Сотни ИИ-исследований в медицине могут использовать данные неизвестного происхождения

22:43, 09 Июл, 2026
Андрей Котов
ИИ в медицине
Иллюстрация: pronedra.ru.

Новое исследование учёных Квинслендского технологического университета (QUT) и Австралийского центра инноваций в здравоохранении (AusHSI), опубликованное в BMC Medicine, ставит под угрозу доверие к целому пласту медицинских ИИ-разработок: сотни работ по прогнозированию инсульта и диабета могут опираться на данные, происхождение которых невозможно проверить.

Что нашли исследователи

Команда под руководством Александра Гибсона (Alexander Gibson) изучила два широко используемых датасета, опубликованных на платформе Kaggle — крупнейшей в мире площадке для обмена данными и обучения ИИ-моделей.

Оказалось, что оба датасета используются в 125 рецензируемых научных статьях, несмотря на то что предоставляют минимум информации о происхождении данных, методах их сбора и о том, отражают ли они реальных пациентов.

При оценке по международному стандарту TRIPOD+AI — специальному чеклисту для медицинских предсказательных моделей — оба датасета набрали 0 баллов из 9 по ключевым критериям прослеживаемости данных.

«Это оказалось огромным сюрпризом. Эти датасеты демонстрируют необычные паттерны, которые ставят серьёзные вопросы об их подлинности и пригодности для клинических исследований», — заявил Гибсон.

Реальные последствия для клинической практики

Проблема вышла далеко за пределы академических журналов:

  • Три прогностические модели, созданные на основе этих данных, используются в клинической практике
  • Одна из моделей процитирована в патенте на медицинское устройство
  • 86 обзорных статей ссылаются на исследования, построенные на этих данных
  • Семь статей уже были отозваны из журналов как ненадёжные

«Модели, построенные на данных неизвестного происхождения, не имеют права на участие в клинических решениях. Без достоверных данных результаты ненадёжны и рискуют ввести врачей в заблуждение и навредить пациентам», — предупредил Гибсон.

Системная проблема и призыв к реформам

Авторы указывают, что проблема отражает более широкую тенденцию: с ростом популярности ИИ в медицине возникает «быстрая» наука, которая внешне выглядит строгой, но лишена базовой прозрачности.

Читайте также по теме: медицинских исследованиях мозга и рисков.

Исследователи призывают журналы, фонды и репозитории данных ужесточить требования к раскрытию информации о происхождении данных, а также рекомендуют удалить оба проблемных датасета с платформы Kaggle, чтобы предотвратить их дальнейшее использование.