Сотни ИИ-исследований в медицине могут использовать данные неизвестного происхождения
Новое исследование учёных Квинслендского технологического университета (QUT) и Австралийского центра инноваций в здравоохранении (AusHSI), опубликованное в BMC Medicine, ставит под угрозу доверие к целому пласту медицинских ИИ-разработок: сотни работ по прогнозированию инсульта и диабета могут опираться на данные, происхождение которых невозможно проверить.
Что нашли исследователи
Команда под руководством Александра Гибсона (Alexander Gibson) изучила два широко используемых датасета, опубликованных на платформе Kaggle — крупнейшей в мире площадке для обмена данными и обучения ИИ-моделей.
Оказалось, что оба датасета используются в 125 рецензируемых научных статьях, несмотря на то что предоставляют минимум информации о происхождении данных, методах их сбора и о том, отражают ли они реальных пациентов.
При оценке по международному стандарту TRIPOD+AI — специальному чеклисту для медицинских предсказательных моделей — оба датасета набрали 0 баллов из 9 по ключевым критериям прослеживаемости данных.
«Это оказалось огромным сюрпризом. Эти датасеты демонстрируют необычные паттерны, которые ставят серьёзные вопросы об их подлинности и пригодности для клинических исследований», — заявил Гибсон.
Реальные последствия для клинической практики
Проблема вышла далеко за пределы академических журналов:
- Три прогностические модели, созданные на основе этих данных, используются в клинической практике
- Одна из моделей процитирована в патенте на медицинское устройство
- 86 обзорных статей ссылаются на исследования, построенные на этих данных
- Семь статей уже были отозваны из журналов как ненадёжные
«Модели, построенные на данных неизвестного происхождения, не имеют права на участие в клинических решениях. Без достоверных данных результаты ненадёжны и рискуют ввести врачей в заблуждение и навредить пациентам», — предупредил Гибсон.
Системная проблема и призыв к реформам
Авторы указывают, что проблема отражает более широкую тенденцию: с ростом популярности ИИ в медицине возникает «быстрая» наука, которая внешне выглядит строгой, но лишена базовой прозрачности.
Читайте также по теме: медицинских исследованиях мозга и рисков.
Исследователи призывают журналы, фонды и репозитории данных ужесточить требования к раскрытию информации о происхождении данных, а также рекомендуют удалить оба проблемных датасета с платформы Kaggle, чтобы предотвратить их дальнейшее использование.