Большинство ИИ-медустройств в США не доказали влияние на исходы лечения
Технологии искусственного интеллекта уже активно применяются в американской медицине, однако для подавляющего большинства таких решений по-прежнему не подтверждена реальная польза для пациентов. Систематический анализ показал: лишь единичные ИИ-медустройства изучались с учетом смертности, осложнений, повторных госпитализаций и других клинически значимых результатов.
Авторы работы проанализировали 1357 медицинских устройств с функциями искусственного интеллекта или машинного обучения, допущенных Управлением по санитарному надзору за качеством пищевых продуктов и медикаментов США до 5 декабря 2025 года. Дополнительно они изучили сведения о соответствующих исследованиях в международном реестре клинических испытаний и научных публикациях.
Результаты выявили существенный разрыв между разрешением на использование и полноценной клинической проверкой. Только 34 устройства, то есть 2,5% от общего числа, были связаны с зарегистрированными проспективными исследованиями. Данные о результатах имелись лишь для 12 устройств, или 0,9%. Еще по 12 системам были опубликованы рецензируемые научные статьи. Однако исследования, в которых оценивались непосредственно исходы лечения пациентов, провели всего для трех устройств - это около 0,2% выборки.
Большая часть технологий - 78% - предназначалась для радиологии. Такие решения используются для анализа изображений, выявления патологий и помощи врачу при интерпретации результатов обследований. Около 9% устройств были связаны с кардиологией и кардиохирургией, еще 5% применялись в неврологии. Остальные продукты относились к другим медицинским направлениям.
Качество имеющихся исследований также оказалось неоднородным. В 62% работ использовался наблюдательный дизайн, а сами исследования часто включали небольшие и достаточно однородные группы пациентов. При этом представители уязвимых категорий нередко исключались из анализа. В результате остается неясным, насколько надежно ИИ работает у пожилых людей, пациентов с несколькими хроническими заболеваниями, представителей разных этнических групп и людей, проходящих лечение в учреждениях с ограниченными ресурсами.
Почему разрешение FDA не гарантирует клиническую эффективность
Одной из причин сложившейся ситуации исследователи считают особенности американской процедуры допуска медицинских устройств. Во многих случаях производителю достаточно доказать "существенную эквивалентность" уже зарегистрированному продукту. Это означает, что новый инструмент может быть признан сопоставимым с существующим устройством по назначению и принципу работы, даже если его способность улучшать долгосрочные результаты лечения отдельно не подтверждалась.
Такой подход позволяет быстрее выводить инновационные решения на рынок, но одновременно снижает объем независимых доказательств. Регуляторное разрешение показывает, что устройство соответствует определенным требованиям безопасности и может применяться по заявленному назначению. Однако оно не обязательно означает, что использование системы уменьшает смертность, предотвращает осложнения или сокращает число повторных госпитализаций.
Разница особенно заметна в случае программ, которые не принимают решения самостоятельно, а лишь помогают врачу. Подобные продукты часто классифицируются как инструменты поддержки клинической работы. При этом влияние подсказок на итоговое решение специалиста, скорость оказания помощи и состояние пациента может оставаться недостаточно изученным.
Ошибки ИИ могут проявляться после внедрения
Авторы анализа напомнили о случаях, когда системы, успешно прошедшие формальную процедуру допуска или получившие широкое распространение, показывали слабые результаты в реальной практике. Например, модель Epic Sepsis, внедренная более чем в половине больниц США, не распознала 67% пациентов с сепсисом. Это особенно серьезная проблема, поскольку промедление при таком состоянии напрямую связано с риском тяжелых осложнений и смерти.
Другой пример - IBM Watson for Oncology. Система получила международное признание после одобрения FDA, но ее рекомендации совпадали с решениями врачей лишь примерно в 33% случаев. Сам по себе этот показатель не означает, что технология полностью бесполезна, однако он показывает: авторитет бренда и факт регуляторного допуска не могут заменить независимую проверку точности и клинической ценности.
Отдельный риск связан с тем, что алгоритм может хорошо работать в условиях, где его разрабатывали, но хуже - в другой больнице. На результат влияют качество медицинских изображений, используемое оборудование, особенности ведения документации, распространенность заболеваний и опыт персонала. Поэтому перенос модели из одной системы здравоохранения в другую без локальной валидации может привести к ошибкам.
Что необходимо изменить в оценке ИИ-медустройств
Исследователи считают, что оценивать такие технологии следует не только по техническим параметрам - например, чувствительности, специфичности или точности классификации. Важнее понять, меняет ли применение алгоритма тактику лечения и улучшает ли состояние пациента.
Для этого нужны проспективные исследования, в которых систему оценивают до начала широкого внедрения и сравнивают ее использование с обычной медицинской практикой. Желательно учитывать не только диагностические показатели, но и смертность, осложнения, длительность пребывания в стационаре, повторные обращения и качество жизни.
Не менее важен постоянный мониторинг уже после выхода продукта на рынок. Алгоритмы могут менять поведение по мере обновления программного обеспечения, изменения структуры данных или появления новых групп пациентов. Регулятору и медицинским организациям необходимо отслеживать, сохраняется ли эффективность системы в повседневной работе.
Проверка должна включать анализ возможного неравенства. Если модель обучалась преимущественно на данных одной возрастной, этнической или социальной группы, она способна хуже распознавать заболевания у других пациентов. Поэтому в испытания следует включать разнообразные популяции и отдельно оценивать результаты для уязвимых категорий.
Медицинским учреждениям также важно заранее определить, кто отвечает за окончательное решение, принятое с использованием ИИ. Алгоритм должен рассматриваться как вспомогательный инструмент, а не как безусловный источник истины. Врачам необходимы понятные сведения об ограничениях системы, вероятности ошибки и обстоятельствах, при которых ее рекомендации нельзя использовать без дополнительной проверки.
Проблема имеет международное значение. Разрешение FDA часто воспринимается как сильный аргумент для коммерциализации продукта за пределами США. В странах с низким и средним уровнем дохода такие технологии могут внедряться без дополнительных испытаний, хотя местная структура заболеваемости, оснащение клиник и доступность специалистов существенно отличаются от американских условий.
В итоге готовность ИИ-системы к применению в медицине нельзя определять только наличием разрешительного документа. Для безопасного внедрения необходимы прозрачные данные о качестве разработки, независимая клиническая проверка, оценка рисков для разных групп пациентов и регулярный контроль эффективности в реальной практике. Только такой подход позволит отличить действительно полезные технологии от решений, чья эффективность пока существует главным образом на уровне рекламных обещаний и лабораторных показателей.


