Искусственный интеллект радиологии: систематический обзор и оценка методов
Ключевые положения
- Систематический обзор охватил исследования глубокого обучения в клинической радиологии, опубликованные в 2015–2019 годах: 11 083 результата поиска, 767 просмотренных полных текстов и 535 включенных статей.
- 98% исследований были ретроспективными, лишь 13 — проспективными, и только в 5% упоминался расчет статистической мощности.
- Чаще всего встречались МРТ (37%), нейрорадиология (24%), задача сегментации (39%), обучение с учителем (88%) и архитектура U-Net (14%).
- Медиана показателей: коэффициент Dice 0,89, площадь под кривой (AUC) 0,903 и точность 89,4; в 77 исследованиях с прямым сравнением качество при внешней валидации снижалось в среднем на 6% (от улучшения на 4% до снижения на 44%).
- В 17% исследований не было сравнения качества, в 28% не была обеспечена объяснимость, а исходный код или модель были свободно доступны лишь в 14%.
Обзор
Систематический обзор RAISE проанализировал исследования применения глубокого обучения в клинической радиологии, чтобы определить, на какие клинические вопросы они отвечают, и оценить использованные методы. Главный вывод: многие работы сообщают о результатах экспертного уровня, но большинство применяет узкий набор методов к небольшому числу задач, а в литературе преобладают ретроспективные когортные исследования с ограниченной внешней валидацией и высоким риском систематической ошибки. Обзор выполнен по PRISMA с проспективно зарегистрированным протоколом (PROSPERO: CRD42020154790); поиск проводился в MEDLINE и EMBASE с 1 января 2015 по 31 декабря 2019 года.
Клинические задачи и методы визуализации
Число включенных исследований росло каждый год: 14, 31, 84, 170 и 237 с 2015 по 2019 год. Чаще всего изучалась онкологическая визуализация (156 исследований, 29%), еще 45 (8%) были посвящены именно легочным узлам. Ведущими разделами были нейрорадиология (127, 24%) и торакальная радиология (92, 17%), ведущими методами — МРТ (200, 37%) и КТ (155, 29%). Основными задачами были сегментация (211, 39%), классификация (171, 31%) и обнаружение (74); ни одно исследование не содержало данных о клинических исходах.
Дизайн и эталон
525 исследований (98%) были ретроспективными, 13 — проспективными, и лишь в одном проводилась проспективная оценка в реальных условиях. Эталоном служило заключение радиолога в 66% случаев, мнение экспертной группы или заключения других специалистов — в 19%, патоморфологическое заключение — в 9%. Качество сравнивали с современной моделью в 37%, с радиологами — в 31%, а в 17% сравнения не было.
Данные и методы
Медиана числа пациентов составила 460 (от 3 до 313 318), медиана числа изображений — 1993. Данные были получены из одной больницы в 44% случаев и из общедоступного набора данных — в 32%, а внешняя валидация проводилась в 169 исследованиях (31%). Трансферное обучение использовалось в 46%, а U-Net и собственные архитектуры показали очень близкие значения Dice (0,877 и 0,895).
Качество, объяснимость и открытый доступ
В 60 из 77 исследований (78%) снижение при внешней валидации составило 10% и менее; вместе со средними метриками около 90% от максимума это указывает на возможную публикационную предвзятость. Объяснимость чаще всего обеспечивалась примерами случаев (49%), в 28% она отсутствовала, в 18% использовались визуализации и карты значимости, а контрфактические примеры не применялись ни разу. Код или модель были доступны в 14%, данные — в 38%. Авторы призывают к проспективной регистрации, соблюдению руководств по представлению результатов, например CONSORT и RSNA, внешней валидации и исследованиям более высокого уровня с данными об исходах.
Часто задаваемые вопросы
Как работают модели ИИ в радиологии за пределами учреждения-разработчика?
В 77 исследованиях с возможностью прямого сравнения качество при внешней валидации снижалось в среднем на 6% — от улучшения на 4% до снижения на 44%.
Какие исследования преобладали в литературе?
Ретроспективные когортные: 98% включенных исследований были ретроспективными, и лишь 13 — проспективными.
Что рекомендуют авторы?
Проспективную регистрацию исследований, следование руководствам по представлению результатов, больше внешней валидации и исследования более высокого уровня с данными об исходах, чтобы доказать реальную пользу для пациентов.
Источник
Kelly BS, Judge C, Bollard SM, Clifford SM, Healy GM, Aziz A, et al. Radiology artificial intelligence: a systematic review and evaluation of methods (RAISE). European Radiology 2022;32(11):7998-8007. DOI: 10.1007/s00330-022-08784-6. Открытый доступ по лицензии Creative Commons Attribution 4.0; позднее опубликовано исправление. Эта страница — краткое изложение, подготовленное Medpresso на основе оригинальной публикации; она не заменяет полный текст и медицинскую консультацию.