Искусственный интеллект радиологии: систематический обзор и оценка методов

Ключевые положения

Обзор

Систематический обзор RAISE проанализировал исследования применения глубокого обучения в клинической радиологии, чтобы определить, на какие клинические вопросы они отвечают, и оценить использованные методы. Главный вывод: многие работы сообщают о результатах экспертного уровня, но большинство применяет узкий набор методов к небольшому числу задач, а в литературе преобладают ретроспективные когортные исследования с ограниченной внешней валидацией и высоким риском систематической ошибки. Обзор выполнен по PRISMA с проспективно зарегистрированным протоколом (PROSPERO: CRD42020154790); поиск проводился в MEDLINE и EMBASE с 1 января 2015 по 31 декабря 2019 года.

Клинические задачи и методы визуализации

Число включенных исследований росло каждый год: 14, 31, 84, 170 и 237 с 2015 по 2019 год. Чаще всего изучалась онкологическая визуализация (156 исследований, 29%), еще 45 (8%) были посвящены именно легочным узлам. Ведущими разделами были нейрорадиология (127, 24%) и торакальная радиология (92, 17%), ведущими методами — МРТ (200, 37%) и КТ (155, 29%). Основными задачами были сегментация (211, 39%), классификация (171, 31%) и обнаружение (74); ни одно исследование не содержало данных о клинических исходах.

Дизайн и эталон

525 исследований (98%) были ретроспективными, 13 — проспективными, и лишь в одном проводилась проспективная оценка в реальных условиях. Эталоном служило заключение радиолога в 66% случаев, мнение экспертной группы или заключения других специалистов — в 19%, патоморфологическое заключение — в 9%. Качество сравнивали с современной моделью в 37%, с радиологами — в 31%, а в 17% сравнения не было.

Данные и методы

Медиана числа пациентов составила 460 (от 3 до 313 318), медиана числа изображений — 1993. Данные были получены из одной больницы в 44% случаев и из общедоступного набора данных — в 32%, а внешняя валидация проводилась в 169 исследованиях (31%). Трансферное обучение использовалось в 46%, а U-Net и собственные архитектуры показали очень близкие значения Dice (0,877 и 0,895).

Качество, объяснимость и открытый доступ

В 60 из 77 исследований (78%) снижение при внешней валидации составило 10% и менее; вместе со средними метриками около 90% от максимума это указывает на возможную публикационную предвзятость. Объяснимость чаще всего обеспечивалась примерами случаев (49%), в 28% она отсутствовала, в 18% использовались визуализации и карты значимости, а контрфактические примеры не применялись ни разу. Код или модель были доступны в 14%, данные — в 38%. Авторы призывают к проспективной регистрации, соблюдению руководств по представлению результатов, например CONSORT и RSNA, внешней валидации и исследованиям более высокого уровня с данными об исходах.

Часто задаваемые вопросы

Как работают модели ИИ в радиологии за пределами учреждения-разработчика?

В 77 исследованиях с возможностью прямого сравнения качество при внешней валидации снижалось в среднем на 6% — от улучшения на 4% до снижения на 44%.

Какие исследования преобладали в литературе?

Ретроспективные когортные: 98% включенных исследований были ретроспективными, и лишь 13 — проспективными.

Что рекомендуют авторы?

Проспективную регистрацию исследований, следование руководствам по представлению результатов, больше внешней валидации и исследования более высокого уровня с данными об исходах, чтобы доказать реальную пользу для пациентов.

Источник

Kelly BS, Judge C, Bollard SM, Clifford SM, Healy GM, Aziz A, et al. Radiology artificial intelligence: a systematic review and evaluation of methods (RAISE). European Radiology 2022;32(11):7998-8007. DOI: 10.1007/s00330-022-08784-6. Открытый доступ по лицензии Creative Commons Attribution 4.0; позднее опубликовано исправление. Эта страница — краткое изложение, подготовленное Medpresso на основе оригинальной публикации; она не заменяет полный текст и медицинскую консультацию.