Радіологічний штучний інтелект: систематичний огляд та оцінка методів
Ключові положення
- Систематичний огляд охопив дослідження глибокого навчання в клінічній радіології, опубліковані у 2015–2019 роках: 11 083 результати пошуку, 767 переглянутих повних текстів і 535 включених статей.
- 98% досліджень були ретроспективними, лише 13 — проспективними, і лише в 5% згадувався розрахунок статистичної потужності.
- Найчастіше траплялися МРТ (37%), нейрорадіологія (24%), завдання сегментації (39%), навчання з учителем (88%) та архітектура U-Net (14%).
- Медіана показників: коефіцієнт Dice 0,89, площа під кривою (AUC) 0,903 і точність 89,4; у 77 дослідженнях із прямим порівнянням якість під час зовнішньої валідації знижувалася в середньому на 6% (від покращення на 4% до зниження на 44%).
- У 17% досліджень не було порівняння якості, у 28% не було забезпечено пояснюваності, а вихідний код або модель були вільно доступні лише в 14%.
Огляд
Систематичний огляд RAISE проаналізував дослідження застосування глибокого навчання в клінічній радіології, щоб визначити, на які клінічні запитання вони відповідають, і оцінити використані методи. Головний висновок: багато робіт повідомляють про результати експертного рівня, але більшість застосовує вузький набір методів до невеликої кількості завдань, а в літературі переважають ретроспективні когортні дослідження з обмеженою зовнішньою валідацією та високим ризиком систематичної похибки. Огляд виконано за PRISMA з проспективно зареєстрованим протоколом (PROSPERO: CRD42020154790); пошук проводили в MEDLINE та EMBASE з 1 січня 2015 по 31 грудня 2019 року.
Клінічні завдання та методи візуалізації
Кількість включених досліджень зростала щороку: 14, 31, 84, 170 і 237 з 2015 по 2019 рік. Найчастіше вивчали онкологічну візуалізацію (156 досліджень, 29%), ще 45 (8%) були присвячені саме легеневим вузлам. Провідними розділами були нейрорадіологія (127, 24%) і торакальна радіологія (92, 17%), провідними методами — МРТ (200, 37%) і КТ (155, 29%). Основними завданнями були сегментація (211, 39%), класифікація (171, 31%) і виявлення (74); жодне дослідження не містило даних про клінічні наслідки.
Дизайн і еталон
525 досліджень (98%) були ретроспективними, 13 — проспективними, і лише в одному проводили проспективну оцінку в реальних умовах. Еталоном слугував висновок радіолога в 66% випадків, думка експертної групи чи висновки інших спеціалістів — у 19%, патоморфологічний висновок — у 9%. Якість порівнювали із сучасною моделлю в 37%, з радіологами — у 31%, а в 17% порівняння не було.
Дані та методи
Медіана кількості пацієнтів становила 460 (від 3 до 313 318), медіана кількості зображень — 1993. Дані отримано з однієї лікарні в 44% випадків і із загальнодоступного набору даних — у 32%, а зовнішню валідацію проведено в 169 дослідженнях (31%). Трансферне навчання використовували в 46%, а U-Net і власні архітектури показали дуже близькі значення Dice (0,877 і 0,895).
Якість, пояснюваність і відкритий доступ
У 60 із 77 досліджень (78%) зниження під час зовнішньої валідації становило 10% і менше; разом із середніми метриками близько 90% від максимуму це вказує на можливу публікаційну упередженість. Пояснюваність найчастіше забезпечували прикладами випадків (49%), у 28% вона була відсутня, у 18% використовували візуалізації та карти значущості, а контрфактичні приклади не застосовували жодного разу. Код або модель були доступні в 14%, дані — у 38%. Автори закликають до проспективної реєстрації, дотримання настанов щодо подання результатів, наприклад CONSORT і RSNA, зовнішньої валідації та досліджень вищого рівня з даними про наслідки.
Часті запитання
Як працюють моделі ШІ в радіології за межами закладу-розробника?
У 77 дослідженнях із можливістю прямого порівняння якість під час зовнішньої валідації знижувалася в середньому на 6% — від покращення на 4% до зниження на 44%.
Які дослідження переважали в літературі?
Ретроспективні когортні: 98% включених досліджень були ретроспективними, і лише 13 — проспективними.
Що рекомендують автори?
Проспективну реєстрацію досліджень, дотримання настанов щодо подання результатів, більше зовнішньої валідації та дослідження вищого рівня з даними про наслідки, щоб довести реальну користь для пацієнтів.
Джерело
Kelly BS, Judge C, Bollard SM, Clifford SM, Healy GM, Aziz A, et al. Radiology artificial intelligence: a systematic review and evaluation of methods (RAISE). European Radiology 2022;32(11):7998-8007. DOI: 10.1007/s00330-022-08784-6. Відкритий доступ за ліцензією Creative Commons Attribution 4.0; згодом опубліковано виправлення. Ця сторінка — стислий виклад, підготовлений Medpresso на основі оригінальної публікації; вона не замінює повний текст і медичну консультацію.