Радіологічний штучний інтелект: систематичний огляд та оцінка методів

Ключові положення

Огляд

Систематичний огляд RAISE проаналізував дослідження застосування глибокого навчання в клінічній радіології, щоб визначити, на які клінічні запитання вони відповідають, і оцінити використані методи. Головний висновок: багато робіт повідомляють про результати експертного рівня, але більшість застосовує вузький набір методів до невеликої кількості завдань, а в літературі переважають ретроспективні когортні дослідження з обмеженою зовнішньою валідацією та високим ризиком систематичної похибки. Огляд виконано за PRISMA з проспективно зареєстрованим протоколом (PROSPERO: CRD42020154790); пошук проводили в MEDLINE та EMBASE з 1 січня 2015 по 31 грудня 2019 року.

Клінічні завдання та методи візуалізації

Кількість включених досліджень зростала щороку: 14, 31, 84, 170 і 237 з 2015 по 2019 рік. Найчастіше вивчали онкологічну візуалізацію (156 досліджень, 29%), ще 45 (8%) були присвячені саме легеневим вузлам. Провідними розділами були нейрорадіологія (127, 24%) і торакальна радіологія (92, 17%), провідними методами — МРТ (200, 37%) і КТ (155, 29%). Основними завданнями були сегментація (211, 39%), класифікація (171, 31%) і виявлення (74); жодне дослідження не містило даних про клінічні наслідки.

Дизайн і еталон

525 досліджень (98%) були ретроспективними, 13 — проспективними, і лише в одному проводили проспективну оцінку в реальних умовах. Еталоном слугував висновок радіолога в 66% випадків, думка експертної групи чи висновки інших спеціалістів — у 19%, патоморфологічний висновок — у 9%. Якість порівнювали із сучасною моделлю в 37%, з радіологами — у 31%, а в 17% порівняння не було.

Дані та методи

Медіана кількості пацієнтів становила 460 (від 3 до 313 318), медіана кількості зображень — 1993. Дані отримано з однієї лікарні в 44% випадків і із загальнодоступного набору даних — у 32%, а зовнішню валідацію проведено в 169 дослідженнях (31%). Трансферне навчання використовували в 46%, а U-Net і власні архітектури показали дуже близькі значення Dice (0,877 і 0,895).

Якість, пояснюваність і відкритий доступ

У 60 із 77 досліджень (78%) зниження під час зовнішньої валідації становило 10% і менше; разом із середніми метриками близько 90% від максимуму це вказує на можливу публікаційну упередженість. Пояснюваність найчастіше забезпечували прикладами випадків (49%), у 28% вона була відсутня, у 18% використовували візуалізації та карти значущості, а контрфактичні приклади не застосовували жодного разу. Код або модель були доступні в 14%, дані — у 38%. Автори закликають до проспективної реєстрації, дотримання настанов щодо подання результатів, наприклад CONSORT і RSNA, зовнішньої валідації та досліджень вищого рівня з даними про наслідки.

Часті запитання

Як працюють моделі ШІ в радіології за межами закладу-розробника?

У 77 дослідженнях із можливістю прямого порівняння якість під час зовнішньої валідації знижувалася в середньому на 6% — від покращення на 4% до зниження на 44%.

Які дослідження переважали в літературі?

Ретроспективні когортні: 98% включених досліджень були ретроспективними, і лише 13 — проспективними.

Що рекомендують автори?

Проспективну реєстрацію досліджень, дотримання настанов щодо подання результатів, більше зовнішньої валідації та дослідження вищого рівня з даними про наслідки, щоб довести реальну користь для пацієнтів.

Джерело

Kelly BS, Judge C, Bollard SM, Clifford SM, Healy GM, Aziz A, et al. Radiology artificial intelligence: a systematic review and evaluation of methods (RAISE). European Radiology 2022;32(11):7998-8007. DOI: 10.1007/s00330-022-08784-6. Відкритий доступ за ліцензією Creative Commons Attribution 4.0; згодом опубліковано виправлення. Ця сторінка — стислий виклад, підготовлений Medpresso на основі оригінальної публікації; вона не замінює повний текст і медичну консультацію.