Inteligencia artificial en radiología: una revisión sistemática y evaluación de métodos.
Puntos clave
- Esta revisión sistemática abarcó los estudios de aprendizaje profundo en radiología clínica publicados entre 2015 y 2019: 11 083 resultados de búsqueda, 767 textos completos revisados y 535 artículos incluidos.
- El 98 % de los estudios eran retrospectivos, solo 13 eran prospectivos y solo el 5 % mencionaba un análisis de potencia.
- Lo más frecuente fue la resonancia magnética (RM, 37 %), la neurorradiología (24 %), la tarea de segmentación (39 %), el aprendizaje supervisado (88 %) y la arquitectura U-Net (14 %).
- El rendimiento mediano fue un Dice de 0,89, un área bajo la curva (AUC) de 0,903 y una exactitud de 89,4; en 77 estudios con comparación directa, el rendimiento bajó de media un 6 % en la validación externa (desde una mejora del 4 % hasta una reducción del 44 %).
- El 17 % de los estudios no comparaba el rendimiento, el 28 % no ofrecía ninguna explicabilidad y el código o el modelo solo estaba disponible en el 14 %.
Resumen
La revisión sistemática RAISE analizó los estudios que aplican el aprendizaje profundo a la radiología clínica para identificar las preguntas clínicas planteadas y evaluar los métodos empleados. Su hallazgo principal es que muchos trabajos comunican resultados de nivel experto, pero la mayoría aplica una gama estrecha de técnicas a pocos casos de uso, y la literatura está dominada por estudios de cohortes retrospectivos con validación externa limitada y un alto riesgo de sesgo. La revisión siguió la guía PRISMA con un protocolo registrado prospectivamente (PROSPERO: CRD42020154790) y buscó en MEDLINE y EMBASE del 1 de enero de 2015 al 31 de diciembre de 2019.
Casos de uso y modalidades
El número de estudios incluidos aumentó cada año: 14, 31, 84, 170 y 237 de 2015 a 2019. La imagen oncológica fue el caso de uso más frecuente (156 estudios, 29 %), con otros 45 (8 %) dedicados específicamente a los nódulos pulmonares. Las subespecialidades principales fueron la neurorradiología (127, 24 %) y el tórax (92, 17 %), y las modalidades principales, la RM (200, 37 %) y la tomografía computarizada (155, 29 %). Las tareas principales fueron la segmentación (211, 39 %), la clasificación (171, 31 %) y la identificación (74), y ningún estudio aportó datos de resultados clínicos.
Diseño y verdad de referencia
Hubo 525 estudios retrospectivos (98 %), 13 prospectivos y solo 1 con evaluación prospectiva en condiciones reales. La verdad de referencia procedía del informe radiológico en el 66 %, de un panel de expertos u otros informes de especialistas en el 19 % y de la anatomía patológica en el 9 %. El rendimiento se comparó con un modelo de referencia actual en el 37 % y con radiólogos en el 31 %, mientras que el 17 % no tenía comparación.
Datos y métodos
La mediana de pacientes fue de 460 (rango de 3 a 313 318) y la de imágenes, de 1993. Los datos procedían de un solo hospital en el 44 % y de un conjunto de datos público en el 32 %, y se usó validación externa en 169 estudios (31 %). El aprendizaje por transferencia se usó en el 46 %, y U-Net y las arquitecturas propias mostraron un Dice muy similar (0,877 y 0,895).
Rendimiento, explicabilidad y acceso abierto
En 60 de 77 estudios (78 %), la caída en la validación externa fue del 10 % o menos; junto con métricas medias cercanas al 90 % del máximo, esto plantea la posibilidad de un sesgo de publicación. La explicabilidad se ofreció sobre todo mediante casos o ejemplos (49 %), faltó en el 28 %, usó visualizaciones y mapas de prominencia en el 18 % y nunca recurrió a ejemplos contrafactuales. El código o el modelo estaba disponible en el 14 % y los datos, en el 38 %. Los autores piden el registro prospectivo, guías de comunicación como las de CONSORT y la RSNA, validación externa y estudios de mayor nivel con datos de resultados.
Preguntas frecuentes
¿Cómo rinden los modelos de IA radiológica fuera de la institución que los desarrolló?
En los 77 estudios que permitían una comparación directa, el rendimiento disminuyó de media un 6 % en la validación externa, desde una mejora del 4 % hasta una reducción del 44 %.
¿Qué tipo de estudio predominó en la literatura?
Los estudios de cohortes retrospectivos: el 98 % de los estudios incluidos eran retrospectivos y solo 13 eran prospectivos.
¿Qué recomiendan los autores?
Registro prospectivo de los estudios, guías de comunicación, más validación externa y estudios de mayor nivel con datos de resultados que demuestren beneficios reales para los pacientes.
Fuente
Kelly BS, Judge C, Bollard SM, Clifford SM, Healy GM, Aziz A, et al. Radiology artificial intelligence: a systematic review and evaluation of methods (RAISE). European Radiology 2022;32(11):7998-8007. DOI: 10.1007/s00330-022-08784-6. Acceso abierto con licencia Creative Commons Attribution 4.0; posteriormente se publicó una corrección. Esta página es un resumen elaborado por Medpresso a partir de la publicación original y no sustituye al texto completo ni al consejo médico.