Un modelo de deep learning para RM de mama predice BI-RADS con mucha menor precisión que el radiólogo
Un estudio multicéntrico retrospectivo publicado en el European Journal of Radiology evaluó un modelo de aprendizaje profundo para la predicción automatizada de categorías BI-RADS en resonancia magnética mamaria con contraste dinámico (DCE-RM).
En la validación externa, el modelo fue significativamente menos preciso que el radiólogo en todos los indicadores. Los autores son claros: el modelo no está preparado para reemplazar ni igualar de forma independiente la evaluación radiológica.
La DCE-RM mamaria está indicada en mujeres de alto riesgo —portadoras de mutaciones BRCA, con antecedentes familiares significativos o antecedentes personales de cáncer de mama—, en la estadificación preoperatoria y en casos donde la mamografía y la ecografía resultan inconcluyentes.
Su mayor sensibilidad respecto a la mamografía en tejido denso tiene como contraparte una mayor tasa de falsos positivos. Por eso, la clasificación BI-RADS en RM tiene consecuencias directas: una categoría 4 o superior implica indicación de biopsia.
¿Qué es BI-RADS y por qué importa automatizarlo?
El sistema BI-RADS (Breast Imaging Reporting and Data System), desarrollado por el American College of Radiology, estandariza el informe de imagen mamaria en siete categorías.
- Desde la 0 —estudio incompleto, requiere evaluación adicional— hasta la 6, que corresponde a malignidad conocida.
- Las categorías 1 y 2 son hallazgos benignos sin seguimiento adicional.
- La 3 indica hallazgo probablemente benigno con control a corto plazo.
- Las categorías 4 y 5 son sospechosas o altamente sospechosas y conllevan indicación de biopsia.
La automatización de BI-RADS mediante IA podría reducir la carga de trabajo en servicios con alto volumen de estudios. También podría homogeneizar la interpretación entre lectores con distinto nivel de experiencia.
El problema es que ese potencial solo se materializa si el modelo reproduce —o supera— el rendimiento del radiólogo fuera del entorno en el que fue entrenado.
Lo que midió el estudio
El modelo fue entrenado con 12.241 exámenes de RM mamaria. La cohorte de validación externa incluyó 158 mujeres con una mediana de edad de 50 años, de las cuales 21 tenían hallazgos malignos.
Ese número de casos malignos es uno de los límites explícitos del estudio y restringe la robustez estadística de los resultados.
En la validación externa, los resultados favorecen al radiólogo en todos los indicadores:
- Capacidad discriminativa (AUC): radiólogo 91,3 % vs. modelo 76,7 %
- Sensibilidad: 95,2 % vs. 90,5 %
- Especificidad: 77,4 % vs. 54,7 %
La brecha más preocupante no está en la sensibilidad —donde ambos son comparables— sino en la especificidad.
Un modelo que clasifica incorrectamente casi la mitad de los estudios benignos generaría un volumen sustancialmente mayor de falsos positivos en la práctica clínica, con el consiguiente aumento de biopsias innecesarias.
“Un modelo de aprendizaje profundo entrenado para predecir la categoría BI-RADS a partir de RM de mama mostró menor discriminación que la evaluación radiológica rutinaria en la validación externa”, señalaron el autor principal Peter Brader, MD, del Diagnostikum Linz (Austria), y sus colegas.
Ejemplos representativos de visualización de candidatos a lesión generada por IA. Tras la predicción BI-RADS a nivel de estudio, un postprocesamiento basado en atribución generó regiones de interés candidatas superpuestas sobre el estudio de RM mamaria original. Se mostraron hasta ocho candidatos a lesión por estudio.
A, B: paciente posmenopáusica con realce en anillo agrupado regional sospechoso en la mama izquierda, clasificado como de alto riesgo (BI-RADS >4) por el modelo de IA. La biopsia guiada por imagen reveló un CDIS G3 con microinvasión.
C, D: paciente posmenopáusica con realce no másico heterogéneo segmentario, clasificado como de bajo riesgo (BI-RADS <3). El muestreo histopatológico reveló una lesión benigna B2.
El hallazgo más prometedor: triaje de estudios de bajo riesgo
A pesar del rendimiento global inferior, el estudio identifica un escenario con resultados más favorables. Cuando se aplica el umbral de BI-RADS 3, el modelo clasifica correctamente como de bajo riesgo a casi la mitad de los exámenes benignos, con un valor predictivo negativo muy alto.
Este dato abre una hipótesis de trabajo. El modelo podría ser útil no para clasificar de forma autónoma, sino para priorizar listas de trabajo identificando estudios con alta probabilidad de benignidad. Una función de apoyo, no de sustitución.
“Este hallazgo identifica un posible punto de operación para investigación futura, pero no demuestra directamente un beneficio en el flujo de trabajo. Se requieren estudios de implementación prospectiva para determinar si la priorización basada en IA puede mejorar la eficiencia sin comprometer la seguridad diagnóstica”, precisaron Brader y colegas.
¿Por qué la evidencia sigue siendo preliminar?
Los propios autores enumeran tres condicionantes. El primero es el tamaño reducido de la cohorte externa —158 exámenes, 21 malignos— insuficiente para estimar el rendimiento en poblaciones más amplias.
El segundo es el origen del entrenamiento: el modelo aprendió a replicar categorías BI-RADS asignadas por radiólogos, no resultados anátomo-patológicos confirmados. Puede haber incorporado la variabilidad interpretativa del proceso.
El tercero es la ausencia de estudios prospectivos que evalúen el impacto real en el flujo de trabajo de un servicio de imagen.
La validación interna había mostrado resultados más alentadores, pero la diferencia con la validación externa es, en sí misma, un dato. Los modelos de aprendizaje profundo en imagen médica tienden a rendir peor cuando se aplican fuera del entorno de entrenamiento.
El contraste con otras aplicaciones de IA en imagen mamaria es ilustrativo.
En mamografía de cribado —una modalidad distinta, con imágenes más estandarizadas que la DCE-RM—, el modelo AI WaveMar del Hospital del Mar de Barcelona fue entrenado con cerca de 50.000 imágenes del propio programa de cribado y obtuvo reconocimiento como mejor artículo en una revista nacional de radiología (PMID: 42401442).
La diferencia de modalidad importa: la mamografía ofrece un input más homogéneo que la RM dinámica, donde la variabilidad en protocolos de adquisición, equipos y preparación de la paciente añade complejidad que los modelos todavía gestionan de forma desigual.
Fuente: Brader P et al. “Deep learning-based prediction of BI-RADS assessments in breast MRI.” European Journal of Radiology. 2026.
0 comentarios