Simulación de la priorización de la cola de TC guiada por inteligencia artificial en el Servicio de Urgencias

Artículo original: Silva E, Tang K, Chiacchia S, Zhang X, Langlotz CP, Kim D. Simulation of AI-driven CT Queue Prioritization in the Emergency Department. Radiology: Artificial Intelligence. 2026;8(5):e260110.

DOI: https://doi.org/10.1148/ryai.260110

Sociedad: Radiological Society of North America (@RSNA).

Palabras clave: Inteligencia artificial; Tomografía computarizada; Servicio de urgencias; Simulación de eventos discretos; Flujo de trabajo; Priorización de colas.

Abreviaturas y acrónimos utilizados: AUC-PR (Área bajo la curva precisión-exhaustividad / Area Under the Precision-Recall Curve), AUC-ROC (Área bajo la curva ROC / Area Under the ROC Curve), DES (Simulación de eventos discretos / Discrete-Event Simulation), EHR (Historia clínica electrónica / Electronic Health Record), FIFO (Primero en entrar, primero en salir / First-In, First-Out), GBM (Máquina de potenciación de gradiente / Gradient Boosting Machine), IA/AI (Inteligencia Artificial / Artificial Intelligence), IC (Intervalo de confianza / Confidence Interval), IQR (Rango intercuartílico / Interquartile Range), SU/ED (Servicio de Urgencias / Emergency Department), TC/CT (Tomografía Computarizada / Computed Tomography).

Línea editorial del número: Radiology: Artificial Intelligence es una revista bimestral de la Radiological Society of North America (RSNA), lanzada en 2019 como publicación hermana de Radiology, dedicada específicamente a la investigación sobre aplicaciones de la inteligencia artificial y el aprendizaje automático en la práctica radiológica y en las ciencias de la imagen biomédica. Publica investigación original, artículos técnicos, revisiones y editoriales dirigidos a radiólogos, físicos médicos, científicos de datos e ingenieros interesados en el desarrollo, validación y aplicación clínica de algoritmos de IA, abarcando desde la detección y clasificación de hallazgos hasta la optimización de flujos de trabajo, como es el caso del artículo aquí revisado. El número 5 del volumen 8 de septiembre de 2026 cuenta con 7 artículos. Además del presente, destaca un estudio de casos y controles sobre un modelo de Deep learning para detectar cáncer de mama en mamografías.

Motivos para la selección: He elegido este artículo porque aborda un problema muy presente en la práctica diaria de los servicios de radiología de urgencias —la saturación de las colas de TC y el retraso en el diagnóstico de hallazgos potencialmente graves— desde una perspectiva distinta a la habitual. La mayoría de los estudios de IA en radiología se centran en la interpretación de imágenes ya adquiridas (triaje postadquisición de listas de trabajo), mientras que este trabajo plantea intervenir antes, en el momento de decidir qué paciente debe entrar primero en el escáner. Me parece un enfoque muy relevante para los residentes, ya que refleja cómo la IA puede aplicarse a la gestión operativa del servicio y no solo al diagnóstico por imagen, y plantea de forma honesta las ventajas y las contrapartidas (trade-offs) de este tipo de sistemas.

Resumen:

Introducción

Los servicios de urgencias (SU) presentan un volumen creciente de pacientes que satura la capacidad de TC disponible, lo que retrasa el diagnóstico y el tratamiento en cuadros tiempo-dependientes (sepsis, isquemia mesentérica aguda, etc.). En la práctica habitual, las TC se realizan según un sistema FIFO (primero en pedirse, primero en realizarse), con excepciones solo para códigos de trauma e ictus. Los sistemas de IA desarrollados hasta ahora se centran en el triaje postadquisición (repriorizar la lista de lectura de estudios ya realizados), pero no actúan sobre el retraso que se produce antes de realizar la prueba. El objetivo de este estudio es evaluar, mediante una simulación de eventos discretos (DES), el efecto de un sistema de priorización de la cola de TC basado en IA sobre los tiempos de espera en el SU.

Métodos

Estudio retrospectivo, unicéntrico, con datos multimodales de 313 966 visitas consecutivas a un SU académico de nivel I (agosto 2020-agosto 2024), de las cuales se incluyeron 131 027 estudios de TC realizados en adultos con informe finalizado. Los datos se dividieron temporalmente en un conjunto de entrenamiento, uno de validación y un conjunto de prueba interno (20 795 estudios; marzo-agosto 2024).

Se entrenó un modelo de gradient boosting (LightGBM) para predecir, en el momento de la petición, la probabilidad de que una TC mostrara un hallazgo clínicamente «accionable» (definido como aquel que requiere intervención médica inmediata o cambio de manejo durante la visita índice), usando como referencia unas etiquetas generadas y validadas mediante GPT-4 en un trabajo previo del mismo grupo. El modelo emplea variables disponibles en el momento de la petición (constantes vitales, antecedentes, analítica, motivo de consulta, etc.), excluyendo explícitamente raza, etnia y tipo de seguro como predictores.

Se construyó una simulación de eventos discretos del flujo de TC en el SU, comparando dos políticas de despacho: FIFO (política basal, con prioridad para trauma/ictus) y una política basada en IA, en la que, al quedar libre un escáner, el sistema examina las siguientes n peticiones en cola («ventana de anticipación» o lookahead, calibrada en n = 35) y selecciona la de mayor probabilidad de accionabilidad, manteniendo también la prioridad de trauma/ictus. Se calibró el simulador (2,8 escáneres efectivos) frente a la actividad real y se compararon ambas políticas mediante bootstrapping (1000 iteraciones), calculando además un techo teórico de rendimiento con predicciones perfectas.

Resultados

De los 20 795 estudios del conjunto de prueba interno, el 36,73% (7637) presentaron hallazgos accionables. El modelo predictivo obtuvo un AUC-ROC de 0,76 (IC 95%: 0,76-0,77) y un AUC-PR de 0,63.

La simulación FIFO calibrada reprodujo fielmente la actividad real (mediana simulada de 62,5 min frente a 71,0 min empírica; percentil 90 de 193,78 min frente a 193,00 min empírico), validando el simulador como base realista de comparación.

Frente a FIFO, la política basada en IA redujo la mediana de espera de los estudios accionables en 10,75 minutos (IC 95%: -12,40, -9,10) y el percentil 90 en 43,36 minutos (IC 95%: -50,58, -36,80). La proporción de hallazgos accionables obtenidos en menos de 1 hora aumentó del 48,33% al 57,30%. Para los estudios no accionables, la mediana de espera mejoró (-5,80 min), pero el percentil 90 empeoró (+14,46 min; IC 95%: 6,40, 23,20), reflejando el trade-off inherente a cualquier sistema de priorización. La longitud de la cola se mantuvo estable (mediana de 8 estudios) con ambas políticas.

El modelo capturó entre el 80-87% del beneficio máximo teórico alcanzable con predicciones perfectas; de hecho, con predicciones perfectas el retraso en el percentil 90 de los estudios no accionables habría sido casi tres veces mayor (+40,4 min), lo que sugiere que la imperfección del modelo actúa como un «ruido» beneficioso que evita la aparición de una cola estrictamente bicameral. Una política de tres niveles (alto/medio/bajo) recuperó el 96% del beneficio de la puntuación continua. El beneficio por estudio accionable aumentó cuando disminuía la prevalencia de accionabilidad. El rendimiento del modelo fue consistente entre subgrupos demográficos (edad, sexo, raza), sin usar variables raciales/étnicas como predictoras.

Conclusión

La priorización de la cola de TC guiada por IA puede reducir el tiempo hasta el diagnóstico de hallazgos críticos en el SU, con una alteración mínima para los pacientes de menor prioridad, utilizando únicamente los flujos de datos ya existentes y sin necesidad de hardware adicional.

Valoración personal:

Me parece un estudio muy bien diseñado y honesto en la presentación de sus resultados, ya que no esconde los trade-offs del sistema: mejora mucho a los pacientes con hallazgos accionables a costa de un empeoramiento leve (pero real) en la cola de espera de los pacientes no accionables. Es interesante el hallazgo, aparentemente contraintuitivo, de que un modelo «imperfecto» evita crear una cola estrictamente bicameral y protege mejor a los pacientes de baja prioridad que un clasificador perfecto. Como limitaciones, destacaría que se trata de un estudio unicéntrico y retrospectivo, que las etiquetas de accionabilidad derivan de un modelo de lenguaje (GPT-4) sobre informes ya redactados y no de una valoración clínica prospectiva independiente, y que no se evalúan desenlaces clínicos duros (morbimortalidad), sino únicamente métricas operativas de tiempo.

Añadiría, además, varias consideraciones metodológicas. En primer lugar, los datos utilizados en este estudio se superponen con los empleados para validar el propio método de etiquetado de accionabilidad; es un matiz que se sale un poco de lo que los autores analizan explícitamente, pero puede ser una limitación relevante a la hora de valorar la validez externa del sistema en su conjunto. En este sentido, habría que valorar también el impacto específico sobre los «outliers», es decir, aquellos estudios teóricamente no accionables que sufren los mayores retrasos, más allá de lo que reflejan la mediana o incluso el percentil 90 agregado; y, sobre todo, el de los pacientes que el modelo clasifica mal —por ejemplo, aquellos con hallazgos accionables que el sistema etiqueta como no accionables—, que sufrirán retrasos importantes cuyo impacto clínico convendría dimensionar mejor. De hecho, y enlazando con el primer punto, es probable que el porcentaje de estudios erróneamente clasificados esté aquí infraestimado, precisamente por la superposición entre la cohorte usada para entrenar/evaluar el modelo y la usada para validar el sistema de etiquetado de referencia.

Aun así, creo que es un buen ejemplo de hacia dónde puede evolucionar la aplicación de la IA en radiología: no solo ayudando a interpretar la imagen, sino también a gestionar mejor el flujo de trabajo del servicio, algo con lo que como residentes convivimos a diario en las guardias de TC de urgencias.

Firma:

Valentino Pasquale

Hospital Clinico Universitario de Santiago de Compostela, A Coruña. R3.

v.pasqualep@gmail.com

Tagged with: , , , , ,
Publicado en Radiological Society of North America

Deja un comentario

Publicaciones del Club
Residentes SERAM
Autores