← Volver al blog

IA española que predice sepsis reduce ingresos en UCI

Una IA desarrollada en España anticipa la sepsis, disminuye un 4 % los ingresos en unidades de cuidados intensivos, acorta la estancia hospitalaria y genera un ahorro cercano a los 2 000 € por episodio. Analizamos el estudio y su enfoque estadístico.

IA española que predice sepsis reduce ingresos en UCI

🥊 En una esquina, la IA española que predice la sepsis antes de que el cuadro dé la cara. En la otra, el protocolo clásico de vigilancia, el que los hospitales llevan años aplicando sin ayuda de algoritmos. Según publica Servimedia, esta herramienta de inteligencia artificial reduce un 4 % los ingresos en UCI, acorta la estancia en el hospital y ahorra casi 2.000 euros por episodio. ¿Gana por KO o a los puntos? Hoy subimos a los dos al ring. Los mediremos en una tabla comparativa cara a cara y el árbitro será una prueba clásica de la estadística inferencial: el chi-cuadrado de independencia. 📊

El caso de hoy: la IA española que predice la sepsis

La sepsis ocurre cuando el organismo responde de forma desregulada a una infección y acaba dañando sus propios órganos. Es una carrera contra el reloj: cada hora de retraso en el tratamiento empeora el pronóstico. La Organización Mundial de la Salud la sitúa entre las principales causas de muerte en el mundo. Lo más traicionero es que al principio se disfraza: da fiebre, taquicardia o confusión, síntomas que también aparecen en cuadros mucho más banales.

Ahí entra la IA que predice la sepsis. No espera a que el paciente cumpla los criterios clínicos clásicos. Vigila sin descanso la información que ya está en la historia clínica electrónica, como constantes vitales, analíticas y tratamientos previos. Cuando el patrón se parece al de pacientes que acabaron desarrollando el cuadro, lanza una alerta. Según el resumen de la noticia con el que trabajamos, el sistema usa un modelo de gradient boosting alimentado con decenas de variables clínicas (lactato, presión arterial, temperatura, leucocitos…). También según ese resumen, alcanza un área bajo la curva ROC (AUC) de 0,89, frente al 0,78 de los métodos convencionales. Son cifras que conviene contrastar con la publicación científica original.

El titular, en todo caso, se resume en tres golpes 🎯:

  • −4 % de ingresos en UCI entre los pacientes vigilados con la herramienta.
  • Estancias hospitalarias más cortas: el resumen de partida habla de 1,8 días menos por paciente.
  • Casi 2.000 € de ahorro por episodio, porque menos días de cama y menos UCI significan, sobre todo, menos coste.

Pero un titular no es una conclusión estadística. ¿Esa diferencia es real o podría deberse al azar? ¿Afecta por igual a todos los destinos posibles del paciente? ¿Y con quién se está comparando? Para responder, necesitamos un rival.

IA que predice la sepsis: entorno hospitalario en el que se aplican las alertas tempranas
🏥 Imagen de contexto: el hospital es el escenario del duelo entre la IA que anticipa la sepsis y el protocolo clásico. Foto: Unsplash.

El contrincante: un caso análogo

Nuestro rival, la esquina B, es el mismo tipo de hospital un año antes, cuando la sepsis se vigilaba solo con el protocolo clásico. El equipo sospecha una infección y aplica escalas sencillas como qSOFA. Si el paciente cumple los criterios de la definición Sepsis-3 (publicada en JAMA en 2016), se activa el «código sepsis». Es un rival serio: sus reglas son transparentes, todo el personal las conoce y no necesita servidores ni algoritmos. Su punto débil es el reloj, porque suele avisar cuando el deterioro ya ha empezado.

¿Por qué elegir como contrincante el «antes» y no un hospital cualquiera de otro país? Porque comparar el mismo entorno en dos periodos reduce las diferencias de plantilla, de población atendida y de circuitos asistenciales. Según el resumen de la noticia, el estudio usó este diseño antes-después (pre-post), con grupos emparejados por edad, sexo y comorbilidades. No es un diseño perfecto, como veremos en las diferencias estadísticas, pero sí un combate razonablemente equilibrado.

🔎 Duelos que ya se jugaron fuera de España

No es la primera vez que un algoritmo se enfrenta a la sepsis, y la historia deja un aviso para navegantes:

  • TREWS (Johns Hopkins, EE. UU.): un estudio prospectivo en varios hospitales, publicado en Nature Medicine en 2022, asoció este sistema de alerta temprana a una menor mortalidad cuando el equipo clínico confirmaba la alerta con rapidez.
  • Epic Sepsis Model (EE. UU.): su validación externa, publicada en JAMA Internal Medicine en 2021, obtuvo un AUC de solo 0,63 y muchas alertas que no llevaban a ninguna parte.

Moraleja: una herramienta contra la sepsis no gana solo por ser IA. Gana si los datos lo confirman cuando se la pone frente a su rival. Vamos a por ellos.

Tabla comparativa cara a cara (Figura 1)

La tabla enfrenta a las dos esquinas asalto a asalto. La columna de la IA va tintada de azul, y las celdas verdes con ✅ marcan quién gana cada asalto. Los recuentos son datos ilustrativos para uso docente: no son los microdatos del estudio. Se trata de una muestra simulada de 5.000 episodios con sospecha de sepsis, calibrada para reproducir las cifras de la noticia: −4 % relativo en UCI, 1,8 días menos de estancia y cerca de 2.000 € de ahorro por episodio.

Asalto (indicador) 🏆 A · Con IA predictiva B · Protocolo clásico
Episodios con sospecha de sepsis 2.400 2.600
Alta en ≤ 7 días sin pasar por UCI ✅ 1.152 (48,0 %) 1.040 (40,0 %)
Estancia > 7 días en planta (sin UCI) ✅ 672 (28,0 %) 910 (35,0 %)
Ingreso en UCI ✅ 576 (24,0 %) 650 (25,0 %)
Estancia media hospitalaria ✅ 9,6 días 11,4 días
Coste medio por episodio ✅ 12.850 € 14.800 €
Momento del aviso ✅ Anticipado: antes de cumplir criterios clínicos Cuando se cumplen los criterios (Sepsis-3 / qSOFA)
Transparencia de la regla Modelo complejo: hay que explicar cada alerta ✅ Criterios sencillos que conoce todo el equipo
Puesta en marcha Integración con la historia clínica, validación y formación ✅ Ya implantado, coste añadido casi nulo
Marcador provisional 🏆 6 asaltos 2 asaltos

Tabla 1. Cara a cara entre la IA que predice la sepsis (A) y el protocolo clásico (B). Datos ilustrativos para uso docente, calibrados con las cifras publicadas por Servimedia.

Ojo a un detalle: los grupos no tienen el mismo tamaño (2.400 frente a 2.600 episodios). Comparar recuentos brutos sería tramposo, así que hay que mirar los porcentajes dentro de cada grupo. Es justo lo que dibuja la Figura 1. 📈

IA que predice la sepsis: destino de los episodios con IA (A) frente a protocolo clásico (B) Destino de los episodios de sepsis: A con IA vs B sin IA A · Con IA (n = 2.400) B · Protocolo clásico (n = 2.600) 50 % 40 % 30 % 20 % 10 % 0 % % de episodios de cada grupo 48,0 % 40,0 % 28,0 % 35,0 % 24,0 % 25,0 % Alta en ≤ 7 días Planta > 7 días Ingreso en UCI 1.152 vs 1.040 episodios 672 vs 910 episodios 576 vs 650 episodios Destino del episodio · datos ilustrativos para uso docente
📊 Figura 1. IA que predice la sepsis frente al protocolo clásico: porcentaje de episodios según su destino (mismos datos de la Tabla 1). Datos ilustrativos para uso docente.

La lectura es inmediata. Con la IA, la barra azul de «alta en ≤ 7 días» sube 8 puntos (del 40 % al 48 %) y la de «planta > 7 días» baja 7 (del 35 % al 28 %). En la UCI, en cambio, las dos barras casi se tocan: 24 % frente a 25 %. Ese único punto de diferencia es el famoso «−4 %» del titular. ¿Basta para cantar victoria?

Diferencias estadísticas relevantes

1. ¿De qué 4 % hablamos? Absoluto frente a relativo

Pasar del 25 % al 24 % de ingresos en UCI es una reducción absoluta de 1 punto porcentual, pero una reducción relativa del 4 % (1 / 25 = 0,04). Las dos lecturas son correctas, pero no cuentan la misma historia. Una traducción muy clínica es el número necesario a tratar (NNT = 1 / reducción absoluta). Con 1 punto de diferencia, hay que vigilar con la IA a 100 pacientes para evitar un ingreso en UCI. Si el titular se refiriera a 4 puntos (del 25 % al 21 %), el NNT bajaría a 25 y la reducción relativa sería del 16 %. En nuestros datos ilustrativos hemos optado por la lectura relativa, la más prudente. Lección para cualquier noticia: pregunta siempre «¿un 4 % de qué?». 🧠

2. Diferencia de puntos, destino a destino

  • Alta en ≤ 7 días: 48 % frente a 40 %, es decir, +8 puntos a favor de A.
  • Planta > 7 días: 28 % frente a 35 %, es decir, −7 puntos.
  • UCI: 24 % frente a 25 %, es decir, −1 punto.

Las tres diferencias suman cero (+8 − 7 − 1 = 0), porque los porcentajes de cada grupo suman siempre 100 %: si un destino gana peso, otro lo pierde. Por eso, como veremos, una tabla de 2 × 3 solo tiene 2 grados de libertad. El reparto encaja con el mecanismo que se atribuye a una IA que anticipa la sepsis: si el antibiótico y los fluidos llegan antes, más pacientes se recuperan en planta y en menos días. Queda la pregunta clave: ¿son estas diferencias mayores de lo que produciría el azar? Eso lo decidirá el modelo de la Figura 2.

3. El tamaño muestral: los efectos pequeños exigen muestras gigantes

Para detectar una caída del 25 % al 24 % con una potencia del 80 % y α = 0,05, la fórmula clásica para comparar dos proporciones da:

n = (1,96 + 0,84)² · (0,25·0,75 + 0,24·0,76) / 0,01² ≈ 29.000 episodios por grupo

Son casi 60.000 episodios en total, frente a los 5.000 de nuestra muestra. Por eso los efectos pequeños solo se pueden afirmar con estudios multicéntricos muy grandes. Y por eso, al leer el estudio original, conviene revisar con lupa su tamaño muestral y sus intervalos de confianza.

4. Las trampas del antes-después ⚠️

  • Estacionalidad: un invierno con más gripe en el periodo B inflaría sus ingresos en UCI sin que el algoritmo tuviera nada que ver.
  • Cambios simultáneos: si a la vez se reforzó la formación en sepsis o se revisó el protocolo antibiótico, parte del mérito no sería de la IA.
  • Mezcla de casos: si en el periodo A llegaron pacientes menos graves, el reparto mejoraría por sí solo. De ahí la importancia del emparejamiento por edad, sexo y comorbilidades.
  • Paradoja de Simpson: al juntar hospitales muy distintos, una asociación puede incluso cambiar de signo. La solución es estratificar por centro, por ejemplo con la prueba de Cochran-Mantel-Haenszel.

El modelo que separa A de B (Figura 2)

El árbitro de este duelo es el chi-cuadrado de independencia de Pearson, que responde a una pregunta muy concreta: ¿el destino del paciente es independiente del sistema de vigilancia, o saber qué sistema se usó cambia la probabilidad de cada destino? Así se aplica, paso a paso, a nuestra tabla de 2 filas (A y B) por 3 columnas (destinos) 🧮:

  1. Hipótesis. H₀: el destino (alta ≤ 7 días, planta > 7 días, UCI) es independiente del sistema de vigilancia. H₁: ambas variables están asociadas.
  2. Frecuencias esperadas. Si H₀ fuera cierta, los dos grupos repartirían a sus pacientes en la misma proporción que el total, que es de 2.192, 1.582 y 1.226 episodios por destino. Se calculan como E = (total de la fila × total de la columna) / N. Por ejemplo, para la casilla A-UCI: E = 2.400 × 1.226 / 5.000 = 588,48 episodios.
  3. Estadístico. χ² = Σ (O − E)² / E, sumando las seis casillas: χ² = 38,06.
  4. Grados de libertad. gl = (filas − 1) × (columnas − 1) = (2 − 1) × (3 − 1) = 2.
  5. Decisión. El valor crítico para α = 0,05 con 2 gl es 5,99. Como 38,06 supera con creces ese umbral, rechazamos H₀ (p ≈ 5,4 · 10⁻⁹, es decir, p < 0,001).
  6. Diagnóstico. Los residuos ajustados señalan qué casillas se alejan de lo esperado: por encima de ±1,96 son significativos al 5 %.

La tabla de trabajo: observado frente a esperado

Casilla (grupo · destino) Observado (O) Esperado (E) (O − E)² / E Residuo ajustado
A · Alta ≤ 7 días 1.152 1.052,16 9,474 +5,70
A · Planta > 7 días 672 759,36 10,050 −5,32
A · UCI 576 588,48 0,265 −0,82
B · Alta ≤ 7 días 1.040 1.139,84 8,745 −5,70
B · Planta > 7 días 910 822,64 9,277 +5,32
B · UCI 650 637,52 0,244 +0,82
Total 5.000 5.000 χ² = 38,06 gl = 2

Tabla 2. Frecuencias observadas (O), esperadas bajo H₀ (E), contribución de cada casilla al χ² y residuos ajustados. Datos ilustrativos para uso docente.

Chi-cuadrado de independencia: observado frente a esperado en la IA que predice la sepsis La metodología en acción: observado vs esperado (χ²) Observado (A / B) Esperado bajo H₀ χ² = 38,06 · gl = 2 p < 0,001 · V = 0,09 1.200 900 600 300 0 Nº de episodios 1.152 1.052 672 759 576 588 1.040 1.140 910 823 650 638 Alta ≤ 7 d Planta > 7 d UCI Alta ≤ 7 d Planta > 7 d UCI r = +5,7 r = −5,3 r = −0,8 r = −5,7 r = +5,3 r = +0,8 A · Con IA (n = 2.400) B · Protocolo clásico (n = 2.600) r = residuo ajustado · |r| > 1,96 ⇒ la casilla se aleja de lo esperado (α = 0,05) · Datos ilustrativos
📈 Figura 2. La metodología en acción: chi-cuadrado de independencia sobre los datos de la Figura 1. Las barras de color son los episodios observados en cada grupo; las grises discontinuas, los que cabría esperar si el destino no dependiera del sistema de vigilancia. χ² = 38,06; gl = 2; p < 0,001. Datos ilustrativos para uso docente.

La Figura 2 lo deja a la vista. En la esquina A, la barra azul de altas precoces supera a su «fantasma» esperado (1.152 frente a 1.052) y la de estancias largas se queda por debajo (672 frente a 759). En la esquina B ocurre justo lo contrario. Los residuos ajustados (+5,7 y −5,3) confirman que ahí se concentra casi todo el χ²: esas cuatro casillas aportan más de 37 de sus 38 puntos. En la UCI, en cambio, lo observado y lo esperado casi coinciden (576 frente a 588), y el residuo de −0,8 no llega al umbral de 1,96.

🎥 El VAR del asalto de la UCI

¿Y si el árbitro revisa solo la jugada de la UCI? Reducimos la tabla a «UCI sí / UCI no» (2 × 2) y obtenemos χ² ≈ 0,67 con 1 gl y p ≈ 0,41. Con 5.000 episodios, el punto de diferencia en la UCI no se distingue del azar, tal como anticipaba el cálculo del tamaño muestral. Ojo: eso no demuestra que la IA no reduzca los ingresos en UCI, solo que nuestra muestra es demasiado pequeña para verlo. La ausencia de evidencia no es evidencia de ausencia.

📏 Cuánto separa: la V de Cramér

Con miles de datos, casi cualquier diferencia termina siendo «significativa». Por eso, junto al p-valor, hay que informar del tamaño del efecto. En tablas de contingencia se usa la V de Cramér: V = √(χ² / (N · (k − 1))), donde k es el menor entre el número de filas y el de columnas. Aquí, V = √(38,06 / 5.000) ≈ 0,09, una asociación real pero pequeña. Pequeña no quiere decir irrelevante: repartida entre miles de pacientes al año, se traduce en muchas camas libres y muchos euros.

✅ Requisitos antes de fiarse del resultado

  • Frecuencias esperadas ≥ 5 en todas las casillas: se cumple de sobra, porque la menor es 588,48.
  • Categorías excluyentes: cada episodio cae en un único destino.
  • Observaciones independientes: si un mismo paciente aporta varios episodios, habría que contarlo una sola vez o usar modelos para datos dependientes.
  • Asociación no es causalidad: que A y B difieran no prueba por sí solo que la diferencia la cause el algoritmo.

💻 Reprodúcelo en R y en Python

En R basta con la función chisq.test():

tabla <- matrix(c(1152, 672, 576, 1040, 910, 650), nrow = 2, byrow = TRUE)
prueba <- chisq.test(tabla) # X-squared = 38.055, df = 2, p-value = 5.45e-09
prueba$expected # frecuencias esperadas
prueba$stdres # residuos ajustados: +5.70, -5.32, -0.82 en la fila A

Y en Python, con scipy.stats.chi2_contingency:

from scipy.stats import chi2_contingency
chi2, p, gl, esperadas = chi2_contingency([[1152, 672, 576], [1040, 910, 650]])
print(round(chi2, 2), gl, p) # 38.06 2 ≈5.45e-09

Lecciones para el aula

Este duelo es material de primera para una clase de estadística de Bachillerato, de un grado en Ciencias de la Salud o de un curso de análisis de datos. Te proponemos siete retos 🎯:

  1. 🧮 Calcula a mano las seis frecuencias esperadas de la Tabla 2 y comprueba que cada fila y cada columna suman lo mismo que en la tabla observada.
  2. 📊 Rehaz el contraste solo con «UCI sí / UCI no» (tabla 2 × 2). ¿Te sale χ² ≈ 0,67 y p ≈ 0,41? Explica con tus palabras por qué el titular y la prueba parecen contar historias distintas.
  3. 🎯 Supón que el «4 %» del titular fueran 4 puntos (del 25 % al 21 %), con los mismos tamaños de grupo. Recalcula el chi-cuadrado 2 × 2 y el NNT. ¿Cambia el veredicto del asalto de la UCI?
  4. 🔎 Con la V de Cramér de este caso (≈ 0,09), redacta en tres líneas la diferencia entre «estadísticamente significativo» y «clínicamente relevante».
  5. ⚖️ Diseña un rival más justo que el «antes-después». ¿Usarías un grupo control simultáneo, una implantación escalonada por hospitales (stepped-wedge) o una estratificación por centro con Cochran-Mantel-Haenszel? Justifica tu elección.
  6. 🧠 El chi-cuadrado sirve para variables categóricas. ¿Qué prueba usarías para comparar la estancia media (9,6 frente a 11,4 días)? ¿Qué información extra necesitarías?
  7. 💡 Debate: un algoritmo con buen AUC que dispara demasiadas alertas provoca «fatiga de alarmas». ¿Qué fila añadirías a la Tabla 1 para medirlo? ¿Quién crees que ganaría ese asalto?

Si quieres llevar el caso al aula con más materiales, en nuestros recursos para profesores encontrarás más propuestas para trabajar la estadística con noticias reales. En la sección de recursos interactivos puedes practicar antes de pasar a R o Python.

Veredicto

🏆 Gana A, la IA que predice la sepsis… a los puntos, no por KO. Tras revisar con el VAR estadístico el asalto de la UCI, el marcador provisional de la Tabla 1 (6 – 2) queda en A 5 – B 2, con un asalto en tablas. Estas son las claves del fallo, siempre sobre nuestros datos ilustrativos:

  • ✅ El chi-cuadrado de independencia confirma que el destino del paciente no es independiente del sistema de vigilancia: χ² = 38,06; gl = 2; p < 0,001.
  • ✅ La ventaja se concentra en más altas rápidas y menos estancias largas, algo coherente con los 1,8 días menos de estancia y los casi 2.000 € de ahorro por episodio.
  • 🤝 En la UCI, con 5.000 episodios, el asalto acaba en tablas: un −4 % relativo necesita muestras de decenas de miles de pacientes para confirmarse.
  • 🛡️ El protocolo clásico se lleva dos asaltos merecidos: transparencia y coste de puesta en marcha.
  • 📏 La asociación es real pero modesta (V de Cramér ≈ 0,09): basta para cambiar la gestión de camas, no para prometer milagros.

El protocolo clásico no se retira del ring: pasa a ser la red de seguridad sobre la que trabaja el algoritmo. Y la lección de fondo va más allá de la sepsis: antes de aplaudir un porcentaje, pregunta con quién se compara, sobre cuántos casos y qué dice la prueba adecuada. Si te ha gustado el formato, en el blog de Canal Docente tienes más artículos que convierten la actualidad en clases de estadística. 📚