Predecir no es prevenir: lo que
muestra la evidencia 2023–2026, sus promesas y sus nuevos riesgos
RESUMEN EJECUTIVO:
En enero de 2026, ECRI publicó su
lista anual de peligros de la tecnología sanitaria. El primer lugar fue para el
mal uso de los chatbots de inteligencia artificial (IA) (ECRI, 2026a). Dos
meses después, la misma organización eligió como la principal preocupación de
seguridad del paciente del año el "dilema diagnóstico de la IA"
(ECRI, 2026b). La tecnología que más promete reducir el daño evitable encabeza
al mismo tiempo las dos listas de riesgos. Esa paradoja es el punto de partida
de este trabajo.
Revisamos la literatura más
relevante de los últimos tres años en ocho líneas clásicas de la seguridad del
paciente: error diagnóstico, sepsis y deterioro clínico, errores de medicación,
eventos adversos quirúrgicos, infecciones asociadas al cuidado, caídas,
lesiones por presión, y notificación y análisis de incidentes. Hicimos a cada
línea la misma pregunta: ¿hay evidencia de que la IA reduzca el daño a los
pacientes, o solo de que predice bien? Además, ¿qué riesgos nuevos introduce?
Diez mensajes clave
1. Predecir
no es prevenir.
En casi todas las
líneas abundan los estudios que muestran que un algoritmo predice bien, y
escasean los que muestran que los pacientes sufren menos daño. Cuando se miden
desenlaces duros, a menudo el resultado es neutro:
•
Un modelo de mortalidad quirúrgica con
muy buena capacidad de discriminación se implementó en UCLA sobre más de 40.000
cirugías, y la mortalidad no cambió (Wingert et al., 2026).
• El índice que anticipa la hipotensión
intraoperatoria reduce los minutos de hipotensión. Pero en 14 ensayos
aleatorizados no mejoró de manera robusta la lesión renal, la lesión miocárdica
ni la mortalidad (S. S. Wang et al., 2026).
2.
El diagnóstico es hoy la línea
con mejor evidencia de beneficio real.
En un ensayo en el
que participaron más de 105.000 mujeres, y la IA como apoyo a la lectura de
mamografías aumentó la sensibilidad. Los cánceres de intervalo, que son los que
se "escapan" entre dos controles, bajaron un 12%. Esa reducción cumplió
el criterio de no inferioridad, aunque no demostró superioridad (Gommers et
al., 2026). Además, la carga de lectura de los radiólogos bajó un 44%. En un
ensayo pragmático con casi 16.000 pacientes, las alertas de un
electrocardiograma analizado con IA redujeron la mortalidad a 90 días de 4,3% a
3,6% (C.-S. Lin et al., 2024).
3. En
sepsis y deterioro clínico las señales son alentadoras, pero no concluyentes.
Estudios
observacionales muestran reducciones de mortalidad cercanas al 17% (Adams et
al., 2022; Boussina et al., 2024). Sin embargo, el metaanálisis que reunió solo
ensayos aleatorizados no encontró una diferencia significativa (Ein Alshaeba et
al., 2025). En sala general, los sistemas de alerta de deterioro reducen los
paros cardíacos intrahospitalarios, pero su efecto sobre la mortalidad no es
concluyente (Chua et al., 2026). La advertencia más citada es el modelo de
sepsis de Epic, uno de los más difundidos del mundo. Cuando se analizaron solo
las predicciones previas a que el médico sospechara la sepsis, rindió peor que
el azar (Kamran et al., 2024).
4. El
algoritmo no salva vidas: lo hace el circuito que responde a la alerta.
Las experiencias
exitosas tienen algo en común: detrás de la alerta hay un equipo, un protocolo
y un tiempo de respuesta. En Kaiser Permanente, la reducción de mortalidad
asociada a su índice de deterioro dependió de un equipo de enfermería que
monitoreaba a distancia y activaba la respuesta (Escobar et al., 2020). Comprar
un algoritmo sin rediseñar el proceso es comprar una alarma más.
5. La
combinación de profesional e IA supera a cada uno por separado, pero no alcanza
con tener la herramienta.
En una farmacia en
línea, un modelo de lenguaje con revisión humana redujo un 33% los casi-errores
en la transcripción de indicaciones (Pais et al., 2024).
• En casos simulados, los farmacéuticos
asistidos por IA detectaron más errores de medicación que trabajando solos
(Ong, Jin, et al., 2025).
• En cambio, darle GPT-4 a un grupo de
médicos no mejoró su razonamiento diagnóstico, aunque el modelo solo rendía
mejor que ellos (Goh et al., 2024).
• Con pacientes pasa algo parecido. Los
modelos identificaron la condición correcta en el 95% de los casos, pero las
personas que los consultaban acertaron en menos del 35% (Bean et al., 2026).
El algoritmo acierta;
el desafío es que acierte el equipo.
6. En
caídas y lesiones por presión la evidencia es la más débil.
Los modelos predicen
el riesgo mejor que las escalas tradicionales, pero no hay ensayos
aleatorizados que muestren menos caídas. El mejor estudio disponible redujo las
caídas con lesión, pero no las caídas totales (Cho et al., 2023). Para las
lesiones por presión, una revisión paraguas de 70 herramientas concluyó que ni
la escala de Braden ni los modelos de aprendizaje automático demostraron
reducir su incidencia (Hillier et al., 2025a).
7. Lo
que funciona en un hospital puede fallar en otro.
Los sistemas de
visión por computadora que miden la higiene de manos alcanzan un 95% de
exactitud en la unidad donde se entrenaron, y caen a un 56% al trasladarse a
otro servicio (X. Lin et al., 2026). En el caso de Epic, lo que falló fue un
producto propietario, desplegado a gran escala sin validación independiente.
Validar el modelo en la propia población no es un lujo: es una condición de
seguridad.
8. Con
los incidentes, la IA ya sabe clasificar, pero todavía no sabe analizar.
Un modelo de lenguaje
clasificó reportes de errores de medicación con un 96% de concordancia con
farmacéuticos expertos (Krifors et al., 2026). Pero al buscar los factores
contribuyentes de un evento adverso, los modelos confunden los factores
organizacionales con los individuales (Y. Wang et al., 2026). Es decir, tienden
a señalar a la persona donde había una falla del sistema. En un análisis causa
raíz eso no es un detalle técnico: es un retroceso hacia la cultura de la
culpa.
9.
La IA genera riesgos propios.
• Sesgo de automatización. Cuando la IA
sugería una categoría equivocada, la exactitud de los lectores inexpertos de
mamografía cayó de casi 80% a 20% (Dratsch et al., 2023).
• Pérdida de habilidades. Después de
acostumbrarse a la IA, los endoscopistas detectaron menos adenomas en las
colonoscopías que hacían sin ella (Budzyń et al., 2025).
• Escribas ambientales. Los asistentes
que redactan la historia clínica a partir de la conversación omiten o alteran
información de manera sutil (Lukac et al., 2025).
• Chatbots de salud. En una prueba
estructurada, un chatbot orientado a pacientes subestimó la urgencia en la
mitad de las emergencias (Ramaswamy et al., 2026).
A esto se suma que
los incidentes en los que la IA contribuye casi no se notifican (Taylor, 2025).
10. Qué
hacer.
Para las
instituciones, el consenso internacional converge en cinco medidas (IHI Lucian
Leape Institute, 2024; Joint Commission & Coalition for Health AI, 2025):
•
validar localmente antes de
implementar;
•
xigir evidencia de desenlaces, no solo
de rendimiento;
•
diseñar qué ocurre después de cada
alerta;
•
establecer una gobernanza que
monitoree el desempeño en el tiempo;
•
incorporar los eventos vinculados a la
IA al sistema de notificación.
Para los profesionales, la IA
debe funcionar como una segunda opinión y no como un piloto automático. Esto
vale también en el plano médico-legal: la firma al pie de la historia clínica
sigue siendo del médico, aunque el texto lo haya escrito una máquina.
Seguir leyendo AQUÍ
Dr. Fabián Vítolo NOBLE Cía de
Seguros

No hay comentarios.:
Publicar un comentario