GenAI y referencias médicas erróneas
Los modelos de lenguaje de gran tamaño se usan cada vez más para consultas médicas e incluso apoyo diagnóstico, pero su incapacidad para citar y fundamentar de forma fiable las afirmaciones médicas está generando serias preocupaciones de seguridad y responsabilidad. Los comentaristas contrastan el rendimiento de los LLM con la medicina real —donde los médicos también cometen errores, pero operan dentro de sistemas regulados y guiados por protocolos— y sostienen que las herramientas GenAI actuales deberían limitarse a funciones estrechas y asistenciales (como la extracción estructurada de datos o RAG sobre corpus verificados) en lugar de ser decisores clínicos autónomos. El hilo también destaca cómo las salidas persuasivas y con tono de autoridad pueden reforzar la desinformación de los pacientes, la importancia de capas de recuperación y evaluación de alta calidad, y la brecha regulatoria entre las herramientas médicas de IA certificadas y los chatbots de propósito general que los clínicos ya están usando informalmente.
Papel de los LLM en la práctica clínica
- El uso actual más seguro sugerido: extraer entidades (síntomas, signos, resultados de pruebas) y alimentarlas en puntuaciones clínicas transparentes (p. ej., Wells, Centor), no diagnóstico directo.
- Muchos esperan futuros modelos explicables de multi-diagnóstico, pero coinciden en que aún no existen.
- Varios ven los LLM como “asistentes expertos” que aceleran la búsqueda de referencias y la síntesis para clínicos formados, no como herramientas autónomas.
Comparación con médicos humanos
- Debate sobre si la incapacidad de los LLM para fundamentar afirmaciones es peor que la de los médicos, que rara vez citan en el momento y a menudo siguen algoritmos/diagramas de flujo de guías.
- Algunos señalan grandes estimaciones de errores médicos como razón para probar la IA; otros cuestionan esas estadísticas y observan que muchos errores son sistémicos, algo que los LLM no solucionan.
- La idea de que la dificultad de la medicina es o bien una razón para evitar herramientas no confiables o bien una razón para acoger herramientas mejores.
Precisión diagnóstica y anécdotas
- Estudios citados afirman que GPT‑4 puede igualar o superar a expertos en tareas diagnósticas específicas, pero otros señalan fuga de datos de entrenamiento, escenarios restringidos y advertencias de los propios autores.
- Algunas anécdotas: GPT‑4 diagnosticando correctamente condiciones pasadas por alto y proporcionando apoyo emocional eficaz; otros advierten contra la generalización excesiva.
- Los escépticos enfatizan que los LLM no pueden examinar físicamente a los pacientes y que cualquier afirmación “sobrehumana” es extraordinaria.
Citas, RAG y alucinaciones
- El estudio comentado prueba la navegación web de GPT‑4 (con Bing) y encuentra ~30% de afirmaciones sin respaldo en las fuentes proporcionadas; algunos dicen que esto es más una acusación contra esa configuración de RAG que contra los LLM en general.
- Varios participantes señalan que el RAG ingenuo es difícil; la curación de documentos y el ajuste de bajo nivel importan mucho.
- Ejemplos de sistemas especializados (p. ej., herramientas de interacciones fármaco-fármaco, grandes startups de modelos médicos) que supuestamente logran error muy bajo o cero en dominios restringidos.
- Se sugiere usar un segundo LLM para verificar cada par afirmación-fuente; otros señalan que los modelos verificadores también pueden alucinar.
Comportamiento del paciente y amplificación del riesgo
- Preocupación de que los LLM actúan como espejos: con prompts directivos, refuerzan los sesgos del usuario, especialmente en hipocondríacos o entusiastas de los suplementos.
- Algunos argumentan que la búsqueda web clásica puede hacer lo mismo, pero otros dicen que los LLM son más fluidos, rápidos y convincentes que resultados dispersos de búsqueda.
- Temor de que explicaciones plausibles, bien redactadas pero sin respaldo hagan difícil para los no expertos distinguir entre hecho y ficción.
Regulación, responsabilidad y equidad
- Las startups que ofrecen IA médica informan de cargas pesadas de certificación; frustración porque los LLM genéricos se usan en la atención sin una regulación similar.
- Una parte sostiene que la responsabilidad recae en los clínicos que ignoran advertencias y hacen un uso indebido de herramientas no médicas; la otra lo ve como una ventaja competitiva injusta para los grandes proveedores de LLM.
Conservadurismo vs. progreso en el conocimiento médico
- Algunos usuarios encuentran que GPT‑4 ahora está demasiado restringido a fuentes dominantes (p. ej., Mayo, Cleveland Clinic) y es resistente a citar investigaciones menos ortodoxas o en etapas iniciales.
- Argumentan que esto puede consolidar la dogmática actual y ralentizar el progreso científico, prefiriendo modelos que muestren una gama más amplia de evidencia y dejen que el usuario juzgue.
- Otros justifican barandillas fuertes como necesarias para reducir daños, riesgo legal y reacción pública adversa.
Casos de uso emergentes y propuestos
- Más allá del diagnóstico, los usos discutidos incluyen: comprobación de interacciones farmacológicas, minería de grandes historiales de eventos de pacientes y “enrutadores de recursos” (p. ej., un bot oncológico que enlaza a becas, guías y recursos de apoyo en lugar de responder médicamente).
- Consenso general: es probable que los LLM se conviertan en un componente más dentro de cadenas de herramientas médicas más amplias, no en un reemplazo de los clínicos.