GenAI y referencias médicas erróneas

Los modelos de lenguaje de gran tamaño se usan cada vez más para consultas médicas e incluso apoyo diagnóstico, pero su incapacidad para citar y fundamentar de forma fiable las afirmaciones médicas está generando serias preocupaciones de seguridad y responsabilidad. Los comentaristas contrastan el rendimiento de los LLM con la medicina real —donde los médicos también cometen errores, pero operan dentro de sistemas regulados y guiados por protocolos— y sostienen que las herramientas GenAI actuales deberían limitarse a funciones estrechas y asistenciales (como la extracción estructurada de datos o RAG sobre corpus verificados) en lugar de ser decisores clínicos autónomos. El hilo también destaca cómo las salidas persuasivas y con tono de autoridad pueden reforzar la desinformación de los pacientes, la importancia de capas de recuperación y evaluación de alta calidad, y la brecha regulatoria entre las herramientas médicas de IA certificadas y los chatbots de propósito general que los clínicos ya están usando informalmente.

Papel de los LLM en la práctica clínica

  • El uso actual más seguro sugerido: extraer entidades (síntomas, signos, resultados de pruebas) y alimentarlas en puntuaciones clínicas transparentes (p. ej., Wells, Centor), no diagnóstico directo.
  • Muchos esperan futuros modelos explicables de multi-diagnóstico, pero coinciden en que aún no existen.
  • Varios ven los LLM como “asistentes expertos” que aceleran la búsqueda de referencias y la síntesis para clínicos formados, no como herramientas autónomas.

Comparación con médicos humanos

  • Debate sobre si la incapacidad de los LLM para fundamentar afirmaciones es peor que la de los médicos, que rara vez citan en el momento y a menudo siguen algoritmos/diagramas de flujo de guías.
  • Algunos señalan grandes estimaciones de errores médicos como razón para probar la IA; otros cuestionan esas estadísticas y observan que muchos errores son sistémicos, algo que los LLM no solucionan.
  • La idea de que la dificultad de la medicina es o bien una razón para evitar herramientas no confiables o bien una razón para acoger herramientas mejores.

Precisión diagnóstica y anécdotas

  • Estudios citados afirman que GPT‑4 puede igualar o superar a expertos en tareas diagnósticas específicas, pero otros señalan fuga de datos de entrenamiento, escenarios restringidos y advertencias de los propios autores.
  • Algunas anécdotas: GPT‑4 diagnosticando correctamente condiciones pasadas por alto y proporcionando apoyo emocional eficaz; otros advierten contra la generalización excesiva.
  • Los escépticos enfatizan que los LLM no pueden examinar físicamente a los pacientes y que cualquier afirmación “sobrehumana” es extraordinaria.

Citas, RAG y alucinaciones

  • El estudio comentado prueba la navegación web de GPT‑4 (con Bing) y encuentra ~30% de afirmaciones sin respaldo en las fuentes proporcionadas; algunos dicen que esto es más una acusación contra esa configuración de RAG que contra los LLM en general.
  • Varios participantes señalan que el RAG ingenuo es difícil; la curación de documentos y el ajuste de bajo nivel importan mucho.
  • Ejemplos de sistemas especializados (p. ej., herramientas de interacciones fármaco-fármaco, grandes startups de modelos médicos) que supuestamente logran error muy bajo o cero en dominios restringidos.
  • Se sugiere usar un segundo LLM para verificar cada par afirmación-fuente; otros señalan que los modelos verificadores también pueden alucinar.

Comportamiento del paciente y amplificación del riesgo

  • Preocupación de que los LLM actúan como espejos: con prompts directivos, refuerzan los sesgos del usuario, especialmente en hipocondríacos o entusiastas de los suplementos.
  • Algunos argumentan que la búsqueda web clásica puede hacer lo mismo, pero otros dicen que los LLM son más fluidos, rápidos y convincentes que resultados dispersos de búsqueda.
  • Temor de que explicaciones plausibles, bien redactadas pero sin respaldo hagan difícil para los no expertos distinguir entre hecho y ficción.

Regulación, responsabilidad y equidad

  • Las startups que ofrecen IA médica informan de cargas pesadas de certificación; frustración porque los LLM genéricos se usan en la atención sin una regulación similar.
  • Una parte sostiene que la responsabilidad recae en los clínicos que ignoran advertencias y hacen un uso indebido de herramientas no médicas; la otra lo ve como una ventaja competitiva injusta para los grandes proveedores de LLM.

Conservadurismo vs. progreso en el conocimiento médico

  • Algunos usuarios encuentran que GPT‑4 ahora está demasiado restringido a fuentes dominantes (p. ej., Mayo, Cleveland Clinic) y es resistente a citar investigaciones menos ortodoxas o en etapas iniciales.
  • Argumentan que esto puede consolidar la dogmática actual y ralentizar el progreso científico, prefiriendo modelos que muestren una gama más amplia de evidencia y dejen que el usuario juzgue.
  • Otros justifican barandillas fuertes como necesarias para reducir daños, riesgo legal y reacción pública adversa.

Casos de uso emergentes y propuestos

  • Más allá del diagnóstico, los usos discutidos incluyen: comprobación de interacciones farmacológicas, minería de grandes historiales de eventos de pacientes y “enrutadores de recursos” (p. ej., un bot oncológico que enlaza a becas, guías y recursos de apoyo en lugar de responder médicamente).
  • Consenso general: es probable que los LLM se conviertan en un componente más dentro de cadenas de herramientas médicas más amplias, no en un reemplazo de los clínicos.