Los LLM no pueden encontrar errores de razonamiento, pero sí corregirlos

Los modelos de lenguaje grandes a menudo no detectan sus propios errores de razonamiento, pero con frecuencia pueden “arreglar” respuestas cuando se les indica que hay un error o dónde está. Los comentaristas contrastan este comportamiento con el razonamiento lógico real, debaten si los modelos solo hacen coincidencia de patrones o piensan, y exploran tácticas como múltiples borradores, conjuntos de modelos e ingeniería de prompts para mejorar la fiabilidad. El intercambio destaca tanto las impresionantes capacidades superficiales de los LLM actuales como sus debilidades persistentes en la verificación de errores autodirigida y el razonamiento formal.

Alcance de la afirmación del artículo

  • El hilo coincide en que el artículo muestra que los LLM actuales a menudo no logran localizar sus propios errores de razonamiento, pero con frecuencia pueden mejorar las respuestas cuando:
    • Se les dice que existe un error, y
    • Se les da (o se les insinúa fuertemente) la ubicación del error.
  • Varios sostienen que esto se parece más a “intentarlo de nuevo con una restricción” que a una autocorrección genuina o a razonamiento.

¿Realmente razonan los LLM?

  • Muchos comentaristas insisten en que los LLM no “razonan” de verdad; hacen coincidencia de patrones con los datos de entrenamiento y generan texto que se parece al razonamiento.
  • Otros señalan que, desde el punto de vista del comportamiento, los LLM pueden seguir cadenas de lógica en muchos ejemplos e incluso hacer stream-of-thought, así que la línea entre “coincidencia de patrones” y “razonamiento” es difusa.
  • Escepticismo fuerte: los LLM no pueden mantener de forma consistente la coherencia lógica a través de múltiples cláusulas dependientes o pasos matemáticos; cuando se corrigen, a menudo simplemente fallan de nuevas maneras.
  • Hay desacuerdo sobre las definiciones de “razonamiento”; algunos quieren definiciones formales basadas en lógica, otros aceptan nociones más heurísticas, similares a las humanas.

Detección de errores vs corrección de errores

  • Distinción clave: detectar que una respuesta es incorrecta frente a producir una mejor alternativa una vez se les da un empujón.
  • Varios señalan que los LLM se dejan persuadir fácilmente para cambiar incluso respuestas correctas (“falta de convicción”), atribuido en gran parte a la alineación/RLHF y a una tendencia a complacer al usuario.
  • Hay observaciones de que los LLM a veces se autocorrigen cuando solo se les dice “esto está mal” sin detalles, pero también “arreglarán” errores inexistentes si se les pide.

Autocrítica, perspectiva y datos de entrenamiento

  • Hipótesis: los modelos pueden criticar mejor la respuesta de “otra persona” que la propia, porque los datos de entrenamiento contienen muchos más ejemplos de personas corrigiendo a otros que corrigiéndose a sí mismas.
  • Truco sugerido: presentar la salida previa del modelo como si la hubiera escrito otra persona para mejorar la detección de errores.
  • Debate sobre si esto es antropomorfizar o simplemente explotar patrones en datos de entrenamiento altamente humanos.

Enfoques con múltiples modelos y múltiples muestras

  • Se comentaron ideas como:
    • Usar un modelo para evaluar o atacar la salida de otro.
    • Ejecutar varias generaciones (n muestras) y elegir la mejor con un modelo selector más pequeño.
    • Configuraciones tipo GAN donde un modelo “validador” se entrena explícitamente para encontrar errores.
  • Beneficios: mejores tasas de error y “segundas oportunidades”.
  • Costes/restricciones: mayor cómputo, posible incompatibilidad con interfaces en streaming, y aun así no resuelve los límites fundamentales del razonamiento.

Prompting, estilo y uso práctico

  • Prompts más explícitos y de mayor calidad (buena gramática, restricciones claras, instrucciones de “piensa cuidadosamente”) mejoran notablemente los resultados.
  • Algunos usan pasadas separadas del LLM para reescribir prompts desordenados en entradas más limpias y “canónicas” antes de preguntarle al modelo principal.
  • Se observó “contaminación del contexto”: las interacciones largas acumulan alucinaciones; reiniciar con “aquí hay mal código, arréglalo” suele producir correcciones mejores.

Interpretabilidad y comprensión

  • Hay acuerdo en que entendemos el algoritmo de entrenamiento y el código, pero no la representación interna detallada que vincula los pesos con conceptos y comportamientos parecidos al razonamiento.
  • Analogía: sabemos cómo ejecutar la optimización, pero no cómo el enorme conjunto de parámetros resultante “implementa” capacidades cognitivas concretas.