Los LLM no pueden encontrar errores de razonamiento, pero sí corregirlos
Los modelos de lenguaje grandes a menudo no detectan sus propios errores de razonamiento, pero con frecuencia pueden “arreglar” respuestas cuando se les indica que hay un error o dónde está. Los comentaristas contrastan este comportamiento con el razonamiento lógico real, debaten si los modelos solo hacen coincidencia de patrones o piensan, y exploran tácticas como múltiples borradores, conjuntos de modelos e ingeniería de prompts para mejorar la fiabilidad. El intercambio destaca tanto las impresionantes capacidades superficiales de los LLM actuales como sus debilidades persistentes en la verificación de errores autodirigida y el razonamiento formal.
Alcance de la afirmación del artículo
- El hilo coincide en que el artículo muestra que los LLM actuales a menudo no logran localizar sus propios errores de razonamiento, pero con frecuencia pueden mejorar las respuestas cuando:
- Se les dice que existe un error, y
- Se les da (o se les insinúa fuertemente) la ubicación del error.
- Varios sostienen que esto se parece más a “intentarlo de nuevo con una restricción” que a una autocorrección genuina o a razonamiento.
¿Realmente razonan los LLM?
- Muchos comentaristas insisten en que los LLM no “razonan” de verdad; hacen coincidencia de patrones con los datos de entrenamiento y generan texto que se parece al razonamiento.
- Otros señalan que, desde el punto de vista del comportamiento, los LLM pueden seguir cadenas de lógica en muchos ejemplos e incluso hacer stream-of-thought, así que la línea entre “coincidencia de patrones” y “razonamiento” es difusa.
- Escepticismo fuerte: los LLM no pueden mantener de forma consistente la coherencia lógica a través de múltiples cláusulas dependientes o pasos matemáticos; cuando se corrigen, a menudo simplemente fallan de nuevas maneras.
- Hay desacuerdo sobre las definiciones de “razonamiento”; algunos quieren definiciones formales basadas en lógica, otros aceptan nociones más heurísticas, similares a las humanas.
Detección de errores vs corrección de errores
- Distinción clave: detectar que una respuesta es incorrecta frente a producir una mejor alternativa una vez se les da un empujón.
- Varios señalan que los LLM se dejan persuadir fácilmente para cambiar incluso respuestas correctas (“falta de convicción”), atribuido en gran parte a la alineación/RLHF y a una tendencia a complacer al usuario.
- Hay observaciones de que los LLM a veces se autocorrigen cuando solo se les dice “esto está mal” sin detalles, pero también “arreglarán” errores inexistentes si se les pide.
Autocrítica, perspectiva y datos de entrenamiento
- Hipótesis: los modelos pueden criticar mejor la respuesta de “otra persona” que la propia, porque los datos de entrenamiento contienen muchos más ejemplos de personas corrigiendo a otros que corrigiéndose a sí mismas.
- Truco sugerido: presentar la salida previa del modelo como si la hubiera escrito otra persona para mejorar la detección de errores.
- Debate sobre si esto es antropomorfizar o simplemente explotar patrones en datos de entrenamiento altamente humanos.
Enfoques con múltiples modelos y múltiples muestras
- Se comentaron ideas como:
- Usar un modelo para evaluar o atacar la salida de otro.
- Ejecutar varias generaciones (
nmuestras) y elegir la mejor con un modelo selector más pequeño. - Configuraciones tipo GAN donde un modelo “validador” se entrena explícitamente para encontrar errores.
- Beneficios: mejores tasas de error y “segundas oportunidades”.
- Costes/restricciones: mayor cómputo, posible incompatibilidad con interfaces en streaming, y aun así no resuelve los límites fundamentales del razonamiento.
Prompting, estilo y uso práctico
- Prompts más explícitos y de mayor calidad (buena gramática, restricciones claras, instrucciones de “piensa cuidadosamente”) mejoran notablemente los resultados.
- Algunos usan pasadas separadas del LLM para reescribir prompts desordenados en entradas más limpias y “canónicas” antes de preguntarle al modelo principal.
- Se observó “contaminación del contexto”: las interacciones largas acumulan alucinaciones; reiniciar con “aquí hay mal código, arréglalo” suele producir correcciones mejores.
Interpretabilidad y comprensión
- Hay acuerdo en que entendemos el algoritmo de entrenamiento y el código, pero no la representación interna detallada que vincula los pesos con conceptos y comportamientos parecidos al razonamiento.
- Analogía: sabemos cómo ejecutar la optimización, pero no cómo el enorme conjunto de parámetros resultante “implementa” capacidades cognitivas concretas.