ChatGPT hace Advent of Code 2023
Advent of Code 2023 se está usando como un banco de pruebas informal para ver qué tan bien los modelos de lenguaje grandes como ChatGPT pueden resolver rompecabezas de programación novedosos, y muchos señalan que estos problemas ponen en aprietos a los modelos actuales mucho más que los de años anteriores. Los comentaristas debaten si esto refleja un diseño deliberadamente “hostil a los LLM” (algo que el creador niega explícitamente), límites inherentes de las arquitecturas actuales o simplemente la ausencia de datos de entrenamiento para estas tareas únicas. El hilo se amplía hacia preguntas sobre cuánto pueden ayudar realmente los LLM a los programadores —especialmente en depuración y razonamiento—, hasta dónde puede llevarlos el escalado y si cambian de forma significativa los flujos de trabajo cotidianos de desarrollo en lugar de reemplazar la resolución humana de problemas.
¿Fue AoC 2023 hecho deliberadamente para ser resistente a los LLM?
- Varios comentaristas asumieron inicialmente que los rompecabezas estaban diseñados para confundir a los LLM (condiciones extra, redacción tramposa, necesidad de inspeccionar las entradas).
- Otros señalan que el autor del rompecabezas negó explícitamente cualquier influencia de los LLM y describió el mismo proceso que en años anteriores.
- Algunos reconcilian esto diciendo que el autor quizá favorece sin querer estilos difíciles para los LLM, o que “adverso a la IA” puede significar simplemente “problemas realmente nuevos que no están en el conjunto de entrenamiento”.
Características de los rompecabezas e idiosincrasias de entrada
- Varias personas señalan que más problemas de lo habitual se beneficiaron de estudiar la estructura específica de la entrada o casos especiales.
- Entre los ejemplos hay tareas tipo circuito divididas en subgrafos más fáciles y problemas que se vuelven mucho más simples que el caso general una vez que se notan las peculiaridades de la entrada.
- Otros dicen que este tipo de trucos dependientes de la entrada también existían en años anteriores.
Rendimiento de los LLM en AoC y programación
- Algunos informan que GPT-4 falló incluso en los primeros días de 2023 sin mucha guía, especialmente en análisis sintáctico matizado.
- Otros muestran que GPT-4 puede añadir registros de depuración, interpretar salidas y corregir iterativamente su propio código cuando se le da un intérprete y una guía clara.
- Hay desacuerdo sobre la depuración: algunos dicen que sus habilidades de depuración son “inexistentes”, mientras que otros dicen que es fuerte si se le piden diffs, diagnósticos o ayuda enfocada en lugar de reescrituras completas.
- AoC se ve como un buen banco de pruebas para el razonamiento general, pero no necesariamente representativo de la programación empresarial cotidiana.
Debates sobre productividad y evaluación comparativa
- Muchos usan LLM para acelerar código repetitivo, regex, aclarar enunciados de rompecabezas y andamiaje aproximado.
- Una prueba real sugerida: si un programador promedio con GPT-4 supera a otro de igual habilidad sin él, y por cuánto margen.
- Se hacen comparaciones con otros factores de productividad (elección del lenguaje, IDE, resaltado de sintaxis).
Escalado, datos y preocupaciones sobre el “pico de la IA”
- Algunos predicen ganancias sustanciales futuras con más cómputo, datos y técnicas (MoE, datos sintéticos).
- Otros argumentan que nos estamos acercando a los límites de datos y que los LLM son fundamentalmente imitadores de patrones, no un camino hacia la “verdadera” inteligencia o la sentiencia.
- Hay preocupación por el sobreajuste y por que los modelos simplemente regurgiten código existente de AoC y tutoriales en lugar de razonar desde primeros principios.
Depuración y educación
- Un hilo lateral critica la educación en CS por enfatizar en exceso el código perfecto y enseñar demasiado poco la depuración.
- AoC (y el uso de LLM) ponen de relieve lo crucial que es realmente depurar y razonar sobre código defectuoso.