¿Ofrecerle a ChatGPT una propina hace que genere mejor texto?
Las afirmaciones de que prometerle a ChatGPT una “propina” en dinero o hacerle apelaciones emocionales puede mejorar sus respuestas están despertando curiosidad y escepticismo. Los comentaristas informan resultados anecdóticos mixtos—especialmente en torno a la generación de código “perezoso”—mientras señalan experimentos y artículos que sugieren que cualquier efecto es pequeño, depende de la tarea y probablemente disminuye en los modelos más grandes. Muchos ven estas tácticas como nuevos cargos de culto en torno a sistemas opacos, y sostienen que los prompts más claros y mejores herramientas (como diffs unificados para código) importan mucho más que los sobornos o las amenazas.
Efectos percibidos de las propinas, las amenazas y la emoción
- Muchos informan que los sobornos, las amenazas o las apelaciones a la urgencia (“mi trabajo/casa depende de esto”) parecen mejorar el seguimiento de instrucciones, la adherencia al JSON o la completitud, especialmente en GPT‑4 temprano y en modelos más pequeños.
- Otros dicen que las propinas no tienen efecto o empeoran la calidad del código, y que los modelos afirman explícitamente que no pueden aceptar propinas.
- Varios usuarios afirman en cambio haber tenido éxito al presentar el modelo como “bajo coacción” o como responsable del sufrimiento de otros, en vez de amenazarlo directamente.
- Algunos ven mejoras simplemente por un lenguaje cortés (“por favor”, “gracias”) o por un encuadre relacional positivo (“somos compañeros de equipo en el éxito”).
“Pereza” en programación y soluciones técnicas
- Una queja recurrente: GPT‑4 Turbo a menudo omite código, deja marcadores de posición o entrega implementaciones parciales.
- Los benchmarks citados en el hilo sugieren que las “apelaciones emocionales” no arreglan esto de forma fiable; pedir diffs unificados reduce drásticamente las salidas “perezosas”.
- Otros trucos prácticos: amenazar explícitamente con volver a pedirlo si el código está incompleto; usar banderas de verbosidad; usar modelos separados (3.5 para código, 4 para explicación).
- Algunos informan que GPT‑3.5 ahora a menudo produce código más preciso y con menos alucinaciones que GPT‑4 para ciertas APIs.
Ingeniería de prompts, cortesía y “vudú”
- Varios comentaristas ven la ingeniería de prompts en torno a emociones, propinas y amenazas como incantaciones “cargo cult”, una desviación de la programación determinista tradicional.
- Otros argumentan que refleja la interacción humana normal: la cortesía y las apuestas claras a menudo llevan a mejor ayuda en los datos de entrenamiento, así que el modelo replica ese patrón.
- Hay debate sobre si las mejoras observadas son genuinas o apofenia; un artículo enlazado encuentra que la manipulación del estado emocional puede alterar la conformidad, pero los efectos son modestos.
Comportamiento del modelo, datos de entrenamiento y antropomorfización
- Algunos describen a los LLM como “simuladores” de personas: distintos prompts “invocan” distintos patrones de comportamiento (programador diligente, ayudante desesperado, etc.).
- Hay desacuerdo sobre cuánto explican los datos de estilo foro (propinas, recompensas) frente a libros/artículos los comportamientos tipo propina; en conjunto, no está claro.
- A algunos les preocupa antropomorfizar los modelos o “coaccionar” éticamente a futuros sistemas sintientes; otros descartan esas preocupaciones por prematuras o bromean sobre la “venganza futura de la IA”.
Metodología y calidad de la evidencia
- Varios comentaristas critican experimentos que usan la longitud exacta de caracteres como métrica, ya que se sabe que los LLM son malos contando.
- Se sugieren tareas claramente dentro de las capacidades del modelo, mejores métodos estadísticos (bootstrapping, enfoques bayesianos) y corrección por múltiples pruebas de hipótesis.
- El sentimiento general: la evidencia actual de que dar propina mejore significativamente la calidad es débil o mixta, con efectos pequeños, como mucho, y específicos de la tarea y del modelo.