¿Ofrecerle a ChatGPT una propina hace que genere mejor texto?

Las afirmaciones de que prometerle a ChatGPT una “propina” en dinero o hacerle apelaciones emocionales puede mejorar sus respuestas están despertando curiosidad y escepticismo. Los comentaristas informan resultados anecdóticos mixtos—especialmente en torno a la generación de código “perezoso”—mientras señalan experimentos y artículos que sugieren que cualquier efecto es pequeño, depende de la tarea y probablemente disminuye en los modelos más grandes. Muchos ven estas tácticas como nuevos cargos de culto en torno a sistemas opacos, y sostienen que los prompts más claros y mejores herramientas (como diffs unificados para código) importan mucho más que los sobornos o las amenazas.

Efectos percibidos de las propinas, las amenazas y la emoción

  • Muchos informan que los sobornos, las amenazas o las apelaciones a la urgencia (“mi trabajo/casa depende de esto”) parecen mejorar el seguimiento de instrucciones, la adherencia al JSON o la completitud, especialmente en GPT‑4 temprano y en modelos más pequeños.
  • Otros dicen que las propinas no tienen efecto o empeoran la calidad del código, y que los modelos afirman explícitamente que no pueden aceptar propinas.
  • Varios usuarios afirman en cambio haber tenido éxito al presentar el modelo como “bajo coacción” o como responsable del sufrimiento de otros, en vez de amenazarlo directamente.
  • Algunos ven mejoras simplemente por un lenguaje cortés (“por favor”, “gracias”) o por un encuadre relacional positivo (“somos compañeros de equipo en el éxito”).

“Pereza” en programación y soluciones técnicas

  • Una queja recurrente: GPT‑4 Turbo a menudo omite código, deja marcadores de posición o entrega implementaciones parciales.
  • Los benchmarks citados en el hilo sugieren que las “apelaciones emocionales” no arreglan esto de forma fiable; pedir diffs unificados reduce drásticamente las salidas “perezosas”.
  • Otros trucos prácticos: amenazar explícitamente con volver a pedirlo si el código está incompleto; usar banderas de verbosidad; usar modelos separados (3.5 para código, 4 para explicación).
  • Algunos informan que GPT‑3.5 ahora a menudo produce código más preciso y con menos alucinaciones que GPT‑4 para ciertas APIs.

Ingeniería de prompts, cortesía y “vudú”

  • Varios comentaristas ven la ingeniería de prompts en torno a emociones, propinas y amenazas como incantaciones “cargo cult”, una desviación de la programación determinista tradicional.
  • Otros argumentan que refleja la interacción humana normal: la cortesía y las apuestas claras a menudo llevan a mejor ayuda en los datos de entrenamiento, así que el modelo replica ese patrón.
  • Hay debate sobre si las mejoras observadas son genuinas o apofenia; un artículo enlazado encuentra que la manipulación del estado emocional puede alterar la conformidad, pero los efectos son modestos.

Comportamiento del modelo, datos de entrenamiento y antropomorfización

  • Algunos describen a los LLM como “simuladores” de personas: distintos prompts “invocan” distintos patrones de comportamiento (programador diligente, ayudante desesperado, etc.).
  • Hay desacuerdo sobre cuánto explican los datos de estilo foro (propinas, recompensas) frente a libros/artículos los comportamientos tipo propina; en conjunto, no está claro.
  • A algunos les preocupa antropomorfizar los modelos o “coaccionar” éticamente a futuros sistemas sintientes; otros descartan esas preocupaciones por prematuras o bromean sobre la “venganza futura de la IA”.

Metodología y calidad de la evidencia

  • Varios comentaristas critican experimentos que usan la longitud exacta de caracteres como métrica, ya que se sabe que los LLM son malos contando.
  • Se sugieren tareas claramente dentro de las capacidades del modelo, mejores métodos estadísticos (bootstrapping, enfoques bayesianos) y corrección por múltiples pruebas de hipótesis.
  • El sentimiento general: la evidencia actual de que dar propina mejore significativamente la calidad es débil o mixta, con efectos pequeños, como mucho, y específicos de la tarea y del modelo.