Ask HN: Si has usado GPT-4-Turbo y Claude Opus, ¿cuál prefieres?

Desarrolladores y usuarios avanzados que comparan GPT‑4‑Turbo de OpenAI con Claude 3 Opus de Anthropic reportan una clara inclinación hacia Claude para programación, resumir y escribir correos, citando su salida más concisa, un tono menos “corporativo” y menos señales de autoría obvia de IA. GPT‑4, especialmente las variantes no Turbo, sigue viéndose como más fuerte para el razonamiento lógico complejo, la interpretación de artículos de investigación, el aprendizaje de idiomas y los flujos de trabajo que dependen de herramientas integradas como la ejecución de Python, pero muchos se quejan de que los modelos GPT‑4 recientes se sienten más “perezosos” o degradados. Factores prácticos como la disponibilidad limitada de Claude en Europa, la calidad distinta de la interfaz y la confianza en la dirección de cada empresa también influyen de forma importante en qué modelo elige la gente.

Patrones generales de uso

  • Muchos usan ambos modelos y eligen según la tarea; algunos ejecutan GPT‑4, Claude Opus y Gemini en paralelo, y luego continúan la conversación con el que mejor “entiende” la tarea.
  • Casos de uso comunes: programación/depuración, planificación empresarial, aprendizaje de idiomas, redacción de correos y textos, resumir, generación de diagramas (p. ej., Mermaid) y estrategia/lluvia de ideas.

Fortalezas percibidas de Claude 3 Opus

  • Programación: se describe con frecuencia como “por delante” de GPT‑4, más directo, mejor para entender ediciones dentro de código existente y hacer diffs concisos. Algunos dicen que puede ser una parte integral de un flujo de trabajo de ingeniería.
  • Estilo: menos “lenguaje corporativo”, más conciso y menos obviamente escrito por IA; a menudo se prefiere para correos y escritura general.
  • Enfoque: tiende a mantenerse en el tema, corregir respuestas de forma incremental y manejar mejor en algunos tests de usuarios instrucciones complejas de varios pasos.
  • Multilingüe: se elogia para ciertos idiomas y dialectos con pocos recursos.
  • Se considera que el nivel gratuito de Sonnet es claramente mejor que GPT‑3.5 por parte de varios; Opus se ve como una mejora notable sobre Sonnet.

Fortalezas percibidas de GPT‑4 / GPT‑4‑Turbo

  • Lógica y artículos: algunos informan que GPT‑4 es superior para el razonamiento lógico complejo y para interpretar artículos académicos.
  • Aprendizaje de idiomas: GPT‑4‑Turbo se prefiere para explicaciones de gramática/sintaxis, generalización de reglas, mnemotecnias y ejemplos.
  • Fiabilidad: algunos encuentran GPT‑4 menos propenso a respuestas erróneas con confianza en preguntas sobre herramientas/cómo hacer algo, especialmente cuando se guía con un fuerte prompt de sistema que desalienta las alucinaciones.
  • Herramientas: el intérprete de código integrado y un ecosistema más amplio (apps, plugins) son grandes atractivos.

Estilo, pereza y ajuste de prompts

  • Varios comentarios dicen que las respuestas de GPT‑4 se han vuelto más perezosas o genéricas con el tiempo, posiblemente por coste o por ajustes de alineación; a veces necesita un segundo prompt para “esforzarse de verdad”.
  • Claude suele percibirse como menos perezoso y más dispuesto a hacer el trabajo completo.
  • Los prompts de sistema personalizados en GPT‑4 pueden reducir la verbosidad y el tono “corporativo”; la interfaz de chat de Claude ofrece menos control sobre el prompt de sistema.

Desacuerdos sobre calidad y alucinaciones

  • Algunos consideran que Claude es notablemente mejor para optimización/algoritmos; otros lo ven peor para corregir errores o para preguntas factuales del tipo “¿cómo hago X en la herramienta Y?”, con alucinaciones persistentes.
  • GPT‑4‑Turbo divide opiniones: algunos dicen que está cerca de la calidad del GPT‑4 original; otros lo llaman “prácticamente inutilizable”, especialmente para código (produce pasos de alto nivel en lugar de implementaciones concretas).
  • Los informes de benchmarks en el hilo se contradicen: los benchmarks internos de una persona tienen varias variantes antiguas de GPT‑4 superando a Claude Opus; otro conjunto informal de pruebas tuvo a Claude resolviendo todos los problemas que GPT‑4 falló.

UX, acceso y fricción de políticas

  • La interfaz de ChatGPT se considera más pulida (edición, cancelación), pero también con fallos para algunos; la interfaz de Claude puede bloquearse o carece de funciones avanzadas.
  • Claude no está disponible oficialmente en gran parte de Europa; los usuarios recurren a Poe, Kagi, proxies o trucos de pago de EE. UU.
  • Algunos usuarios prefieren Claude por razones no técnicas: mayor confianza en la dirección de la empresa y malestar con problemas previos de gobernanza de OpenAI.