Claude 2.1

El lanzamiento por parte de Anthropic de Claude 2.1, un modelo de lenguaje grande con una ventana de contexto de 200k tokens y menos alucinaciones, se está comparando con GPT‑4/Turbo de OpenAI en términos de capacidad de programación, profundidad de razonamiento, velocidad y fiabilidad. Muchos comentaristas consideran que Claude es más débil que GPT‑4 para programación compleja y conocimiento general, pero elogian su gran contexto y su tono, especialmente cuando se usa a través de AWS Bedrock. Una gran fuente de frustración es el acceso restrictivo de Anthropic, las limitaciones regionales (especialmente en la UE y Canadá) y los filtros de seguridad agresivos que desencadenan rechazos frecuentes ante consultas aparentemente benignas, lo que plantea dudas sobre su practicidad como plataforma principal de desarrollo.

Momento del lanzamiento y contexto competitivo

  • Muchos señalan el “momento perfecto” del lanzamiento de Claude 2.1 en medio de la turbulencia de OpenAI, viéndolo como una oportunidad para ganar clientes empresariales reacios al riesgo.
  • Otros creen que el momento es en gran medida casual o solo un pequeño ajuste de calendario alrededor de Acción de Gracias.

Calidad del modelo frente a GPT‑4 y otros

  • Varios participantes dicen que Claude 2/2.1 es notablemente peor que GPT‑4 (y a veces incluso GPT‑3.5) para tareas prácticas de programación y razonamiento; más pseudocódigo, restricciones olvidadas, salidas incompletas.
  • Una minoría informa buenos resultados, especialmente para tareas como resumir o revisar varios artículos académicos y el chat general, a veces prefiriendo su tono al de GPT‑4.
  • Algunos sienten que los modelos de código abierto (p. ej., Mistral, variantes de Llama) ya son competitivos o mejores para su uso.

Rechazos, seguridad y “sobrealineación”

  • Un tema importante es la frustración por rechazos frecuentes, a veces extraños: hipotéticos, preparación de exámenes, vocabulario vinculado a “ideologías”, preguntas benignas de seguridad/salud, comandos que rompen procesos, etc.
  • Los críticos describen a Claude como moralizante, discutidor o “parental”, lo que dificulta usarlo como herramienta.
  • Sus defensores dicen que rara vez ven rechazos en dominios estrechos (código, RAG sobre documentos) y valoran que se niegue a inventar información.
  • Algunos argumentan que unas barreras fuertes son aceptables o necesarias para dominios realmente peligrosos (bioweapons, daño grave).

Ventana de contexto, alucinaciones y precisión

  • La ventana de 200k se considera prometedora, pero necesita pruebas independientes; la gente señala que modelos anteriores de contexto largo se degradan después de ~32k tokens.
  • Los gráficos propios de Anthropic sobre menos alucinaciones y rechazos más honestos se ven positivamente, pero no abordan los “falsos positivos” de censura.

Acceso, geografía y APIs

  • Muchos se quejan de que no pueden obtener acceso a la API en absoluto o tienen que esperar semanas/meses; los formularios de solicitud parecen opacos y desalentadores.
  • La falta de disponibilidad en la UE, Canadá, Brasil, etc., además de las restricciones por número de teléfono, es un punto de dolor recurrente.
  • Algunos eluden esto mediante AWS Bedrock y reportan acceso rápido y automatizado; otros siguen enfrentando retrasos.
  • Varios dicen que esto hace que Claude sea demasiado arriesgado como plataforma en comparación con las APIs de OpenAI, de fácil acceso.

Prompts del sistema, prefilling y control

  • Los nuevos prompts del sistema y la capacidad de “prefill” de Anthropic interesan a los usuarios avanzados, tanto para personalizar el comportamiento como para (potencialmente) reducir rechazos.
  • Otros temen que este diseño de prompts aumente el riesgo de inyección de prompts y señalan que OpenAI, en la práctica, concatena de forma similar el texto del sistema y el del usuario.