Claude 2.1
El lanzamiento por parte de Anthropic de Claude 2.1, un modelo de lenguaje grande con una ventana de contexto de 200k tokens y menos alucinaciones, se está comparando con GPT‑4/Turbo de OpenAI en términos de capacidad de programación, profundidad de razonamiento, velocidad y fiabilidad. Muchos comentaristas consideran que Claude es más débil que GPT‑4 para programación compleja y conocimiento general, pero elogian su gran contexto y su tono, especialmente cuando se usa a través de AWS Bedrock. Una gran fuente de frustración es el acceso restrictivo de Anthropic, las limitaciones regionales (especialmente en la UE y Canadá) y los filtros de seguridad agresivos que desencadenan rechazos frecuentes ante consultas aparentemente benignas, lo que plantea dudas sobre su practicidad como plataforma principal de desarrollo.
Momento del lanzamiento y contexto competitivo
- Muchos señalan el “momento perfecto” del lanzamiento de Claude 2.1 en medio de la turbulencia de OpenAI, viéndolo como una oportunidad para ganar clientes empresariales reacios al riesgo.
- Otros creen que el momento es en gran medida casual o solo un pequeño ajuste de calendario alrededor de Acción de Gracias.
Calidad del modelo frente a GPT‑4 y otros
- Varios participantes dicen que Claude 2/2.1 es notablemente peor que GPT‑4 (y a veces incluso GPT‑3.5) para tareas prácticas de programación y razonamiento; más pseudocódigo, restricciones olvidadas, salidas incompletas.
- Una minoría informa buenos resultados, especialmente para tareas como resumir o revisar varios artículos académicos y el chat general, a veces prefiriendo su tono al de GPT‑4.
- Algunos sienten que los modelos de código abierto (p. ej., Mistral, variantes de Llama) ya son competitivos o mejores para su uso.
Rechazos, seguridad y “sobrealineación”
- Un tema importante es la frustración por rechazos frecuentes, a veces extraños: hipotéticos, preparación de exámenes, vocabulario vinculado a “ideologías”, preguntas benignas de seguridad/salud, comandos que rompen procesos, etc.
- Los críticos describen a Claude como moralizante, discutidor o “parental”, lo que dificulta usarlo como herramienta.
- Sus defensores dicen que rara vez ven rechazos en dominios estrechos (código, RAG sobre documentos) y valoran que se niegue a inventar información.
- Algunos argumentan que unas barreras fuertes son aceptables o necesarias para dominios realmente peligrosos (bioweapons, daño grave).
Ventana de contexto, alucinaciones y precisión
- La ventana de 200k se considera prometedora, pero necesita pruebas independientes; la gente señala que modelos anteriores de contexto largo se degradan después de ~32k tokens.
- Los gráficos propios de Anthropic sobre menos alucinaciones y rechazos más honestos se ven positivamente, pero no abordan los “falsos positivos” de censura.
Acceso, geografía y APIs
- Muchos se quejan de que no pueden obtener acceso a la API en absoluto o tienen que esperar semanas/meses; los formularios de solicitud parecen opacos y desalentadores.
- La falta de disponibilidad en la UE, Canadá, Brasil, etc., además de las restricciones por número de teléfono, es un punto de dolor recurrente.
- Algunos eluden esto mediante AWS Bedrock y reportan acceso rápido y automatizado; otros siguen enfrentando retrasos.
- Varios dicen que esto hace que Claude sea demasiado arriesgado como plataforma en comparación con las APIs de OpenAI, de fácil acceso.
Prompts del sistema, prefilling y control
- Los nuevos prompts del sistema y la capacidad de “prefill” de Anthropic interesan a los usuarios avanzados, tanto para personalizar el comportamiento como para (potencialmente) reducir rechazos.
- Otros temen que este diseño de prompts aumente el riesgo de inyección de prompts y señalan que OpenAI, en la práctica, concatena de forma similar el texto del sistema y el del usuario.