Cognition lanza el nuevo modelo SWE-2, rivalizando con Fable 5.1 y GPT-Astra
El nuevo modelo de código SWE-2 de Cognition, construido mediante post-training sobre Kimi K3, se está comercializando como rival de los principales modelos frontier como GPT-Astra y Fable 5.1, pero muchos ingenieros cuestionan si sus puntuaciones destacadas provienen de una capacidad genuina o de “benchmaxxing” frente a benchmarks antiguos y saturados. Los comentaristas señalan su fuerte caída en el nuevo Terminal Bench 4 y sus pesos cerrados, argumentando que modelos abiertos como DeepSeek V4.1 Flash ofrecen mejor relación precio-rendimiento y más control. Otros observan que SWE-1.x ya era bastante usable, ven valor en que Cognition opere su propia pila ajustada para reducir la dependencia de OpenAI/Anthropic, pero les frustra que SWE-2 esté fuertemente ligado a las herramientas Devin de Cognition en lugar de a APIs estándar o distribución abierta.
Benchmarks, “Benchmaxxing” y generalización
- Muchos comentaristas cuestionan el benchmark FrontierCode publicado por Cognition, señalando que es interno, no reproducible y presenta a SWE‑2 como “rival de Astra/Fable”.
- La brecha entre Terminal Bench 2.1 (≈93%) y Terminal Bench 4 (≈27%) se cita repetidamente como una señal de alerta de sobreajuste/“benchmaxxing” y de mala generalización a problemas nuevos.
- Otros señalan que modelos punteros como Sol y GLM también caen bruscamente de TB2.1 a TB4, argumentando que es un problema de todo el ecosistema y que TB4 aún no está saturado.
- Algunos consideran que los benchmarks de código son cada vez números de marketing con poca señal; en su lugar, abogan por construir cargas de trabajo personalizadas.
Origen del modelo, entrenamiento y capacidades
- SWE‑2 se describe como “post-trained from Kimi K3”, lo que lleva a debatir sobre post-training frente a distillation y fine-tuning, y sobre cuánta capacidad extra puede aportar el RL/post-training.
- Hay debate sobre si un modelo de ~2.8T parámetros puede realmente igualar a modelos de la clase de ~10T; algunos son escépticos de que solo con RL se pueda cerrar esa brecha.
Acceso, integración del producto y lock-in
- Actualmente, SWE‑2 es accesible principalmente a través del ecosistema Devin de Cognition (CLI, escritorio/nube), no mediante APIs estándar o agregadores como OpenRouter.
- A algunos usuarios no les gusta tener que usar un CLI/harness a medida solo para probar el modelo de un único laboratorio y piden una API sencilla estilo chat/completions.
- Hay confusión sobre los precios: se afirma que SWE‑2 es gratis durante un mes vía CLI, con descuento en la nube y gratis en el dispositivo, pero algunos usuarios informan que se les cobró.
Pesos abiertos vs cerrados y modelos base chinos
- Varios comentaristas preguntan si SWE‑2 tiene open-weights; expresan decepción si es cerrado, especialmente al compararlo con DeepSeek V4.1 Flash y otros modelos chinos abiertos.
- La discusión señala que muchas startups estadounidenses ahora hacen post-training o envuelven modelos abiertos chinos potentes (Kimi, GLM, etc.) en lugar de entrenar desde cero.
Experiencia de producto con Devin/Windsurf
- Las experiencias con Devin/Windsurf son mixtas: algunos usuarios empresariales e individuales lo encuentran útil como agente de programación, especialmente con modelos frontera integrados.
- Otros informan graves problemas de UX y fiabilidad con el harness de CLI/escritorio, falta de funciones clave y demos anteriores exageradas, lo que genera desconfianza.
Contexto económico y competitivo
- Los comentaristas ven SWE‑2 en parte como una forma de que Cognition reduzca su dependencia de las API de OpenAI/Anthropic.
- Hay un debate más amplio sobre las relaciones coste-rendimiento, y muchos elogian DeepSeek 4.1 Flash como una alternativa fuerte y barata, además de predecir presión sobre los precios de los laboratorios cerrados.