K2 Horizon: Una flota conectada de seis modelos abiertos
Una nueva familia de modelos de lenguaje K2 Horizon “radicalmente abiertos” está llamando la atención tanto por publicar pesos y grandes partes de los datos de entrenamiento, como por aspirar a ofrecer un pipeline de entrenamiento totalmente transparente. Los comentaristas celebran otro competidor serio de stack abierto —especialmente un modelo de 7B que rinde de forma competitiva en código con hardware modesto—, pero señalan que las variantes más grandes aún quedan por detrás de los mejores modelos abiertos como Qwen y que algunos repositorios y recetas siguen incompletos. El lanzamiento también reaviva debates más amplios sobre si los modelos totalmente abiertos pueden o deben incluir datos de entrenamiento, cómo se aplican el copyright y el uso legítimo, y si la rápida avalancha de nuevos LLM está llevando a una “fatiga de modelos”.
Fatiga de modelos, hype y analogía con ciclos tecnológicos pasados
- Varios comentaristas expresan “fatiga de modelos” por los lanzamientos nuevos constantes.
- Se hacen comparaciones con épocas anteriores del hype de CPU y smartphones: los lanzamientos iniciales eran eventos enormes, ahora solo los especialistas siguen cada chip/teléfono nuevo.
- Expectativa de que los LLM sigan una trayectoria similar: la mayoría de los usuarios simplemente elegirá modelos “suficientemente buenos”.
- Algunos señalan que “no tienes que prestar atención”; lo que construyas con los modelos importa más que perseguir lanzamientos de frontera.
Apertura, datos de entrenamiento y afirmaciones de “radicalmente abierto”
- Fuerte apoyo a stacks totalmente abiertos: pesos, código, datos de entrenamiento y recetas, para reducir la manipulación de caja negra.
- Escepticismo hacia el marketing de “radicalmente abierto” hasta que los datos de entrenamiento y las recetas completas se publiquen de verdad.
- Se señala que los conjuntos de datos de entrenamiento de K2 ya están en Hugging Face, pero los repos de pre/post-training siguen siendo marcadores de posición.
- Trabajos previos del mismo ecosistema (por ejemplo, modelos K2 anteriores) hacen que algunos esperen que las recetas completas lleguen eventualmente, pero reservan el juicio.
Rendimiento y benchmarks
- Se informa que el dense de 32B queda rezagado (según sus propias gráficas) frente a competidores abiertos más fuertes como Qwen 3.8 27B; Gemma 4 31B no está en el conjunto de comparación.
- Algunos sostienen que el 32B está etiquetado como “stage 1” y sin terminar, así que el lanzamiento temprano es principalmente para mostrar el pipeline abierto.
- El modelo de 7B es mencionado repetidamente como impresionante, potencialmente el “mejor por debajo de 10B” y competitivo en benchmarks de código (por ejemplo, puntuaciones de SWE-bench-verified comparables a modelos mucho más grandes).
- Otros destacan que las comparaciones omiten modelos abiertos nuevos y fuertes, y que las clases/variantes de cuantización no están emparejadas de forma consistente.
Capacidades de codificación y modelos pequeños
- Unos pocos usuarios prueban modelos más pequeños (3.7B, 7B) con problemas de codificación estilo entrevista.
- Informes: el 3.7B falla tareas básicas, alucina APIs y se atasca; el 7B da respuestas mixtas o parcialmente correctas.
- Debate sobre si los modelos por debajo de 10B son adecuados para codificación seria o solo para autocompletado/resumen.
- Algunos lo comparan con otros modelos pequeños de código que ya manejan bien esas tareas.
Herramientas, despliegue y aspectos prácticos
- Interés en ejecutar K2 localmente; los usuarios mencionan soporte para vLLM y soporte reciente de dflash2 para otros modelos.
- Frustración porque los nuevos lanzamientos suelen soportar vLLM rápidamente pero tardan en llegar a llama.cpp, que es clave para hardware antiguo/de gama baja.
- Observaciones de que la demo alojada de K2 es extremadamente rápida cuando funciona, aunque al principio algunos modelos no estaban disponibles.
Debates más amplios sobre IP, copyright y datos sintéticos
- Largo subhilo sobre si los modelos totalmente abiertos son siquiera posibles bajo la ley de copyright actual.
- Ideas discutidas:
- Usar LLMs para generar datos de entrenamiento sintéticos a partir de fuentes no permisivas.
- Corpora totalmente sintéticos o solo de dominio público.
- Entrenamiento y almacenamiento descentralizados.
- Propuestas controvertidas para tratar todos los datos de internet alcanzables públicamente como dominio público son impulsadas y fuertemente criticadas por ser imprácticas y distópicas.
- Algunos señalan proyectos existentes (por ejemplo, OLMo/Dolma y similares) como prueba parcial de concepto de pipelines transparentes, aunque el contenido raspado subyacente no sea completamente redistribuible.
Notas varias
- Algunos se quejan de gráficos del blog faltantes/bloqueados y de visuales pequeños y difíciles de leer.
- Confusión con el nombre (“K2” ya se usa en otro lugar).
- Se aprecia que este lanzamiento coincida con grandes caídas de LLM cerrados, reforzando el valor percibido de los modelos abiertos.