Kimi Linear: Una arquitectura de atención expresiva y eficiente (2025)

Kimi Linear presenta una arquitectura de atención de código abierto y más eficiente que sustenta el nuevo modelo Kimi K3 de Moonshot, que añade mejoras a gran escala como Stable LatentMoE, visión nativa y aprendizaje por refuerzo extensivo. Los comentaristas destacan la rápida polinización cruzada entre arquitecturas como DeltaNet, Mamba y diseños tipo RNN, y señalan que gran parte de la “inteligencia” de los modelos de frontera parece surgir del mero escalado y de objetivos de entrenamiento bien elegidos más que de una única idea revolucionaria. Junto con el elogio técnico, hay un debate controvertido sobre la destilación de modelos, la propiedad intelectual y las distintas normas regulatorias y de censura entre los laboratorios de IA chinos y occidentales.

Relación entre Kimi K3 y Kimi Linear

  • Se describe a Kimi K3 como fuertemente basado en Kimi Linear, escalándolo e incorporando visión, mejoras de RL y Stable LatentMoE.
  • K3 usa capas de “Kimi Delta Attention”, pero la variante específica de KDA difiere de la de Kimi Linear; se dice que estas diferencias se detallan en el informe técnico de K3.
  • Algunos señalan que el artículo de Kimi Linear es del año anterior y que muchas contribuciones en estos modelos se realizan mucho antes de los lanzamientos de producto.

Evolución de la arquitectura (DeltaNet, Gated DeltaNet, linaje RNN)

  • Los comentaristas ven Kimi Linear y trabajos relacionados (DeltaNet, Gated DeltaNet, modelos tipo Mamba) como descendientes de RNNs/LSTMs, reformulando la atención como actualizaciones recurrentes.
  • Se informa que Gated DeltaNet 2 supera a Kimi Linear en pruebas internas, y Kimi Linear se presenta como un paso anterior en esta progresión.
  • Se valora lo rápido que las empresas iteran e integran las ideas arquitectónicas de unas y otras.

Stable LatentMoE y estrategia de entrenamiento

  • La principal innovación atribuida a K3 es Stable LatentMoE: comprimir datos entre capas con una estrategia de enrutamiento de expertos más equilibrada.
  • El hilo señala que la mayor parte del progreso reciente proviene del entrenamiento de RL en fases tardías: múltiples modelos expertos, herramientas en sandbox, datos de preferencias humanas y trazas de agentes.

Destilación, PI y ética

  • Una gran parte de la discusión debate los “ataques de destilación”: entrenar un modelo con las salidas de otro modelo.
  • Un lado: se presenta esto como un “ataque” y como aprovecharse injustamente del costoso entrenamiento y de licencias pagadas de datos; especialmente sensible en un contexto de competitividad China-Occidente.
  • El otro lado: sostiene que esto es análogo a cómo los LLM ya entrenan con datos producidos por humanos (a menudo no remunerados); ve hipocresía en exigir protección de PI para los modelos pero no para los datos humanos subyacentes.
  • Varios cuestionan el lenguaje de “ataque”, sugiriendo términos neutrales como “variantes destiladas” y considerando las violaciones de los Términos de Servicio como asuntos civiles, no penales.

Censura y barreras de seguridad del modelo

  • Algunos usuarios afirman que los modelos chinos están menos censurados, especialmente cuando se autoalojan; otros señalan ejemplos de evasivas políticas o restricciones a nivel de API.
  • La opinión general: la mayor parte de la “censura” parece aplicarse en las capas de API/servicio más que en los pesos del modelo base.

Escalado, capacidades emergentes y teoría

  • Múltiples comentarios vinculan la “inteligencia” de los modelos de frontera con las leyes de escalado y la “Bitter Lesson”: el aprendizaje de propósito general más cómputo supera a los algoritmos hechos a medida.
  • Las capacidades emergentes (p. ej., razonamiento complejo, chain-of-thought) se discuten como:
    • Surgiendo cuando los modelos ganan suficiente capacidad para representar circuitos internos más ricos.
    • Reflejando una disminución de la “entropía excedente” con la escala y los datos (“slingshot generalization”).
    • Apareciendo de forma súbita en ciertos benchmarks, pero sustentadas en mejoras graduales de capacidades genéricas.
  • Algunos lo comparan con aproximación de funciones, grokking, descenso de gradiente y métodos de búsqueda/ascenso por colinas.

Seguridad y discusión secundaria sobre HTTPS

  • Breve tangente sobre acceder a un ensayo influyente por HTTP frente a HTTPS.
  • Un lado minimiza el riesgo para texto estático; otro enfatiza amenazas de MITM/inyección de scripts incluso para páginas aparentemente simples.

Código abierto e impacto en el ecosistema

  • Se elogia como “genial” y inusualmente detallada la publicación de kernels, integración con vLLM y checkpoints de Kimi Linear, en comparación con la comunicación de algunos laboratorios occidentales.
  • Se especula que el auge de arquitecturas no estándar (atención lineal, modelos tipo RNN) podría desafiar las pilas de hardware y compiladores optimizadas para transformers estándar; se plantean implicaciones para proveedores de hardware especializado, aunque no se resuelven.

Preguntas abiertas y puntos poco claros

  • Sigue sin responderse una pregunta directa sobre cómo rinde Kimi Linear en recuperación de contexto largo (needle-in-haystack, pruebas ruler) frente a la atención completa.
  • Se reconoce que sigue sin estar clara la contribución cuantitativa exacta de la destilación frente a los datos novedosos/la arquitectura en el rendimiento de los modelos chinos.