Moonshot AI suspende nuevas suscripciones debido a la demanda de Kimi K3

El nuevo modelo Kimi K3 de Moonshot AI ha atraído una demanda tan intensa que la empresa ha pausado las nuevas suscripciones para preservar la calidad del servicio para los usuarios existentes, lo que ha provocado comparaciones con las estrategias de capacidad de OpenAI, Anthropic y otros grandes proveedores. Los comentaristas informan de un fuerte rendimiento en programación y en contextos largos, especialmente en flujos de trabajo multiagente y agentic, pero se quejan de respuestas lentas y topes de uso ajustados en los planes de nivel bajo, que pueden agotar las cuotas rápidamente. El auge también alimenta debates más amplios sobre modelos de pesos abiertos, sostenibilidad de precios, límites de infraestructura y si los modelos fronterizos chinos pueden erosionar la ventaja de los incumbentes.

Aumento de la demanda y pausa de suscripciones

  • La demanda de Kimi K3 ha llevado a Moonshot AI casi al límite de capacidad; han pausado las nuevas suscripciones para preservar la calidad para los usuarios existentes.
  • Muchos comentaristas elogian esto como algo favorable para el cliente en comparación con reducir silenciosamente los límites, aunque algunos señalan que también podrían haber restringido el acceso a K3 o ajustado los límites en su lugar.
  • Algunos suscriptores actuales informan que todavía pueden actualizar o ampliar sus planes.

Precios, cuotas y valor

  • Los usuarios del nivel de aproximadamente $20/mes informan que agotan los topes diarios de 5 horas con unas pocas tareas complejas, especialmente con K3 y flujos de trabajo multiagente.
  • Existe confusión en torno a varios tipos de planes (investigación vs programación, nombres antiguos vs nuevos), prioridades y topes superpuestos (5 horas, semanales, mensuales).
  • Varias personas consideran que los niveles más bajos ofrecen poco valor para K3 y recomiendan niveles más altos o uso medido en su lugar.
  • Algunos creen que K3 está infrapreciado dada la demanda; otros lo comparan desfavorablemente con modelos más baratos como DeepSeek para algunas cargas de trabajo.

Rendimiento, velocidad y flujos de trabajo

  • A muchos les impresiona la calidad de K3, especialmente para revisión de código, revisión de PR e informes de investigación complejos (por ejemplo, ejecuciones de varias horas que generan resultados de longitud de libro).
  • Una queja importante es la lentitud bajo carga, especialmente a través de los harness oficiales; algunos creen que el cuello de botella es el harness o las cuotas más que el modelo en bruto.
  • Los usuarios describen prácticas muy diferentes: algunos dejan que los agentes funcionen 30 minutos o incluso horas sin supervisión, mientras que otros encuentran que las ejecuciones largas degradan la calidad y prefieren sesiones cortas y muy acotadas.

Comportamiento del modelo, seguridad y “slop”

  • K3 se describe como aproximadamente capaz al nivel de Opus para algunas tareas de programación y menos “sloppy” en la redacción, pero las opiniones difieren sobre si justifica costes más altos frente a la competencia.
  • Algunos dicen que K3 está menos censurado que los modelos de Anthropic; otros dicen que se ha vuelto más censurado que las versiones anteriores de Kimi y que “suena como Claude”.

Implicaciones de arquitectura y pesos abiertos

  • Los comentaristas técnicamente inclinados destacan el uso intensivo de K3 de capas de tipo RNN/atención lineal (delta attention), vinculándolo conceptualmente con xLSTM, variantes tipo Mamba y arquitecturas al estilo Qwen.
  • Se discute que los transformers estaban destinados a reemplazar a las RNN no paralelizables, pero nuevas técnicas permiten variantes de RNN paralelizables.
  • Los pesos abiertos se consideran cruciales: una vez liberados, los proveedores de inferencia de terceros y el autoalojamiento pueden aliviar los cuellos de capacidad y distribuir el cómputo.

Mercado y geopolítica

  • Algunos especulan que los laboratorios de EE. UU. mantienen ventaja principalmente en escalado, fiabilidad y contratos con hyperscalers, mientras que los modelos chinos de pesos abiertos los presionan en precio y apertura.
  • Hay frustración porque Europa no ha financiado proyectos xLSTM a gran escala ni supercomputación de IA dedicada, con sugerencias detalladas de chips e infraestructura respaldados por la UE; la viabilidad está en debate.