Panel de control en vivo de postentrenamiento de Xiaomi Mimo 2.6

Xiaomi ha lanzado un panel en vivo que muestra ejecuciones de aprendizaje por refuerzo de postentrenamiento para sus modelos de codificación MiMo 2.6, revelando costes, progreso y puntuaciones de benchmarks en una industria que normalmente es opaca. Los comentaristas elogian la transparencia y la fuerte relación coste-rendimiento de los modelos MiMo anteriores, los comparan con competidores como DeepSeek, GLM, Qwen y Gemini, y debaten cuestiones como la contaminación de benchmarks, la composición de datos y una posible destilación a partir de modelos frontier. Algunos son escépticos sobre si el panel refleja datos en vivo, pero muchos lo ven como un contraste notable con el secretismo de los grandes laboratorios estadounidenses y una señal de la creciente apertura de las empresas chinas de IA.

Reacción general al panel de control

  • Muchos consideran que el panel de control de postentrenamiento/RL en vivo es “extraordinariamente transparente” y “genial”, especialmente en una industria generalmente reservada.
  • Varios usuarios dicen que están aprendiendo mucho sobre la dinámica del entrenamiento solo con ver la ejecución.
  • Otros lo ven principalmente como una maniobra de PR ingeniosa más que como un cambio fundamental.

Transparencia, apertura y motivaciones

  • Algunos se preguntan por qué otros laboratorios (OpenAI, Anthropic, Google, IBM) no hacen paneles similares; se proponen varias razones:
    • Los grandes laboratorios de EE. UU. creen que tienen una “salsa especial” y ganan poco al exponer su metodología.
    • Los laboratorios más pequeños/chinos se benefician más de la apertura como diferenciador y como marketing.
  • Se sugiere que la política china ahora favorece explícitamente los modelos abiertos y el desarrollo abierto, creando incentivos para una apertura visible.

Datos de entrenamiento, RL y benchmarks

  • Se aclara que esto es una ejecución de RL de postentrenamiento, no de preentrenamiento, aunque algunos señalan que incluso el preentrenamiento suele usar entre un 30 % y un 50 % de código.
  • Hay debate sobre si ejecutar benchmarks durante el entrenamiento es “contaminación”:
    • Una postura: los benchmarks actúan como señales de validación/parada temprana, causando un ligero sobreajuste, pero mucho menos que entrenar directamente sobre ellos.
    • Otra postura: incluso como criterios de parada, ajustan implícitamente hacia esos benchmarks y contribuyen al “benchmaxxing”.
  • Los benchmarks también se presentan como necesarios para detectar degradación o lotes de datos defectuosos.

Autenticidad y fiabilidad del panel de control

  • Un subconjunto de comentaristas sospecha que el panel es parcial o totalmente falso (por ejemplo, el progreso salta hacia atrás al actualizar, los reinicios no coinciden con los gráficos, comportamiento de “ticker”).
  • Otros responden que los tickers intermedios pueden ser sintéticos mientras que las actualizaciones periódicas con datos reales siguen siendo auténticas, comparándolo con una barra de progreso.
  • En general, se considera poco claro si el feed es totalmente en tiempo real y fiel.

Calidad del modelo y benchmarks

  • Las puntuaciones de DeepSWE para MiMo 2.6 parecen muy altas en comparación con el 19 % reportado por MiMo 2.5 Pro, situándolo cerca de los modelos de codificación “frontier” en ese benchmark.
  • Algunos argumentan que DeepSWE ahora está saturado y discrimina menos en la parte alta; aun así, sigue siendo útil para distinguir entre modelos de nivel medio y de nivel superior.

Precio, ROI y uso práctico

  • Varios usuarios informan que MiMo 2.5 (y 2.5 Pro) son excelentes caballos de batalla para programación, con un coste por token muy bueno, especialmente en relación con modelos de EE. UU. y otros modelos chinos.
  • Patrón común: usar un modelo más capaz o caro para planificación/diseño, y luego MiMo para implementación obediente o tareas en segundo plano.
  • Se hacen comparaciones con DeepSeek, GLM, Qwen, Gemini, etc., con compensaciones entre calidad, precio y velocidad.
  • Algunos ven los modelos de pesos abiertos y más baratos como cada vez más atractivos para empresas: rendimiento predecible, ajustabilidad, privacidad y precios fijos con hardware propio.

Geopolítica y contraste de la industria

  • Varios comentarios presentan a los laboratorios chinos como si estuvieran “superando” a los laboratorios de EE. UU. por ser más abiertos y experimentales, mientras que los laboratorios estadounidenses se centran en la retórica de seguridad, los modelos cerrados y la valoración.
  • Otros matizan esto, señalando que muchos modelos chinos se consideran destilaciones de modelos “frontier” de EE. UU., lo que lleva a debatir quién lidera realmente y quién copia.