Painel ao vivo de pós-treinamento do Xiaomi Mimo 2.6

A Xiaomi lançou um painel ao vivo mostrando execuções de reinforcement learning de pós-treinamento para seus modelos de código MiMo 2.6, revelando custos, progresso e pontuações de benchmarks em tempo real em uma indústria que normalmente é opaca. Comentadores elogiam a transparência e a forte relação custo-desempenho dos modelos MiMo anteriores, comparam-nos a concorrentes como DeepSeek, GLM, Qwen e Gemini, e debatem questões como contaminação de benchmarks, composição de dados e possível distilação a partir de modelos de fronteira. Alguns são céticos quanto a o painel refletir dados ao vivo, mas muitos veem isso como um contraste notável com o sigilo dos grandes laboratórios dos EUA e um sinal de crescente abertura das empresas chinesas de IA.

Reação geral ao painel

  • Muitos consideram o painel ao vivo de pós-treinamento / RL “notavelmente transparente” e “legal”, especialmente em uma indústria geralmente sigilosa.
  • Vários usuários dizem que estão aprendendo muito sobre a dinâmica do treinamento apenas observando a execução.
  • Outros veem isso principalmente como uma jogada inteligente de PR, e não como uma mudança fundamental.

Transparência, abertura e motivações

  • Alguns se perguntam por que outros laboratórios (OpenAI, Anthropic, Google, IBM) não fazem painéis semelhantes; foram propostas razões:
    • Grandes laboratórios dos EUA acreditam ter uma “salsa especial” e ganham pouco ao expor a metodologia.
    • Laboratórios menores/chineses se beneficiam mais da abertura como diferencial e marketing.
  • Sugere-se que a política chinesa agora favorece explicitamente modelos abertos e desenvolvimento aberto, criando incentivos para uma abertura visível.

Dados de treinamento, RL e benchmarks

  • Esclarecimento de que se trata de uma execução de RL de pós-treinamento, não de pré-treinamento, embora alguns observem que até o pré-treinamento muitas vezes usa 30–50% de código.
  • Debate sobre se executar benchmarks durante o treinamento é “contaminação”:
    • Um ponto de vista: benchmarks funcionam como sinais de validação/parada antecipada, causando um leve overfitting, mas muito menos do que treinar diretamente neles.
    • Outro ponto de vista: mesmo como critério de parada, eles ajustam implicitamente o modelo para esses benchmarks e contribuem para o “benchmaxxing”.
  • Os benchmarks também são apresentados como necessários para detectar degradação ou lotes de dados ruins.

Autenticidade e confiabilidade do painel

  • Um subconjunto de comentaristas suspeita que o painel seja parcial ou totalmente falso (por exemplo, progresso saltando para trás ao atualizar, reinícios que não batem com os gráficos, comportamento de “ticker”).
  • Outros contrapõem que tickers intermediários podem ser sintéticos enquanto atualizações reais periódicas de dados ainda são genuínas, comparando isso a uma barra de progresso.
  • No geral, considera-se अस्प? elucidative? [No correction needed—translate only] se o feed é totalmente em tempo real e fiel ainda não está claro.

Qualidade do modelo e benchmarks

  • As pontuações DeepSWE para MiMo 2.6 parecem muito altas em comparação com os 19% reportados do MiMo 2.5 Pro, colocando-o perto dos modelos de codificação “de fronteira” nesse benchmark.
  • Alguns argumentam que o DeepSWE agora está saturado e é menos discriminativo no topo; ainda assim, continua útil para distinguir modelos intermediários dos de primeira linha.

Preço, ROI e uso prático

  • Vários usuários relatam o MiMo 2.5 (e o 2.5 Pro) como fortes cavalos de batalha para programação, com excelente custo por token, especialmente em relação a modelos dos EUA e de outros modelos chineses.
  • Padrão comum: usar um modelo mais capaz ou caro para planejamento/design e depois o MiMo para implementação obediente ou tarefas em segundo plano.
  • As comparações são feitas com DeepSeek, GLM, Qwen, Gemini etc., com trade-offs entre qualidade, preço e velocidade.
  • Alguns veem modelos abertos e mais baratos como cada vez mais atraentes para empresas: desempenho previsível, ajustabilidade, privacidade, precificação fixa com hardware próprio.

Geopolítica e contraste do setor

  • Vários comentários enquadram os laboratórios chineses como “aparecendo” os laboratórios dos EUA por serem mais abertos e experimentais, enquanto os laboratórios dos EUA se concentram em retórica de segurança, modelos fechados e valuation.
  • Outros rebatem, observando que muitos modelos chineses são vistos como distilações de modelos “de fronteira” dos EUA, levando a um debate sobre quem realmente lidera e quem copia.