Painel ao vivo de pós-treinamento do Xiaomi Mimo 2.6
A Xiaomi lançou um painel ao vivo mostrando execuções de reinforcement learning de pós-treinamento para seus modelos de código MiMo 2.6, revelando custos, progresso e pontuações de benchmarks em tempo real em uma indústria que normalmente é opaca. Comentadores elogiam a transparência e a forte relação custo-desempenho dos modelos MiMo anteriores, comparam-nos a concorrentes como DeepSeek, GLM, Qwen e Gemini, e debatem questões como contaminação de benchmarks, composição de dados e possível distilação a partir de modelos de fronteira. Alguns são céticos quanto a o painel refletir dados ao vivo, mas muitos veem isso como um contraste notável com o sigilo dos grandes laboratórios dos EUA e um sinal de crescente abertura das empresas chinesas de IA.
Reação geral ao painel
- Muitos consideram o painel ao vivo de pós-treinamento / RL “notavelmente transparente” e “legal”, especialmente em uma indústria geralmente sigilosa.
- Vários usuários dizem que estão aprendendo muito sobre a dinâmica do treinamento apenas observando a execução.
- Outros veem isso principalmente como uma jogada inteligente de PR, e não como uma mudança fundamental.
Transparência, abertura e motivações
- Alguns se perguntam por que outros laboratórios (OpenAI, Anthropic, Google, IBM) não fazem painéis semelhantes; foram propostas razões:
- Grandes laboratórios dos EUA acreditam ter uma “salsa especial” e ganham pouco ao expor a metodologia.
- Laboratórios menores/chineses se beneficiam mais da abertura como diferencial e marketing.
- Sugere-se que a política chinesa agora favorece explicitamente modelos abertos e desenvolvimento aberto, criando incentivos para uma abertura visível.
Dados de treinamento, RL e benchmarks
- Esclarecimento de que se trata de uma execução de RL de pós-treinamento, não de pré-treinamento, embora alguns observem que até o pré-treinamento muitas vezes usa 30–50% de código.
- Debate sobre se executar benchmarks durante o treinamento é “contaminação”:
- Um ponto de vista: benchmarks funcionam como sinais de validação/parada antecipada, causando um leve overfitting, mas muito menos do que treinar diretamente neles.
- Outro ponto de vista: mesmo como critério de parada, eles ajustam implicitamente o modelo para esses benchmarks e contribuem para o “benchmaxxing”.
- Os benchmarks também são apresentados como necessários para detectar degradação ou lotes de dados ruins.
Autenticidade e confiabilidade do painel
- Um subconjunto de comentaristas suspeita que o painel seja parcial ou totalmente falso (por exemplo, progresso saltando para trás ao atualizar, reinícios que não batem com os gráficos, comportamento de “ticker”).
- Outros contrapõem que tickers intermediários podem ser sintéticos enquanto atualizações reais periódicas de dados ainda são genuínas, comparando isso a uma barra de progresso.
- No geral, considera-se अस्प? elucidative? [No correction needed—translate only] se o feed é totalmente em tempo real e fiel ainda não está claro.
Qualidade do modelo e benchmarks
- As pontuações DeepSWE para MiMo 2.6 parecem muito altas em comparação com os 19% reportados do MiMo 2.5 Pro, colocando-o perto dos modelos de codificação “de fronteira” nesse benchmark.
- Alguns argumentam que o DeepSWE agora está saturado e é menos discriminativo no topo; ainda assim, continua útil para distinguir modelos intermediários dos de primeira linha.
Preço, ROI e uso prático
- Vários usuários relatam o MiMo 2.5 (e o 2.5 Pro) como fortes cavalos de batalha para programação, com excelente custo por token, especialmente em relação a modelos dos EUA e de outros modelos chineses.
- Padrão comum: usar um modelo mais capaz ou caro para planejamento/design e depois o MiMo para implementação obediente ou tarefas em segundo plano.
- As comparações são feitas com DeepSeek, GLM, Qwen, Gemini etc., com trade-offs entre qualidade, preço e velocidade.
- Alguns veem modelos abertos e mais baratos como cada vez mais atraentes para empresas: desempenho previsível, ajustabilidade, privacidade, precificação fixa com hardware próprio.
Geopolítica e contraste do setor
- Vários comentários enquadram os laboratórios chineses como “aparecendo” os laboratórios dos EUA por serem mais abertos e experimentais, enquanto os laboratórios dos EUA se concentram em retórica de segurança, modelos fechados e valuation.
- Outros rebatem, observando que muitos modelos chineses são vistos como distilações de modelos “de fronteira” dos EUA, levando a um debate sobre quem realmente lidera e quem copia.