Sobre o Problema do Prêmio do Milênio de Navier–Stokes

A OpenAI afirma que um sistema interno de IA produziu uma solução verificada em Lean para o Problema do Prêmio do Milênio de Navier–Stokes após executar dezenas de milhares de agentes e gastar milhões de dólares em computação, o que muitos veem como um momento decisivo para as capacidades matemáticas da IA. Ao mesmo tempo, surgem preocupações sérias de que o modelo possa ter sido treinado indiretamente com sessões privadas de ChatGPT/Codex de matemáticos independentes trabalhando em problemas relacionados, e de que a OpenAI então teria corrido para “dar o bote” sobre eles enquanto pressionava por crédito assimétrico de autoria. Comentadores temem que isso estabeleça um precedente que incentiva a secretização na pesquisa, obscurece a linha entre assistência e plágio e mostra o quanto o progresso científico futuro pode se tornar dependente de sistemas corporativos opacos de IA.

Computação, Custo e Metodologia

  • Comentadores estimam cerca de US$ 15 milhões, a preços públicos da Astra, para os ~300 bilhões de tokens de saída; alguns observam que o custo interno da OpenAI é menor, mas ainda assim enorme.
  • O sistema usou cerca de 10.000 agentes concorrentes ao longo de ~88 horas. Alguns veem isso como uma “nação de gênios em um datacenter”; outros argumentam que é força bruta mais forte orientação humana, e não uma AGI “de um tiro” limpa.
  • Vários apontam que a cadeia de prompts, uso de ferramentas e orientação humana não é trivial, e que a postagem do blog minimiza o envolvimento humano.

Disputa de Prioridade e Preocupações com Plágio

  • Uma equipe अलग já vinha trabalhando há cerca de um ano em um trabalho estreitamente relacionado de Euler/NS usando Codex/LLMs; sua declaração pública alega:
    • A OpenAI só iniciou seu esforço depois de ouvir rumores de uma solução do Milênio.
    • Suas sessões de Codex continham rascunhos e ideias-chave.
    • Não houve resposta clara sobre se esses chats foram usados no treinamento.
    • A OpenAI propôs anúncios conjuntos condicionados a remover o coautor afiliado à Anthropic e, supostamente, usou linguagem de ameaça à carreira.
  • As respostas da OpenAI (na postagem e nas redes sociais) afirmam:
    • Eles nunca acessaram chats privados específicos.
    • A prova do modelo e até mesmo o resultado preciso de Euler diferem.
    • Dados de usuários podem ter contribuído com sinais de treinamento “desidentificados”; eles “não podem descartar isso”.
  • O debate se divide:
    • Um lado vê isso como provável vazamento de IP / “front-running” de clientes usando seus próprios dados.
    • O outro lado insiste que não há evidência concreta de má conduta e que alegações exigem prova.

Uso de Dados, Privacidade e Confiança

  • Forte foco no interruptor de treinamento (“melhorar o modelo para todos”) e em se o opt-out realmente impede o uso de dados brutos ou “desidentificados”.
  • Alguns argumentam que a OpenAI poderia e deveria determinar se chats específicos entraram no treinamento; outros dizem que a escala e a desidentificação tornam isso inviável ou violador de privacidade.
  • Muitos concluem que pesquisadores deveriam evitar LLMs proprietários (ou exigir retenção zero de dados estrita) para trabalhos não publicados.

Impacto na Matemática e na Cultura de Pesquisa

  • Reações mistas: admiração diante de um problema do Milênio sendo derrubado; consternação com a forma como aconteceu.
  • Preocupações de que rumores de progresso agora disparem enormes esforços de IA que “achatam” problemas abertos antes que projetos humanos amadureçam, empurrando a matemática para a secrecia (“floresta escura cognitiva”).
  • Alguns dizem que isso mostra o raciocínio de fronteira da IA e sinaliza AGI; outros comparam a Deep Blue ou motores de xadrez: super-humanos em um domínio estreito e bem verificado.

Formalização em Lean e Correção

  • Muitos enfatizam a prova em Lean como forte evidência de correção, possivelmente mais forte do que a revisão por pares tradicional.
  • Outros observam:
    • As afirmações em Lean precisam corresponder exatamente ao problema da Clay, o que ainda requer verificação humana.
    • Bugs passados em assistentes de prova significam que alguma supervisão humana ainda é necessária.

Implicações Sociais Mais Amplas e de Trabalho

  • Debate sobre se isso acelera uma “explosão de inteligência” ameaçando empregos de trabalho intelectual versus apenas empurrando os humanos para tarefas de nível mais alto.
  • Vários veem isso como um momento de virada; outros alertam contra a superinterpretação de um único resultado matemático de alto perfil como AGI geral.