Qual é o maior projeto de software que a IA consegue completar sozinha?
Desenvolvedores estão investigando até onde os modelos atuais de IA conseguem chegar na construção autônoma de software, desde shells, compiladores e motores de recuperação até apps completos e até ambientes semelhantes a sistemas operacionais. Muitos relatam que, embora a IA consiga gerar grandes quantidades de código funcional e clonar sistemas bem especificados quando guiada por testes fortes e arquitetura definida por humanos, ela rapidamente deriva para designs frágeis, duplicados ou incoerentes se for deixada sem supervisão. O consenso emergente é que a IA é mais eficaz como um engenheiro júnior poderoso em fluxos de trabalho liderados por humanos, e que o problema aberto mais difícil é a manutenção de longo prazo, a coerência arquitetural e a definição de requisitos, e não a geração bruta de código.
Escopo de software “AI-complete”
- Vários comentários argumentam que “maior projeto” é a pergunta errada; a questão mais difícil e interessante é quão grande um sistema uma IA consegue manter ao longo do tempo, preservando arquitetura coerente, desempenho e segurança.
- Outros observam que reproduzir software existente com especificações/testes claros é muito mais fácil do que projetar novos produtos com requisitos nebulosos.
Experiências reais com projetos de IA
- Projetos com uso intensivo de IA relatados variam de:
- Um clone do Bash em Rust com milhares de testes e centenas de issues deixadas para agentes corrigirem.
- Um motor de recuperação investigativa com 180k LOC, WAL personalizado, recuperação híbrida, ACLs e ~3.000 testes, avaliado por agências governamentais.
- Uma distribuição Linux completa empacotada como um app de Mac, construída ao longo de ~2 semanas.
- Ferramentas de gestão de portfólio, protótipos FHIR/SNOMED, proxies de cache, clones de jogos, experimentos de compiladores e uma base de código multilíngue com ~2M+ LOC.
- Padrão típico: a IA faz a maior parte da implementação; humanos lidam com arquitetura, especificações e revisões.
Arquitetura, bagunça e saúde de longo prazo
- Muitos relatam que projetos sem supervisão ou “vibe-coded” rapidamente viram espaguete:
- Correções pelo caminho mais curto, remendos improvisados, duplicação, hacks estruturalmente indispensáveis.
- A IA raramente dá um passo atrás para fazer grandes refatorações arquitetônicas por conta própria.
- Alguns dizem que isso se assemelha a engenheiros juniores precisando de दिशाção; outros enfatizam que humanos conseguem projetar e manter autonomamente sistemas complexos de maneiras que os modelos atuais não conseguem.
Testes, harnesses e guardrails
- Há forte consenso de que o sucesso depende de:
- Testes extensivos de unidade/integração, invariantes e comparações ponta a ponta com implementações de referência.
- Tarefas incrementais e de pequeno escopo, além de revisão humana contínua.
- Harnesses/loops que permitam aos agentes executar muitas iterações sob suítes de teste rigorosas.
- Há discordância sobre se “muitos testes” é suficiente sem que humanos entendam profundamente o que está sendo testado.
Capacidades, limites e casos de uso
- Os modelos têm bom desempenho em:
- Componentes pequenos a médios (por exemplo, componentes React de ~500 linhas, endpoints).
- Portes/clones bem especificados com testes existentes robustos.
- Eles enfrentam dificuldades com:
- Arquiteturas novas, domínios grandes e únicos (por exemplo, kernels CAD) e consistência global.
- Operação totalmente autônoma sem correção de rota humana periódica.
Preocupações com benchmarks e dados
- Alguns questionam benchmarks que cobrem apenas programas baseados em texto e que potencialmente dependem de código visto durante o treinamento.
- Vários destacam que benchmarks com orçamentos triviais são irreais; avaliações sérias precisam permitir grandes espaços de busca e execuções longas.