¿Cuál es el proyecto de software más grande que la IA puede completar por sí sola?
Los desarrolladores están explorando hasta dónde pueden llegar los modelos de IA actuales al construir software de forma autónoma, desde shells, compiladores y motores de recuperación hasta apps completas e incluso entornos similares a sistemas operativos. Muchos informan que, aunque la IA puede generar grandes cantidades de código funcional y clonar sistemas bien especificados cuando se guía por pruebas sólidas y una arquitectura diseñada por humanos, rápidamente deriva hacia diseños frágiles, duplicados o incoherentes si se deja sin supervisión. El consenso emergente es que la IA es más efectiva como un potente ingeniero junior dentro de flujos de trabajo liderados por humanos, y que el problema abierto más difícil es el mantenimiento a largo plazo, la coherencia arquitectónica y la definición de requisitos, más que la mera generación de código.
Alcance del software “AI-complete”
- Varios comentarios sostienen que “proyecto más grande” es la pregunta equivocada; la cuestión más difícil e interesante es qué tan grande puede ser un sistema que una IA pueda mantener a lo largo del tiempo, preservando una arquitectura coherente, el rendimiento y la seguridad.
- Otros señalan que reproducir software existente con especificaciones/pruebas claras es mucho más fácil que diseñar productos nuevos con requisitos difusos.
Experiencias reales con proyectos de IA
- Los proyectos intensivos en IA informados van desde:
- Un clon de Bash en Rust con miles de pruebas y cientos de incidencias dejadas para que los agentes las arreglen.
- Un motor de recuperación investigativa de 180k LOC con WAL personalizado, recuperación híbrida, ACLs y ~3,000 pruebas, evaluado por agencias gubernamentales.
- Una distribución completa de Linux empaquetada como una app de Mac construida en ~2 semanas.
- Herramientas de gestión de cartera, prototipos FHIR/SNOMED, proxies de caché, clones de juegos, experimentos de compiladores y una base de código multilingüe con ~2M+ LOC.
- El patrón típico: la IA hace la mayor parte de la implementación; los humanos se ocupan de la arquitectura, las especificaciones y las revisiones.
Arquitectura, desorden y salud a largo plazo
- Muchos informan que los proyectos sin supervisión o “vibe-coded” se convierten rápidamente en spaghetti:
- Arreglos del camino más corto, parches con cinta adhesiva, duplicación, atajos que sostienen todo.
- La IA rara vez da un paso atrás para hacer grandes refactorizaciones arquitectónicas por sí sola.
- Algunos dicen que esto se parece a ingenieros junior que necesitan dirección; otros enfatizan que los humanos pueden diseñar y mantener de forma autónoma sistemas complejos de maneras que los modelos actuales no pueden.
Pruebas, harnesses y guardrails
- Hay un amplio consenso en que el éxito depende de:
- Amplias pruebas unitarias/de integración, invariantes y comparaciones de extremo a extremo con implementaciones de referencia.
- Tareas incrementales y de pequeño alcance, más revisión humana continua.
- Harnesses/bucles que permitan a los agentes ejecutar muchas iteraciones bajo conjuntos de pruebas estrictos.
- Hay desacuerdo sobre si “muchas pruebas” es suficiente sin que los humanos entiendan profundamente qué se está probando.
Capacidades, límites y casos de uso
- Los modelos funcionan bien en:
- Componentes pequeños a medianos (p. ej., componentes React de ~500 líneas, endpoints).
- Puertos/clones bien especificados con pruebas existentes ricas.
- Tienen dificultades con:
- Arquitecturas novedosas, dominios únicos grandes (p. ej., kernels CAD) y coherencia global.
- Operación totalmente autónoma sin corrección humana periódica.
Preocupaciones sobre benchmarks y datos
- Algunos cuestionan los benchmarks que solo cubren programas basados en texto y que potencialmente dependen de código visto durante el entrenamiento.
- Varios recalcan que los benchmarks con presupuestos triviales no son realistas; las evaluaciones serias deben permitir grandes espacios de búsqueda y ejecuciones largas.