Tell HN: Los copilots de GPT no son tan buenos para programar
Los asistentes de programación con IA, como GitHub Copilot y ChatGPT, se consideran ampliamente útiles para boilerplate, autocompletado y aprendizaje de herramientas o frameworks desconocidos, pero mucho menos fiables para tareas de programación complejas o a gran escala. Muchos programadores informan de mejoras modestas de productividad compensadas por problemas como APIs alucinadas, errores sutiles, comprensión limitada del contexto del proyecto y preocupaciones sobre la calidad del código y el plagio. Hay un amplio consenso en que estas herramientas funcionan mejor como apoyo para desarrolladores experimentados y tareas rutinarias, con la esperanza de que una integración más profunda con la base de código y garantías de corrección más sólidas puedan desbloquear beneficios más transformadores en el futuro.
Sentimiento general sobre los copilots de GPT para programar
- Muchos consideran que los copilots y los LLM basados en chat son decepcionantes para tareas de programación complejas o novedosas.
- Se los ve ampliamente como “autocompletado con esteroides” más que como verdaderos solucionadores de problemas o sustitutos de desarrolladores experimentados.
- Las opiniones van de “que te cambia la vida” a “simplemente no sirve”, dependiendo mucho del caso de uso, las expectativas y la habilidad del usuario.
Dónde funcionan bien
- Código repetitivo / boilerplate:
- Autocompletar patrones obvios, mapear estructuras de datos similares, generar esqueletos de funciones simples, scripts básicos y pruebas unitarias.
- Generar consultas SQL simples, comandos de shell, configuraciones de Docker/Nginx, o scripts puntuales y tareas de transformación de datos.
- Aprendizaje y exploración:
- Preguntas rápidas de “¿cómo hago X en el lenguaje/biblioteca Y?”.
- Obtener ejemplos idiomáticos, desambiguar documentación o resumir nuevos frameworks/tecnologías.
- Actuar como un “rubber duck” sin juicio para discusiones de arquitectura o dominios desconocidos.
- Tareas de administración / infraestructura:
- Solución de problemas en Linux a partir de logs, configuración básica de cloud/devops o explicación de APIs/herramientas.
Dónde fallan o son arriesgados
- Código complejo, a gran escala o muy novedoso:
- Son malos para el razonamiento profundo, la arquitectura o algoritmos intrincados; a menudo producen código que compila pero es incorrecto, o que ni siquiera compila.
- Les cuesta SQL complejo, casos límite de inyección de dependencias, bibliotecas especializadas o ML/compiladores avanzados.
- Alucinaciones y falsa autoridad:
- Inventan APIs, métodos o incluso bibliotecas enteras; a veces se equivocan con mucha confianza sobre funciones del lenguaje o de la base de datos.
- Las correcciones de ida y vuelta suelen degradar la calidad; reiniciar sesiones es una solución habitual.
- Calidad y mantenibilidad del código:
- Riesgo de errores sutiles, problemas de seguridad y código repetitivo que no sigue DRY.
- Algunos equipos informan de que no hay ganancia de productividad y el código empeora; otros ven mejoras modestas (5–40%) pero enfatizan la revisión cuidadosa.
Impacto según el nivel de experiencia
- Desarrolladores experimentados:
- El mayor valor aparece cuando ya saben lo que quieren y pueden revisar la salida; lo usan para trabajo pesado y búsqueda.
- Algunos sienten una productividad significativamente mayor; otros solo ven mejoras marginales.
- Principiantes / no desarrolladores:
- Pueden sacar adelante proyectos pequeños o scripts que de otro modo no podrían, pero quizá aprendan menos fundamentos y les cueste detectar errores.
- Varios sostienen que los copilots pueden ser incluso perjudiciales para principiantes reales que no pueden validar los resultados.
Modelos, calidad y preocupaciones del ecosistema
- Algunos informan que GPT‑4 supera a GPT‑4 Turbo y 3.5, y señalan regresiones percibidas de calidad con el tiempo.
- Los límites de la ventana de contexto y la falta de comprensión profunda del proyecto son puntos de dolor recurrentes; las herramientas que prometen contexto de todo el código base se ven como próximos pasos prometedores.
- Preocupaciones éticas y legales sobre los datos de entrenamiento, el plagio y la sobredependencia corporativa de la IA, incluidos posibles impactos en la contratación y la moral.