Tell HN: Los copilots de GPT no son tan buenos para programar

Los asistentes de programación con IA, como GitHub Copilot y ChatGPT, se consideran ampliamente útiles para boilerplate, autocompletado y aprendizaje de herramientas o frameworks desconocidos, pero mucho menos fiables para tareas de programación complejas o a gran escala. Muchos programadores informan de mejoras modestas de productividad compensadas por problemas como APIs alucinadas, errores sutiles, comprensión limitada del contexto del proyecto y preocupaciones sobre la calidad del código y el plagio. Hay un amplio consenso en que estas herramientas funcionan mejor como apoyo para desarrolladores experimentados y tareas rutinarias, con la esperanza de que una integración más profunda con la base de código y garantías de corrección más sólidas puedan desbloquear beneficios más transformadores en el futuro.

Sentimiento general sobre los copilots de GPT para programar

  • Muchos consideran que los copilots y los LLM basados en chat son decepcionantes para tareas de programación complejas o novedosas.
  • Se los ve ampliamente como “autocompletado con esteroides” más que como verdaderos solucionadores de problemas o sustitutos de desarrolladores experimentados.
  • Las opiniones van de “que te cambia la vida” a “simplemente no sirve”, dependiendo mucho del caso de uso, las expectativas y la habilidad del usuario.

Dónde funcionan bien

  • Código repetitivo / boilerplate:
    • Autocompletar patrones obvios, mapear estructuras de datos similares, generar esqueletos de funciones simples, scripts básicos y pruebas unitarias.
    • Generar consultas SQL simples, comandos de shell, configuraciones de Docker/Nginx, o scripts puntuales y tareas de transformación de datos.
  • Aprendizaje y exploración:
    • Preguntas rápidas de “¿cómo hago X en el lenguaje/biblioteca Y?”.
    • Obtener ejemplos idiomáticos, desambiguar documentación o resumir nuevos frameworks/tecnologías.
    • Actuar como un “rubber duck” sin juicio para discusiones de arquitectura o dominios desconocidos.
  • Tareas de administración / infraestructura:
    • Solución de problemas en Linux a partir de logs, configuración básica de cloud/devops o explicación de APIs/herramientas.

Dónde fallan o son arriesgados

  • Código complejo, a gran escala o muy novedoso:
    • Son malos para el razonamiento profundo, la arquitectura o algoritmos intrincados; a menudo producen código que compila pero es incorrecto, o que ni siquiera compila.
    • Les cuesta SQL complejo, casos límite de inyección de dependencias, bibliotecas especializadas o ML/compiladores avanzados.
  • Alucinaciones y falsa autoridad:
    • Inventan APIs, métodos o incluso bibliotecas enteras; a veces se equivocan con mucha confianza sobre funciones del lenguaje o de la base de datos.
    • Las correcciones de ida y vuelta suelen degradar la calidad; reiniciar sesiones es una solución habitual.
  • Calidad y mantenibilidad del código:
    • Riesgo de errores sutiles, problemas de seguridad y código repetitivo que no sigue DRY.
    • Algunos equipos informan de que no hay ganancia de productividad y el código empeora; otros ven mejoras modestas (5–40%) pero enfatizan la revisión cuidadosa.

Impacto según el nivel de experiencia

  • Desarrolladores experimentados:
    • El mayor valor aparece cuando ya saben lo que quieren y pueden revisar la salida; lo usan para trabajo pesado y búsqueda.
    • Algunos sienten una productividad significativamente mayor; otros solo ven mejoras marginales.
  • Principiantes / no desarrolladores:
    • Pueden sacar adelante proyectos pequeños o scripts que de otro modo no podrían, pero quizá aprendan menos fundamentos y les cueste detectar errores.
    • Varios sostienen que los copilots pueden ser incluso perjudiciales para principiantes reales que no pueden validar los resultados.

Modelos, calidad y preocupaciones del ecosistema

  • Algunos informan que GPT‑4 supera a GPT‑4 Turbo y 3.5, y señalan regresiones percibidas de calidad con el tiempo.
  • Los límites de la ventana de contexto y la falta de comprensión profunda del proyecto son puntos de dolor recurrentes; las herramientas que prometen contexto de todo el código base se ven como próximos pasos prometedores.
  • Preocupaciones éticas y legales sobre los datos de entrenamiento, el plagio y la sobredependencia corporativa de la IA, incluidos posibles impactos en la contratación y la moral.