Meta AI lanza Code Llama 70B

El lanzamiento por parte de Meta del modelo Code Llama de 70 mil millones de parámetros se percibe como un gran paso para la generación de código de alto nivel y abierta, con comparaciones con GPT‑4 y competidores más pequeños como DeepSeek Coder y Mixtral. Los comentaristas evalúan su probable enfoque de entrenamiento, su rendimiento en benchmarks y su utilidad práctica, especialmente mediante variantes cuantizadas que pueden ejecutarse localmente en hardware de consumo potente o a bajo coste mediante servicios de alquiler de GPU. Un tema recurrente es el motivo estratégico de Meta: al liberar gratuitamente modelos base potentes, presiona a proveedores cerrados como OpenAI, atrae talento y desplaza el valor hacia los datos, la infraestructura y las aplicaciones derivadas en lugar de depender solo de modelos propietarios.

Capacidades del modelo y comparaciones

  • A muchos les entusiasma ver lo que puede hacer un Code Llama de 70B, dadas las fuertes versiones más pequeñas para código (p. ej., Deepseek Coder 6.7B, WaveCoder-Ultra-6.7B) y herramientas como AlphaCodium (estrategia de prompt/flujo, no un nuevo modelo base).
  • Algunos usuarios informan que Deepseek Coder supera a Code Llama del mismo tamaño; se dice que un Deepseek de 30–35B rinde de forma similar a su versión de 7B en benchmarks.
  • Los benchmarks compartidos (BigCode, EvalPlus, etc.) sugieren que las variantes de Code Llama son sólidas pero no las mejores de su clase de forma uniforme; en el hilo se mencionan afirmaciones de que algunos métodos superan a GPT‑4 en pass@k, pero no están verificadas de manera independiente.
  • Hay curiosidad por saber si Code Llama 70B puede acercarse a GPT‑4 en rendimiento de programación y servir como una fuerte alternativa local a Copilot.

Hardware, cuantización y uso local

  • Se considera que 70B solo es utilizable localmente con cuantización (normalmente 4 bits); la inferencia en precisión completa se ve como un desperdicio fuera de investigación.
  • Informes de ejecuciones exitosas:
    • Mac Studio / MacBook con 64 GB+ de memoria unificada: 70B a 4 bits es “utilizable”, aunque más lento; ~9–10 tok/s en algunas configuraciones M1/M2 Ultra.
    • RTX 3090 (24 GB de VRAM): buena para modelos de ~33B; 70B requiere descarga a CPU o varias GPU, lo que se vuelve lento o complejo.
    • Equipos multi‑GPU (p. ej., múltiples P40, chasis de centro de datos) pueden ejecutar 70B+ eficientemente, pero requieren hardware y consumo propios de un centro de datos.
  • Hay debate sobre si una 4090 “basta” para 70B: con cuantización realista de 4 bits, por lo general no, salvo que se divida entre varias GPU.
  • Se estima que el coste energético del uso local es modesto (del orden de centavos a pocos dólares al mes para cargas interactivas típicas).

Herramientas, flujos de trabajo y “Copilot local”

  • Pilas locales populares: llama.cpp / GGUF, Ollama, text-generation-webui, con frontends para IDE como Continue (VS Code), Cody, Twinny, plugins de JetBrains (CodeGPT) y modos para Emacs (p. ej., gptel).
  • Estrategias discutidas:
    • RAG sobre bases de código en lugar de fine-tuning, dada la rapidez con que cambia el código.
    • Usar APIs alojadas (Together, Bedrock, etc.) para modelos grandes y modelos cuantizados locales para el trabajo del día a día.
  • Varios usuarios ya ejecutan Deepseek o Code Llama localmente como copilotos internos y reportan buenos resultados; esperan que 70B mejore aún más.

Datos de entrenamiento y apertura

  • Varios comentaristas afirman que es muy improbable que Code Llama 70B haya sido entrenado con código interno de Meta debido a los riesgos de extracción de datos.
  • Algunos sostienen que en realidad hay escasez de código open source de alta calidad, y que los modelos ya ingieren “prácticamente todo” el código público disponible.
  • Hay un fuerte debate sobre llamar a Llama “open source”:
    • Críticas: las restricciones de la licencia, la falta de datos y de toda la pila de entrenamiento, y la barrera computacional significan que no es reproducible ni verdaderamente abierto.
    • Contrapuntos: los pesos redistribuibles más la pila open source de PyTorch se consideran “lo suficientemente abiertos” y mucho mejores que los lanzamientos solo en forma de paper.

Estrategia de Meta e implicaciones más amplias

  • Muchos ven las publicaciones de Meta como estratégicas más que altruistas:
    • Debilitar los fosos defensivos de OpenAI/Google/Microsoft haciendo que los modelos base capaces sean baratos o gratuitos.
    • “Commoditize your complement”: convertir los modelos en una mercancía para que la ventaja pase a los datos, la distribución y las aplicaciones, donde Meta es fuerte.
    • Atraer talento de IA de primer nivel permitiendo la publicación abierta y el impacto comunitario.
    • Aprovechar la R&D y las herramientas de forma colaborativa; los modelos de próxima generación de Meta se benefician de técnicas de la comunidad.
    • Mejorar internamente la generación de contenido, la moderación y la construcción de mundos para metaverso/VR.
  • Otros argumentan que esto ayuda a evitar un monopolio de modelos cerrados y diversifica los proveedores de modelos, aunque probablemente siga dejando solo a unos pocos gigantes capaces de entrenar verdaderos modelos de frontera debido a la escala de GPU.
  • Algunos siguen siendo escépticos sobre los motivos de Meta por escándalos pasados; otros señalan que, independientemente de la intención, las publicaciones de pesos abiertos son materialmente beneficiosas para los desarrolladores.