Gemma: Nuevos modelos abiertos

El lanzamiento por parte de Google de los modelos de lenguaje “abiertos” Gemma 2B y 7B es recibido con interés por sus buenos benchmarks, su compatibilidad para ejecutarse localmente (llama.cpp, Ollama, gemma.cpp) y su uso comercial permisivo, situándolos como competidores de Llama 2, Mistral y Phi-2. Los comentaristas analizan el diseño técnico (gran tokenizador de 256k, elecciones de arquitectura, comportamiento de cuantización, contexto de 8k) y señalan que están disponibles los pesos base y ajustados por instrucciones, pero no los datos de entrenamiento ni el código, lo que plantea dudas sobre cuán “abiertos” son realmente estos modelos. Gran parte del debate se centra en la licencia personalizada de Google y en las restricciones de seguridad/alineamiento, que algunos ven como una gestión razonable del riesgo y otros como algo restrictivo, políticamente sesgado o inadecuado para depender de ello en serio en entornos comerciales.

Rendimiento y arquitectura del modelo

  • Muchos ven los benchmarks de Gemma 7B aproximadamente al nivel de Mistral 7B; 2B se considera más débil y superado por Phi-2 en varios benchmarks públicos.
  • Despiertan interés ciertas particularidades de la arquitectura: vocabulario de 256k tokens, gran expansión de FFN, elecciones de MQA/GQA y un diseño del tokenizador muy relacionado con el de Llama, pero más grande y con muchos tokens especiales.
  • Algunos sostienen que los modelos de 7B pueden estar cerca de la saturación dado que Gemma se entrenó con 6T tokens y solo obtuvo mejoras modestas.

Disponibilidad y herramientas

  • Los pesos se pueden descargar (Kaggle, Hugging Face), con JAX, Keras, PyTorch oficiales y un motor C++ independiente.
  • Existe soporte para GGUF y llama.cpp; Gemma aparece en Ollama y otras interfaces locales.
  • La longitud de contexto es de 8k tokens. La pregunta sobre versiones con contexto extendido o multimodales solo se responde con “stay tuned”.

Licencias, definición de “abierto” y uso comercial

  • Los pesos son “abiertos” pero bajo términos personalizados, no una licencia OSI. No se publica el código de entrenamiento ni los conjuntos de datos.
  • El debate se centra en si esto debe llamarse “open” frente a “weights-available”, y en comparaciones con las licencias de Meta y Mistral.
  • Los términos incluyen una cláusula de “reasonable efforts to update” y una política amplia de usos prohibidos; algunos ven esto como una especie de interruptor de apagado de facto y evitan Gemma para uso comercial, prefiriendo modelos con Apache/MIT.
  • Otros señalan que muchas startups ignoran en la práctica las licencias restrictivas.

Seguridad, alineamiento y sesgo

  • Se publican tanto los puntos de control base (preentrenados) como los alineados (ajustados por instrucciones); los usuarios pueden hacer fine-tuning para cambiar el alineamiento.
  • Algunos quieren una caracterización explícita del ajuste ideológico/de seguridad; otros sostienen que eso es difícil de definir o de probar.
  • Ejemplos separados pero relacionados de imágenes de Gemini y de historia (por ejemplo, salidas “diversificadas” racialmente) alimentan el escepticismo de que los modelos de Google puedan estar políticamente sesgados o “falseando la historia”.

Cuantización y comportamiento de la inferencia local

  • Las cuantizaciones tempranas de 4 bits de Gemma 7B (por ejemplo, en Ollama) producían texto sin sentido; una mayor precisión o pilas distintas (Transformers 4-bit, NUQ 4.5-bit de gemma.cpp) se comportan mejor pero son más lentas.
  • Algunos informan que Gemma es más lento que Llama/Mistral y que el fine-tuning puede ser poco práctico en GPUs de consumo.

Reacciones de la comunidad y estrategia

  • Muchos aprecian el lanzamiento y la interacción directa del equipo en HN.
  • Otros lo ven como una jugada de PR para promover el ecosistema de Google y erosionar los fosos de los modelos cerrados, al tiempo que mantiene como propietarios activos clave (datos, pila de entrenamiento).