Mixtral 8x7B: un modelo de lenguaje Sparse Mixture of Experts
Un modelo de lenguaje de pesos abiertos llamado Mixtral 8x7B está llamando la atención por usar una arquitectura Sparse Mixture of Experts para igualar o superar a GPT-3.5 y Llama 2 70B en muchas tareas, activando solo una fracción de sus 47 mil millones de parámetros en tiempo de inferencia. Los comentaristas se centran en su impacto práctico: puede ejecutarse localmente en GPU de consumo de gama alta y en Macs con Apple Silicon mediante cuantización, lo que habilita la experimentación de aficionados, posibles personajes de IA en juegos y asistentes offline, aunque la VRAM y el coste del hardware siguen siendo limitaciones. El lanzamiento también provoca debate sobre la opacidad de los detalles de entrenamiento en los papers modernos de LLM, lo bien que estos modelos manejan las matemáticas, el valor real de los benchmarks informales y cuándo aparecerán modelos abiertos más potentes o multimodales.
Calendario del lanzamiento y del paper
- Los pesos del modelo (Mixtral 8x7B) se torrentearon en dic. de 2023; el paper formal apareció más tarde.
- Este hilo se centra en los detalles del paper y en cómo se corresponden con la experiencia de la comunidad con los pesos ya liberados.
Arquitectura y capacidades
- Mixtral es un Sparse Mixture of Experts: cada capa tiene 8 “expertos”, y un router envía cada token a 2 de ellos.
- El uso efectivo en inferencia es de ~13B de 47B parámetros; aun así, todos los expertos deben cargarse en memoria.
- Se informa que supera a Llama 2 70B y GPT-3.5 en matemáticas, programación y benchmarks multilingües; algunas variantes afinadas supuestamente rivalizan con Gemini Pro.
- Varios comentaristas dicen que es el primer modelo local que usan en serio en lugar de GPT-3.5.
Hardware, cuantización y uso local
- Puede ejecutarse en RTX 3090 / 4090 y en Apple Silicon reciente (M1/M2/M3) con suficiente RAM, usando cuantización de 3–5 bits.
- Informes: ~50 t/s en una 3090 a 3 bits; ~30 t/s en una M1 Max a Q4; solo con CPU es posible, pero lento.
- Hay debate sobre cuán “de consumo” es este hardware: algunos ven las 3090 / Macs con mucha RAM como algo de nicho y caro; otros sostienen que las GPU usadas con mucha VRAM están al alcance de los entusiastas.
- Se anuncia un contexto de 32k, pero al menos un usuario informa dificultades para alcanzar contextos grandes con VRAM limitada.
Aplicaciones: juegos y agentes
- Algunos ven potencial a corto plazo para diálogos de NPC en juegos o juegos de estrategia con líderes impulsados por LLM, ya sea localmente o mediante suscripciones.
- Otros argumentan que la mayoría de los jugadores no tiene el hardware; lo ven como “a años vista” para una adopción masiva.
- Se destacan técnicas como la salida estructurada (“grammars”) para construir agentes y sistemas tipo juego.
Matemáticas y uso de herramientas
- Se debate si los modelos de siguiente token podrán llegar a ser realmente fiables en aritmética.
- Un lado: las matemáticas son intrínsecamente difíciles para los LLM; siempre harán falta herramientas/ejecución de programas.
- El otro lado: con más escala y mejor entrenamiento, la aritmética podría emerger de un mejor modelado del mundo y de la compresión.
- Se mencionan marcos de trabajo con herramientas (calculadoras, ejecución de código) como soluciones prácticas.
Comportamiento de expertos MoE e interpretabilidad
- Una figura del paper muestra que no hay patrones obvios de enrutamiento por tema; los “expertos” emergen, no están definidos por humanos.
- Algunos cuestionan si las mejoras provienen de la estructura MoE en sí y no de expertos claramente especializados.
- Se considera que el procedimiento exacto de entrenamiento y los datasets para los expertos y el router están poco documentados.
Multimodal y modelos futuros
- Hay interés en modelos multimodales abiertos; se citan los existentes (LLaVA, CogVLM, el trabajo multimodal de Meta), pero muchos no son comerciales o son limitados.
- Algunos esperan modelos abiertos potentes comparables a ChatGPT/GPT-4, aunque otros señalan que no todos los futuros modelos de Mistral pueden ser totalmente open-weight.
Benchmarks y calidad del paper
- Se usan benchmarks informales de la comunidad para situar a Mixtral en lo alto, pero algunos los critican por no ser rigurosos ni reproducibles.
- Preocupa más ampliamente que la evaluación de LLM esté fragmentada y sea fácil de manipular.
- Varios comentaristas consideran que el paper es escaso en detalles de entrenamiento y datasets, viendo esto como parte de una tendencia más amplia en la que las empresas ocultan especificaciones clave del entrenamiento.
Cómo ejecutarlo
- Herramientas mencionadas habitualmente: ollama, llama.cpp, llamafile, LM Studio, GPT4All (soporte parcial), ejemplos de MLX.
- Varios fragmentos paso a paso muestran que un binario único (llamafile) o simples comandos
ollama pull mixtralbastan para probar el modelo localmente, siempre que haya suficiente RAM/VRAM.