Modelo Mistral "Mixtral" 8x7B 32k [magnet]
Mistral ha lanzado discretamente “Mixtral” 8x7B, un modelo de lenguaje Mixture-of-Experts con contexto de 32k distribuido mediante un enlace magnet de BitTorrent, lo que ha generado entusiasmo por una gran alternativa de pesos abiertos frente a sistemas propietarios como GPT-4 y Gemini. Los comentaristas diseccionan su arquitectura y configuración, señalando que en inferencia se comporta como un modelo de ~12–13B mientras reclama un rendimiento cercano a la clase de 70B, y debaten cuán viable es ejecutarlo en GPUs de consumo, CPUs y nuevo hardware Mac con cuantización agresiva. El lanzamiento también se ve como una jugada de marketing inteligente y amigable para desarrolladores, en marcado contraste con los lanzamientos corporativos pulidos pero cerrados, y como un posible punto de inflexión en el que los modelos abiertos ejecutables localmente empiecen a acercarse a las capacidades de vanguardia de los LLM comerciales.
Lanzamiento y distribución
- El modelo “Mixtral 8x7B 32k” apareció mediante un enlace magnet de BitTorrent con una explicación mínima, y más tarde miembros de la comunidad lo reflejaron en Hugging Face.
- Muchos ven el lanzamiento con ASCII art al estilo warez como un marketing intencional de alto impacto, especialmente en contraste con los lanzamientos y demos pulidos de la IA corporativa.
- Algunos usuarios tuvieron problemas con el magnet y compartieron listas de trackers; otros levantaron rápidamente endpoints de inferencia y repositorios experimentales en HF.
Arquitectura y capacidades
- Mixtral es un modelo Mixture-of-Experts (MoE) con 8 expertos de ~7B parámetros cada uno, top‑2 expertos por token.
- Configuración: 32 capas, dim 4096, hidden_dim 14336 (≈3.5× expansión MLP), 32 cabezas con 8 cabezas KV (estilo multi-query), vocabulario 32k, contexto declarado de 32k (pero el Mistral anterior usaba ventanas deslizantes y en la práctica se comportaba más como 8k).
- La atención (
2B parámetros) es compartida; los “expertos” FFN (5B cada uno) varían por experto.
Requisitos de hardware y comportamiento en tiempo de ejecución
- Los pesos en bruto pesan ~86–96 GB; con cuantización de 4 bits, la gente espera que quepa en ~24 GB de VRAM, similar a grandes modelos densos de 30–40B.
- Como solo 2 expertos están activos por token, el cómputo efectivo es aproximadamente el de un modelo denso de 12–13B por token, aunque todos los expertos deben residir en memoria rápida para obtener buena velocidad.
- Hay debate sobre si el intercambio inteligente / caché de expertos entre CPU y GPU o tmpfs es práctico; algunos dicen que estará limitado por PCIe, otros son optimistas.
- Los usuarios esperan que funcione en Macs con mucha RAM (hasta 128–192 GB) y en GPUs únicas de 24 GB con cuantización; también aparecen afirmaciones sobre configuraciones experimentales con 4 GB de VRAM.
Discusión sobre el enrutamiento MoE
- Varias explicaciones aclaran que una pequeña red “router” elige 2 expertos por token, y la elección puede cambiar en cada token.
- Esto debilita la esperanza ingenua de que se pueda cargar solo un subconjunto de expertos; el rendimiento interactivo probablemente requiere todos los expertos en RAM/VRAM.
Comparaciones, benchmarks y ajuste fino
- Muchos esperan que Mixtral 8x7B se acerque o supere a los modelos densos abiertos de 40B–70B; algunos afirman que puntúa por encima de Llama‑2 70B, pero otros advierten sobre el sobreajuste a benchmarks.
- Se discuten nuevos ajustes finos de “alineación neuronal” sobre Mistral/Yi que encabezan los rankings de Hugging Face; los participantes debaten cuán significativos son esos rankings.
- Varios comentarios elogian Mistral 7B (y sus fine-tunes) como cercano al nivel de GPT‑3.5 para muchas tareas, y ven Mixtral como un gran paso para los modelos de pesos abiertos.
Modelo de negocio y estrategia
- Algunos especulan que la estrategia de Mistral es construir reputación mediante lanzamientos sólidos de pesos abiertos y luego monetizar mediante hosting, ajuste fino y soporte.
- Otros contrastan este enfoque abierto con modelos geobloqueados o cerrados de grandes empresas estadounidenses y con pesos no liberados como Gemini de Google.