El CEO de Mistral confirma la “filtración” de un nuevo modelo de IA de código abierto que se acerca al rendimiento de GPT-4
Un modelo de lenguaje grande “miqu-1-70b” filtrado, atribuido a la startup francesa Mistral AI, está atrayendo atención por supuestamente acercarse al rendimiento de GPT-4 mientras se distribuye en forma cuantizada apta para uso local. Los comentaristas debaten si la filtración es una maniobra publicitaria deliberada, cuánto se acerca realmente a GPT-4 en tareas del mundo real y qué debería significar “código abierto” para los modelos de IA cuando solo se liberan los pesos, no los datos de entrenamiento. El incidente también alimenta comparaciones más amplias entre Mistral y OpenAI en coste, guardarraíles, estabilidad del rendimiento y el ritmo de progreso en modelos propietarios frente a modelos de pesos abiertos.
Naturaleza de la “filtración” y cuestiones de marketing
- Un modelo cuantizado y con marca de agua de 70B (“miqu-1-70b”) apareció en Hugging Face; el CEO lo describió como un modelo anterior basado en Llama-2 que una vez se entregó a clientes de acceso anticipado.
- Algunos lo ven como una filtración de un “empleado excesivamente entusiasta”; otros creen que parece una PR deliberada e ingeniosa.
- Mistral no ha forzado la retirada; en su lugar, dejaron una nota discreta, que muchos interpretan como una postura segura y favorable a los desarrolladores.
Capacidad del modelo y comparación con GPT-4 / GPT-3.5
- Usuarios que ejecutan Mixtral y derivados localmente informan:
- Para muchas tareas de programación y debate, la calidad se siente cercana a GPT-4, pero con más alucinaciones y menos autocorrección.
- Otro practicante califica los modelos al estilo Mixtral como ~5% a nivel GPT-4, ~75% al nivel de GPT-3.5, ~20% peores (demasiado verbosos, con alucinaciones).
- Mistral Medium vía API suele describirse como comparable a GPT-3.5; algunos dicen “entre 3.5-turbo y 4-turbo”.
- “Cerca de GPT-4” se considera por algunos como exageración; otros enfatizan la importancia de acercarse tanto con modelos mucho más pequeños, baratos y a menudo de una sola GPU.
Guardarraíles, “nerfing” y preferencia por modelos abiertos
- Varios comentarios se quejan de que los modelos de OpenAI se han vuelto menos útiles debido a guardarraíles de seguridad y responsabilidad más estrictos (especialmente para ayuda legal/contractual y tareas grandes), a veces haciendo trabajo parcial o diciendo a los usuarios que consulten a expertos.
- Se elogia la API de Mistral por permitir desactivar los guardarraíles y por sentirse más “adulta” y menos paternalista.
- Algunos están cambiando su uso hacia modelos locales/abiertos por privacidad, estabilidad y para evitar el cambio de políticas.
Código abierto vs “pesos abiertos” y cuestiones legales/de IP
- Debate sobre si esta filtración es realmente “código abierto” o solo “pesos abiertos”.
- Algunos sostienen que el código abierto en IA debería significar uso libre, modificación e inspección de los pesos, incluso sin los datos de entrenamiento.
- Otros destacan que muchas licencias de LLM (por ejemplo, con restricciones de uso por ámbito) no son “abiertas” en el sentido tradicional del software libre.
- Largo hilo legal sobre si los pesos del modelo pueden estar protegidos por copyright, por bases de datos o como secretos comerciales; se reconoce que el resultado no está claro.
Detalles de watermarking y cuantización
- Se discuten ideas de watermarking: perturbaciones en los pesos, tokens especiales de “shibboleth” y patrones estadísticos de salida.
- Se aclara que la cuantización consiste en reducir la precisión numérica de los pesos, no en reemplazar “secuencias numéricas”.
- La filtración llegó como quants GGUF (Q2/Q4/Q5); convenientes para uso local, pero vistos por algunos como subóptimos para producción de alto rendimiento.
Benchmarks, tablas de clasificación y sesgo de evaluación
- Se mencionan tablas de clasificación de HuggingFace/LMSys; algunos señalan una brecha entre GPT-4 “clásico” y GPT-4-Turbo.
- Otros argumentan que las tablas de clasificación son ruidosas, sufren sesgo de muestreo (consultas centradas en desarrolladores/inglés) y corren el riesgo de la ley de Goodhart; las capacidades reales (por ejemplo, escritura creativa, idiomas de nicho, usos de contexto largo) pueden estar submedidas.