Brave Leo ahora usa Mixtral 8x7B como valor predeterminado

Brave ha cambiado su asistente de IA integrado Leo al modelo Mixtral 8x7B, lo que provoca comparaciones con GPT‑4 y una discusión detallada sobre cómo ejecutar Mixtral localmente con herramientas como llama.cpp, koboldcpp y Ollama en CPU de consumo, GPU y Apple Silicon. Los comentaristas sopesan las compensaciones entre niveles de cuantización, requisitos de memoria y velocidad de tokens, y también enumeran proveedores en la nube que ofrecen Mixtral (por ejemplo, la propia API de Mistral, Together, Groq, OpenRouter, Anyscale). Junto con la elección del modelo, las afirmaciones de privacidad de Brave, su enfoque de bloqueo de anuncios bajo los cambios de Manifest V3 de Chrome, y funciones como tokens de suscripción no vinculables y consultas desde la omnibar generan tanto elogios como escepticismo sobre la confianza y la viabilidad a largo plazo.

Ejecutando Mixtral localmente

  • Los usuarios informan ejecuciones locales exitosas mediante llama.cpp, koboldcpp, text-generation-webui, Oobabooga, LM Studio, Ollama y compilaciones optimizadas para Apple Silicon.
  • Las necesidades de memoria son altas: incluso las cuantizaciones de 2 bits requieren ~20 GB de RAM; 4 bits apenas caben en 32 GB; 6–8 bits generalmente necesitan 64 GB o más.
  • Descargar capas a la GPU (mediante indicadores como --n-gpu-layers) produce grandes aumentos de velocidad hasta que la VRAM está casi llena; más allá de eso, descargar puede volverse más lento que usar solo CPU.
  • Apple Silicon con gran RAM unificada (p. ej., 36–64 GB) se menciona repetidamente como “sorprendentemente rápido” y conveniente.
  • AMD/ROCm y las GPU integradas pueden funcionar, pero la configuración es más compleja; algunos describen el rendimiento en gráficos integrados como “terriblemente lento”.
  • Las placas Jetson generan debate: algunos dicen que son divertidas y capaces; otros llaman frágil al stack de software y lo consideran inadecuado como una caja LLM de uso general.

Cuantización y precisión

  • La cuantización más agresiva (2 bits) se describe ampliamente como “terrible” para uso serio; 4 bits o más se ve como una mejor compensación.
  • Se mencionan varias explicaciones: las redes neuronales toleran el ruido; gran parte de la precisión float de 16/32 bits es redundante; la cuantización moderna usa tablas de búsqueda por bloques y metadatos adicionales de escala.
  • También se citan la destilación y la eliminación de pesos como técnicas alternativas de compresión.

APIs remotas de Mixtral y rendimiento

  • Se nombran varios proveedores: OpenRouter, Together, Fireworks, Anyscale, la propia API de Mistral, Replicate y Groq.
  • Together y Groq reciben elogios por su velocidad; Groq afirma tasas de tokens/s extremadamente altas para Mixtral.
  • Algunos usan Mistral o Anyscale para producción y pequeños modelos cuantizados locales para experimentar.

Brave, Manifest V3 y bloqueo de anuncios

  • A los usuarios les gusta el bloqueador de anuncios integrado de Brave y el rendimiento de Chromium, y algunos consideran que uBlock Origin aporta poco adicional.
  • Debate sobre Manifest V3:
    • Un bando dice que MV3 sigue permitiendo un bloqueo de anuncios potente con grandes límites de reglas y actualizaciones dinámicas de reglas.
    • El otro argumenta que MV3 elimina el verdadero “filtrado dinámico” (inspección/modificación de solicitudes basada en código) y obliga a que la innovación en bloqueadores dependa de nuevas APIs de Chrome.
  • Preocupa que la dirección de Chromium y las políticas de Chrome Web Store limiten los bloqueadores basados en extensiones, independientemente de las intenciones de Brave.

Privacidad, registros y suscripciones

  • Se elogian los “sin registros de chat” de Leo y los tokens de suscripción no vinculables, pero también se cuestionan, ya que las afirmaciones en última instancia dependen de la confianza.
  • Algunos consideran que el RGPD y el esquema de tokens de Brave son “suficientemente buenos” para los usuarios habituales; otros advierten contra confiar demasiado en Brave, citando artículos críticos y un escepticismo general hacia las promesas de “sin registros”.
  • Un comentarista esboza cómo podrían funcionar los tokens no vinculables (IDs aleatorios, almacenamiento barajado, derechos limitados), y señala los enfoques de conocimiento cero como una opción más compleja.

Calidad del modelo y UX

  • Varios dicen que, tras usar GPT‑4, Mixtral se siente claramente más débil, aunque sigue siendo fuerte frente a muchos modelos abiertos. Otros informan que Mixtral supera a LLaMA 70B en su uso.
  • Los casos de uso incluyen asistentes locales de programación (p. ej., Dolphin Mixtral), análisis offline de documentos/código y preguntas “rápidas de sintaxis/parámetros” donde la latencia importa.
  • Se puede invocar a Leo desde la barra de direcciones del navegador; la resumificación de PDFs en Leo en sí no está clara/no está presente, y se sugiere como alternativa la extensión de Kagi.