Ferret: Un modelo de lenguaje grande multimodal
El proyecto Ferret de Apple muestra un modelo de lenguaje grande multimodal que puede referirse con precisión a regiones dentro de imágenes y razonar sobre ellas, lo que sugiere futuras capacidades de IA en el dispositivo para tareas como accesibilidad, grounding visual y asistentes más ricos. Quienes comentan señalan que Ferret es un fine-tune solo para investigación construido sobre modelos abiertos existentes (LLaMA, Vicuna, LLaVA) y que fue entrenado en GPUs Nvidia A100, lo que subraya tanto la dependencia de Apple de la infraestructura estándar de IA como su enfoque en una inferencia centrada en el dispositivo y amigable con la privacidad. Gran parte de la conversación se centra en lo que esto implica para Siri, iOS 18 y el panorama general de la IA, y muchos esperan que los modelos locales “suficientemente buenos” en los teléfonos erosionen la ventaja de servicios basados en la nube como ChatGPT, aunque el rendimiento real al nivel de GPT‑4 sigue estando fuera del alcance del hardware móvil en el corto plazo.
Definición y nombre de MLLM / Ferret
- MLLM se discute como “Multimodal Large Language Model”, que maneja múltiples modalidades de entrada (p. ej., texto + imágenes).
- Hay cierto debate sobre la terminología (MLLM vs LLMM, qué es “language” si las entradas no son lingüísticas), pero el consenso se mantiene en el establecido “MLLM”.
- El nombre de Ferret se percibe como un modelo con tema animal y con el sentido figurado de “buscador diligente”, no claramente como un acrónimo.
Qué es realmente Ferret
- El artículo describe Ferret como un LLM multimodal centrado en la referencia espacial / grounding en imágenes: señalar regiones, formas o coordenadas arbitrarias y describirlas con precisión.
- Usa una representación híbrida de regiones y un muestreador visual con conciencia espacial; se entrenó con un conjunto de datos GRIT curado con negativos difíciles para reducir las alucinaciones.
- Algunos consideran que el resumen está cargado de jerga; otros ven las mejoras arquitectónicas (manejo de regiones) como la verdadera innovación.
- Varios señalan que es un fine-tune sobre Vicuna/LLaMA y LLaVa, no un modelo base construido desde cero; el entusiasmo se matiza por esto.
Licenciamiento y apertura
- Publicado “solo para uso en investigación”, con datos no comerciales (CC BY-NC 4.0) y restricciones heredadas de LLaMA, Vicuna y GPT‑4.
- Hay decepción porque no es realmente de código abierto; se especula que las restricciones de licencia sobre los datos/modelos subyacentes obligan a la postura de solo investigación.
La estrategia de IA de Apple y sus ventajas defensivas
- Muchos ven esto como parte de Apple “llenando el foso” frente a los proveedores de LLM en la nube, al habilitar modelos multimodales y herramientas en el dispositivo.
- La opinión es que los LLM se están volviendo commodities; la verdadera ventaja de Apple es el hardware + la base instalada y la profunda integración con la plataforma.
- Otros sostienen que OpenAI y otros pueden copiar el enfoque, pero no igualar la integración a nivel de SO en el iPhone.
LLM en el dispositivo, Siri e iOS
- Hay un fuerte deseo de una Siri significativamente mejorada, impulsada por LLM, y de funciones de iOS 18 “centradas en IA”, combinando modelos locales pequeños con respaldos en la nube.
- Las opiniones están divididas sobre la viabilidad de modelos del nivel de GPT‑4 en teléfonos a corto plazo; el consenso es que son más probables modelos más pequeños con ayuda del lado del servidor.
- Algunos argumentan que incluso un modelo de 7B superaría ampliamente a la Siri actual; otros dicen que los modelos de 7B/13B siguen siendo “tontos” y poco fiables.
Seguridad, control y cautela de Apple
- Varios esperan que Apple restrinja fuertemente cualquier LLM en el dispositivo debido a preocupaciones de seguridad, responsabilidad y marca, lo que podría limitar su generalidad.
- Existe la preocupación de que asistentes verdaderamente impredecibles y totalmente abiertos sean incompatibles con la experiencia de usuario estrictamente controlada de Apple.
Hardware, entrenamiento y CUDA
- Se señaló que Ferret fue entrenado en 8× GPUs Nvidia A100; se debatió que Apple sigue dependiendo de clústeres estándar Linux/Nvidia para el entrenamiento.
- Hay debate sobre si esto socava la imagen de Apple Silicon en ML; el contraargumento es que el entrenamiento y la inferencia son diferentes, y que los centros de datos son un dominio de commodities.