Ferret: एक मल्टीमोडल लार्ज लैंग्वेज मॉडल

Apple का Ferret प्रोजेक्ट एक मल्टीमोडल लार्ज लैंग्वेज मॉडल दिखाता है जो इमेजों के भीतर क्षेत्रों का सटीक संदर्भ दे सकता है और उन पर तर्क कर सकता है, जिससे accessibility, visual grounding, और richer assistants जैसे कार्यों के लिए भविष्य की on-device AI क्षमताओं का संकेत मिलता है। टिप्पणीकार नोट करते हैं कि Ferret एक research-only finetune है, जो मौजूदा खुले models (LLaMA, Vicuna, LLaVA) पर आधारित है और Nvidia A100 GPUs पर प्रशिक्षित किया गया था, जो Apple की standard AI infrastructure पर निर्भरता और privacy-friendly, device-centric inference पर उसके फोकस—दोनों को रेखांकित करता है। चर्चा का बड़ा हिस्सा इस बात पर केंद्रित है कि इसका Siri, iOS 18, और व्यापक AI landscape के लिए क्या मतलब है; कई लोगों को उम्मीद है कि phones पर स्थानीय “good enough” models cloud-based services जैसे ChatGPT की बढ़त को कम कर देंगे, भले ही वास्तविक GPT‑4-स्तरीय प्रदर्शन निकट भविष्य में mobile hardware की पहुँच से बाहर रहे।

MLLM / Ferret की परिभाषा और नामकरण

  • MLLM को “Multimodal Large Language Model” के रूप में चर्चा की गई है, जो कई इनपुट मोडैलिटी (जैसे, टेक्स्ट + इमेज) को संभालता है।
  • शब्दावली को लेकर कुछ बहस है (MLLM बनाम LLMM, जब इनपुट गैर-भाषाई हों तो “language” क्या है), लेकिन सहमति स्थापित “MLLM” पर बनी रहती है।
  • Ferret का नाम एक जानवर-थीम वाला मॉडल माना जाता है, जिसका रूपक अर्थ “मेहनती खोजकर्ता” है; यह स्पष्ट रूप से कोई संक्षिप्त नाम नहीं लगता।

Ferret वास्तव में क्या है

  • पेपर Ferret को एक मल्टीमोडल LLM के रूप में वर्णित करता है, जो इमेजों में spatial referring / grounding पर केंद्रित है: arbitrary regions, shapes, या coordinates की ओर इशारा करना और उन्हें सटीक रूप से वर्णित करना।
  • यह एक hybrid region representation और spatial-aware visual sampler का उपयोग करता है; hallucinations को कम करने के लिए hard negatives के साथ एक curated GRIT dataset पर प्रशिक्षित किया गया।
  • कुछ लोगों को abstract buzzword-heavy लगता है; दूसरों के अनुसार वास्तविक नवाचार architectural tweaks (region handling) हैं।
  • कई लोग नोट करते हैं कि यह Vicuna/LLaMA और LLava के ऊपर एक finetune है, ground-up base model नहीं; इसलिए उत्साह कुछ कम हो जाता है।

लाइसेंसिंग और ओपननेस

  • इसे “for research use only” के रूप में जारी किया गया है, non-commercial data (CC BY-NC 4.0) और LLaMA, Vicuna, तथा GPT‑4 से विरासत में मिली प्रतिबंधों के साथ।
  • कुछ लोग निराश हैं कि यह वास्तव में open-source नहीं है; अनुमान है कि underlying data/models पर licensing constraints research-only रुख को मजबूर करते हैं।

Apple की AI रणनीति और moats

  • कई लोग इसे cloud LLM providers के खिलाफ Apple द्वारा “filling the moat” के रूप में देखते हैं, क्योंकि इससे on-device multimodal models और toolkits सक्षम होते हैं।
  • यह दृष्टिकोण है कि LLMs commoditizing हो रहे हैं; Apple का असली moat hardware + installed base और platform integration की गहराई है।
  • अन्य लोग तर्क देते हैं कि OpenAI और अन्य इस दृष्टिकोण की नकल कर सकते हैं, लेकिन iPhone पर OS-level integration के स्तर तक नहीं पहुँच सकते।

On-Device LLMs, Siri, और iOS

  • एक काफी बेहतर, LLM-powered Siri और iOS 18 के “AI-focused” features की प्रबल इच्छा है, जिसमें local छोटे models और cloud fallbacks का मिश्रण हो।
  • फोन पर निकट भविष्य में GPT‑4-class models की यथार्थता पर राय विभाजित है; आम सहमति है कि छोटे models और server-side मदद अधिक संभावित हैं।
  • कुछ का तर्क है कि 7B model भी वर्तमान Siri से बहुत बेहतर प्रदर्शन करेगा; अन्य कहते हैं कि 7B/13B models अभी भी “dumb” और अविश्वसनीय हैं।

सुरक्षा, नियंत्रण, और Apple की सावधानी

  • कई लोग उम्मीद करते हैं कि सुरक्षा, liability, और brand concerns के कारण Apple किसी भी on-device LLM को काफ़ी सीमित करेगा, जिससे उसकी सामान्यता कम हो सकती है।
  • चिंता है कि वास्तव में अप्रत्याशित, पूरी तरह open-ended assistants Apple के tightly controlled user experience के साथ असंगत हैं।

Hardware, Training, और CUDA

  • ध्यान दिया गया कि Ferret को 8×Nvidia A100 GPUs पर प्रशिक्षित किया गया; चर्चा कि Apple अभी भी training के लिए standard Linux/Nvidia clusters पर निर्भर है।
  • इस बात पर बहस है कि क्या यह Apple Silicon की ML branding को कमजोर करता है; प्रतिवाद यह कि training और inference अलग हैं, और data centers एक commodity domain हैं।