मैंने एक ऐप बनाया है जो Mistral 7B 0.2 LLM को iPhone Pro पर लोकली चलाता है

Mistral 7B जैसे बड़े language models को सीधे iPhone Pro devices पर चलाना अब संभव है, लेकिन RAM, quantization विकल्पों, और thermal limits से अभी भी सीमित है। टिप्पणीकार local inference के लिए कई iOS और desktop ऐप्स की तुलना करते हैं, model variety, speed (tokens per second), conversation history, और on-device privacy तथा cloud models जैसे GPT-4 की बेहतर quality के बीच trade-offs को देखते हैं। वे Apple के hardware और software stack (Metal बनाम Neural Engine), app-store policies, pricing fairness, और इस संभावना की भी पड़ताल करते हैं कि भविष्य के ऐप्स offline use के लिए विशेष, embedded models के साथ आएँगे।

ऐप की क्षमताएँ और UX

  • यह ऐप क्वांटाइज़्ड Mistral 7B (और अन्य छोटे मॉडल) को हाल के iPhone Pro, कुछ iPad और Macs पर पूरी तरह ऑफ़लाइन चलाता है।
  • बातचीत का इतिहास एक बड़ा UX मुद्दा है: कुछ टूल्स में यह नहीं होता, जबकि यह ऐप और कुछ अन्य ऐप चैट को सहेजने, खोजने, फिर से शुरू करने और निर्यात करने का समर्थन करते हैं।
  • उपयोगकर्ता प्रदर्शन की दृश्यता चाहते हैं (tokens/sec, RAM उपयोग) और अधिक सूक्ष्म नियंत्रण भी (मॉडल चयन, temperature, system prompts, themes, haptics)।

प्रदर्शन, मॉडल, और डिवाइस सीमाएँ

  • फ़ोनों पर 7B मॉडल सीमारेखा पर हैं: कई रिपोर्टों में उच्च-गुणवत्ता क्वांटाइज़ेशन वाले 7B मॉडल बेहद धीमे (प्रति टोकन सेकंड) या 16GB iPads/Apple Silicon Macs के अलावा व्यवहार्य नहीं बताए गए हैं।
  • कम-बिट और छोटे मॉडल (जैसे 1–3B, Q2–Q4 quantization) आम तौर पर स्वीकार्य रूप से चलते हैं; 7B को अक्सर घटाई गई context length की आवश्यकता होती है।
  • कुछ लोग नोट करते हैं कि data center GPUs batch size 1 पर quantized 7B मॉडलों के लिए >100 tokens/sec दे सकते हैं, जो फ़ोनों से बहुत आगे है।

स्थिरता और क्रैश

  • कई उपयोगकर्ता Metal के साथ बड़े या आक्रामक रूप से quantized मॉडल लोड करते समय हार्ड डिवाइस लॉकअप, ऐप हैंग और क्रैश की रिपोर्ट करते हैं (कभी-कभी forced reboot की आवश्यकता होती है)।
  • डेवलपर की प्रतिक्रियाएँ नई builds का वर्णन करती हैं जिनमें:
    • सुरक्षित RAM headroom checks।
    • मेमोरी तंग होने पर GPU (Metal) से CPU पर fallback।
    • क्रैश कम करने के लिए default models को हल्के quantizations में बदलना।

System prompts और customization

  • कई लोग शिकायत करते हैं कि बहुत-से iOS LLM ऐप उपयोगकर्ताओं को system prompts सेट नहीं करने देते, और इसके बिना उन्हें “बेकार” कहते हैं।
  • कुछ वैकल्पिक ऐप्स editable system prompts और custom model presets का स्पष्ट समर्थन करते हैं।
  • इस पर बहस है कि Mistral का chat template system prompts बनाम सामान्य संदेशों को कैसे दर्शाता है।

डिवाइस पर बनाम सर्वर LLMs

  • आम सहमति: स्थानीय मॉडल, शीर्ष hosted models (जैसे GPT-4) की तुलना में धीमे और कमजोर होते हैं, लेकिन privacy, offline use, experimentation, और niche workflows (personal data पर RAG, function calling) के लिए आकर्षक हैं।
  • throughput बनाम latency पर चर्चा: batching सर्वर throughput सुधारती है, लेकिन यदि अच्छी तरह tuned हो तो प्रति-उपयोगकर्ता गति पर केवल मामूली प्रभाव डालती है।

Apple हार्डवेयर, ANE, और tooling

  • अधिकांश iOS LLM ऐप्स Neural Engine के बजाय CPU/GPU via Metal का उपयोग करते हैं, क्योंकि:
    • direct ANE APIs की कमी (CoreML only)।
    • LLMs के लिए CoreML की वर्तमान सीमाएँ (fixed shapes, weak quantization support, large memory footprints)।
  • कुछ लोगों को उम्मीद है कि भविष्य के Apple tooling (CoreML, MLX) ANE-based LLMs को व्यावहारिक बनाएँगे।

Pricing, reuse, और App Store मुद्दे

  • कीमत संबंधी शिकायतें उस ऐप के लिए भुगतान करने पर केंद्रित हैं जो कई devices पर काम नहीं करता; अन्य लोग जवाब देते हैं कि आवश्यकताएँ स्पष्ट रूप से बताई गई हैं और refunds मौजूद हैं।
  • एक टिप्पणीकार का आरोप है कि ऐप काफी हद तक एक मौजूदा मुफ्त ऐप का re-skinned version है।
  • रिपोर्ट के अनुसार Apple LLM content “safety” को age ratings से आगे enforce नहीं करता; offensive outputs अपने आप में blocker नहीं हैं।