Hice una app que ejecuta Mistral 7B 0.2 LLM localmente en iPhone Pros

Ejecutar modelos de lenguaje grandes como Mistral 7B directamente en dispositivos iPhone Pro ya es viable, pero sigue limitado por la RAM, las opciones de cuantización y los límites térmicos. Los comentaristas comparan varias apps iOS y de escritorio para inferencia local, sopesando factores como la variedad de modelos, la velocidad (tokens por segundo), el historial de conversación y las compensaciones entre la privacidad en el dispositivo y la calidad superior de los modelos en la nube como GPT-4. También analizan la pila de hardware y software de Apple (Metal frente a Neural Engine), las políticas de la App Store, la justicia de los precios y la probabilidad de que futuras apps incluyan modelos especializados integrados para uso sin conexión.

Capacidades de la app y UX

  • La app ejecuta Mistral 7B cuantizado (y otros modelos pequeños) completamente sin conexión en iPhone Pros recientes y en algunos iPads/Macs.
  • El historial de conversación es una preocupación importante de UX: algunas herramientas no lo tienen, mientras que esta app y otras admiten guardar, buscar, reanudar y exportar chats.
  • Los usuarios quieren visibilidad del rendimiento (tokens/seg, uso de RAM) y controles más finos (selección de modelo, temperatura, prompts del sistema, temas, hápticos).

Rendimiento, modelos y limitaciones del dispositivo

  • Los modelos 7B en teléfonos están al límite: varios informes indican que 7B con cuantización de alta calidad es extremadamente lento (segundos por token) o no es viable salvo en iPads de 16 GB/Macs con Apple Silicon.
  • Los modelos más pequeños y con menos bits (p. ej., 1–3B, cuantización Q2–Q4) por lo general funcionan aceptablemente; 7B a menudo requiere una longitud de contexto reducida.
  • Algunos señalan que las GPU de centros de datos pueden entregar >100 tokens/seg para modelos 7B cuantizados con tamaño de lote 1, muy por encima de los teléfonos.

Estabilidad y bloqueos

  • Varios usuarios informan bloqueos duros del dispositivo, cuelgues de la app y fallos (a veces requiriendo reinicio forzado) al cargar modelos grandes o agresivamente cuantizados con Metal.
  • Las respuestas del desarrollador describen nuevas compilaciones con:
    • Comprobaciones más seguras del margen de RAM.
    • Fallback de GPU (Metal) a CPU cuando la memoria es escasa.
    • Cambio de los modelos predeterminados a cuantizaciones más ligeras para reducir los fallos.

Prompts del sistema y personalización

  • Varios se quejan de que muchas apps iOS de LLM no permiten a los usuarios definir prompts del sistema, llamándolas “inútiles” sin eso.
  • Algunas apps alternativas sí admiten prompts del sistema editables y preajustes de modelos personalizados.
  • Hay debate sobre cómo la plantilla de chat de Mistral representa los prompts del sistema frente a los mensajes normales.

LLM en el dispositivo vs en servidor

  • Consenso: los modelos locales son más lentos y peores que los mejores modelos alojados (p. ej., GPT-4), pero resultan atractivos por privacidad, uso sin conexión, experimentación y flujos de trabajo de nicho (RAG sobre datos personales, llamada de funciones).
  • Debate sobre rendimiento vs latencia: el batching mejora el rendimiento del servidor, pero solo perjudica moderadamente la velocidad por usuario si está bien ajustado.

Hardware de Apple, ANE y herramientas

  • La mayoría de las apps iOS de LLM usan CPU/GPU mediante Metal, no el Neural Engine, debido a:
    • Falta de APIs directas de ANE (solo CoreML).
    • Limitaciones actuales de CoreML para LLM (formas fijas, soporte débil de cuantización, grandes consumos de memoria).
  • Algunos esperan que futuras herramientas de Apple (CoreML, MLX) hagan prácticos los LLM basados en ANE.

Precio, reutilización y problemas de App Store

  • Las quejas sobre el precio se centran en pagar por una app que no funciona en muchos dispositivos; otros responden que los requisitos están claramente indicados y existen reembolsos.
  • Un comentarista alega que la app es en gran medida una versión con la interfaz cambiada de una app gratuita existente.
  • Apple, según se informa, no aplica “seguridad” de contenido para LLM más allá de las clasificaciones por edad; las salidas ofensivas no son un obstáculo por sí mismas.