Show HN: Ejecuta un Qwen de 80B en 4,3 GB de RAM en un Mac, y uno de 35B en un iPhone

Ejecutar modelos de lenguaje masivos en dispositivos de consumo puede ser impráctico hoy, pero muchos ven experimentos como Swiftlet —transmitiendo un modelo Qwen de 80B parámetros desde SSD en un Mac y un modelo de 35B en un iPhone— como pasos importantes hacia ese futuro. Los comentaristas debaten cuellos de botella de rendimiento (especialmente el ancho de banda de memoria y el prefill), el desgaste de los SSD y los límites físicos, mientras otros argumentan que los avances continuos en hardware, cuantización y arquitecturas de modelo acabarán haciendo que la IA local potente sea viable y común. El hilo también contrasta la inferencia centralizada en la nube con los modelos en el dispositivo, destacando trade-offs en coste, latencia, privacidad y control del usuario.

Rendimiento y viabilidad práctica

  • Varios comentaristas señalan que los tokens/segundo de decodificación son solo una parte de la historia; la fase de prefill se convierte en el cuello de botella, así que los prompts largos pueden tardar muchos minutos o más (por ejemplo, ~30 minutos para 10k tokens en un M5).
  • Las velocidades actuales se consideran demasiado lentas para programación o agentes interactivos, pero potencialmente aceptables para trabajos en segundo plano o por lotes durante la noche.
  • Algunos sostienen que puede ser más barato o sencillo alquilar una GPU durante un rato que dejar una máquina de clase escritorio encendida durante horas.

Almacenamiento, desgaste de SSD y ancho de banda de memoria

  • Se debaten las preocupaciones sobre “matar” SSDs mediante streaming intenso.
    • El consenso: las escrituras son el problema principal; el desgaste por lectura (read disturb) existe, pero probablemente no sea un problema práctico para cargas de trabajo no continuas de disco completo.
    • Otros informan de SSDs de larga vida útil y pocas fallas en el mundo real.
  • Varios comentarios subrayan que el ancho de banda de memoria, no los FLOPs brutos, es la restricción clave para los LLM locales, especialmente cuando los pesos están en SSD.

Valor de este trabajo y trayectoria a largo plazo

  • Muchos ven estos proyectos como algo fundacional: pasos tempranos, toscos e imprácticos que habilitan avances posteriores y a los “aficionados motivados”.
  • Los escépticos argumentan que esto es como “trepar a un árbol para alcanzar la luna” y no puede llevar de forma realista a modelos de 1T de parámetros en SSD baratos.
  • Los optimistas responden con las mejoras históricas del hardware y esperan que tanto el hardware como el software sigan mejorando, aunque se reconocen los límites físicos y de ancho de banda.

Inferencia centralizada vs. en el dispositivo

  • Un sector espera que más del 99% del uso siga centralizado por eficiencia, paralelización y hábitos de los usuarios.
  • Otros enfatizan la privacidad, la capacidad sin conexión y los modelos pequeños “suficientemente buenos” como fuertes impulsores de las configuraciones en dispositivo y on-prem.

Futuros del hardware: GPUs, Apple, ASICs, FPGAs

  • La discusión sobre FLOPs de GPU y tendencias del ancho de banda de memoria sugiere mejoras constantes pero no explosivas; la capacidad de memoria se queda atrás respecto a los FLOPs.
  • La memoria unificada y los NPUs de Apple se citan como bien adaptados a LLMs en dispositivo diseñados conjuntamente; algunos especulan sobre aceleradores optimizados para LLMs o incluso modelos integrados en silicio.
  • Se menciona la existencia de productos “modelo-en-silicio” y la especulación de que actores privados ya hacen esto para dominios nicho y críticos para la latencia.

Arquitecturas de modelo y ajuste de RAM

  • MoE y la dispersidad se consideran clave para encajar modelos grandes en RAM limitada, pero seleccionar qué expertos permanecen “calientes” en memoria no es trivial.
  • El proyecto expone una caché de RAM ajustable; el cuello de botella actual es la distribución en GPU más que el SSD, por lo que, por ahora, más RAM ayuda menos de lo esperado, aunque podría importar a medida que mejoren los kernels.

Seguridad, abuso y acceso web

  • Algunos temen que los modelos locales potentes y democratizados faciliten el hacking y las estafas; otros argumentan que las defensas también mejorarán con la misma tecnología.
  • Para agentes locales conscientes de la web, los comentaristas señalan las APIs de búsqueda o la meta-búsqueda autoalojada como opciones realistas; descargar una instantánea completa de la web se considera impracticable.

Detalles del proyecto y atribución

  • La línea “built in collaboration with Claude Code” se aclara como que el autor usó mucho un asistente de codificación con IA, no que hubiera una participación formal de ese proveedor.
  • Se señalan afirmaciones previas similares de “primera vez en un teléfono” para configuraciones de streaming de pesos, por lo que la singularidad de este hito se considera algo poco clara.