Show HN: Executar um Qwen de 80B em 4,3 GB de RAM em um Mac, e um de 35B em um iPhone
Executar modelos de linguagem massivos em dispositivos de consumo pode ser impraticável hoje, mas muitos veem experimentos como o Swiftlet — transmitindo um modelo Qwen de 80B parâmetros a partir de SSD em um Mac e um modelo de 35B em um iPhone — como passos importantes rumo a esse futuro. Os comentaristas debatem gargalos de desempenho (especialmente largura de banda de memória e prefill), desgaste de SSD e limites físicos, enquanto אחרים argumentam que avanços contínuos em hardware, quantização e arquiteturas de modelo acabarão tornando a IA local poderosa tanto viável quanto comum. O fio também contrasta a inferência em nuvem centralizada com modelos no dispositivo, destacando trade-offs em custo, latência, privacidade e controle do usuário.
Desempenho e Praticidade
- Vários comentaristas observam que o número de tokens por segundo na decodificação é apenas parte da história; o prefill vira o gargalo, então prompts grandes podem levar muitos minutos ou mais (por exemplo, ~30 minutos para 10k tokens em um M5).
- As velocidades atuais são vistas como lentas demais para programação ou agentes interativos, mas potencialmente aceitáveis para tarefas em segundo plano ou jobs em lote durante a noite.
- Alguns argumentam que pode ser mais barato ou simples alugar uma GPU por um curto período do que deixar uma máquina de classe desktop ligada por horas.
Armazenamento, Desgaste de SSD e Largura de Banda da Memória
- Preocupações sobre “matar” SSDs por meio de streaming intenso são debatidas.
- O consenso: gravações são o principal problema; desgaste por leitura (read disturb) existe, mas provavelmente não é um problema prático para cargas que não sejam 24/7 em toda a unidade.
- Outros relatam SSDs de longa duração e pouca falha no mundo real.
- Vários comentários destacam que a largura de banda da memória, e não o FLOPs bruto, é a restrição-chave para LLMs locais, especialmente quando os pesos ficam no SSD.
Valor deste Trabalho e Trajetória de Longo Prazo
- Muitos veem projetos assim como fundamentais: passos iniciais ásperos e pouco práticos que viabilizam avanços posteriores e “amadores motivados”.
- Céticos argumentam que isso é como “subir em uma árvore para alcançar a lua” e que não pode realisticamente levar a modelos de 1T parâmetros em SSDs baratos.
- Otimistas contrapõem com ganhos históricos de hardware e esperam que tanto hardware quanto software continuem melhorando, embora os limites físicos e de largura de banda sejam reconhecidos.
Inferência Centralizada vs. No Dispositivo
- Uma corrente espera que 99%+ do uso permaneça centralizado por eficiência, paralelização e hábitos dos usuários.
- Outros enfatizam privacidade, capacidade offline e modelos pequenos “bons o suficiente” como fortes impulsionadores para configurações no dispositivo e on-premises.
Futuros de Hardware: GPUs, Apple, ASICs, FPGAs
- A discussão sobre tendências de FLOPs e largura de banda de memória em GPUs sugere ganhos constantes, mas não explosivos; a capacidade de memória fica atrás dos FLOPs.
- A memória unificada e as NPUs da Apple são citadas como bem adequadas para LLMs no dispositivo co-projetados; alguns especulam sobre aceleradores otimizados para LLMs ou até modelos embutidos no silício.
- Há menção a produtos existentes de “model-on-silicon” e especulação de que atores privados já façam isso em domínios de nicho e críticos em latência.
Arquiteturas de Modelo e Ajuste de RAM
- MoE e esparsidade são vistos como essenciais para encaixar modelos grandes em RAM limitada, mas selecionar quais especialistas permanecem “quentes” na memória não é trivial.
- O projeto expõe um cache de RAM ajustável; o gargalo atual é a distribuição pela GPU, e não o SSD, então RAM extra ajuda menos do que o esperado por enquanto, mas pode importar à medida que os kernels melhorem.
Segurança, Uso Indevido e Acesso à Web
- Alguns temem que modelos locais poderosos e democratizados facilitem hacks e golpes; outros argumentam que as defesas também melhorarão com a mesma tecnologia.
- Para agentes locais com consciência da web, comentaristas apontam APIs de busca ou meta-busca auto-hospedada como opções realistas; baixar um snapshot completo da web é considerado impraticável.
Detalhes do Projeto e Atribuição
- A frase “built in collaboration with Claude Code” é esclarecida como significando que o autor usou bastante um assistente de programação por IA, não que houve envolvimento formal desse fornecedor.
- Observa-se que há alegações anteriores semelhantes de “primeira vez em um telefone” para configurações com streaming de pesos, então a singularidade desse marco é vista como um tanto incerta.