Show HN:在 Mac 上用 4.3 GB RAM 运行 80B 的 Qwen,在 iPhone 上运行 35B
在消费级设备上运行大规模语言模型如今可能并不现实,但许多人认为像 Swiftlet 这样的实验——在 Mac 上从 SSD 流式运行 80B 参数的 Qwen 模型,以及在 iPhone 上运行 35B 模型——是通向未来的重要一步。评论者讨论了性能瓶颈(尤其是内存带宽和 prefill)、SSD 磨损以及物理极限,而另一些人则认为,硬件、量化和模型架构的持续进步最终会让强大的本地 AI 变得既可行又普及。该讨论串还对比了集中式云推理与设备端模型,强调了成本、延迟、隐私和用户控制之间的权衡。
性能与实用性
- 多位评论者指出,解码 token/秒 只是故事的一部分;prefill 会成为瓶颈,因此大提示词可能需要很多分钟甚至更久(例如,在 M5 上处理 10k tokens 约需 30 分钟)。
- 目前的速度被认为对编码或交互式代理来说太慢,但对后台任务或通宵批处理作业可能还算可接受。
- 有人认为,与其让一台桌面级机器运行数小时,不如短时间租用一块 GPU,可能更便宜或更简单。
存储、SSD 磨损与内存带宽
- 围绕通过大量流式加载“杀死” SSD 的担忧展开了讨论。
- 共识是:写入才是主要问题;读磨损(read disturb)确实存在,但对于非 24/7 全盘工作负载而言,实际中大概率不是问题。
- 也有人表示自己的 SSD 使用寿命很长,现实中几乎没见过故障。
- 多条评论强调,对于本地 LLM 来说,关键限制是内存带宽,而不是原始 FLOPs,尤其是在权重放在 SSD 上时。
这项工作的价值与长期轨迹
- 许多人认为这类项目具有基础性意义:它们是粗糙、当下不实用的早期步骤,却能为后续突破和“有动力的业余爱好者”铺路。
- 怀疑者则认为,这相当于“爬树去够月亮”,不可能现实地通向在廉价 SSD 上运行 1T 参数模型。
- 乐观者则以历史上的硬件进步为依据,预计硬件和软件都会继续改进,尽管他们也承认存在物理和带宽限制。
集中式推理 vs 设备端推理
- 一派预计由于效率、并行化和用户习惯,99% 以上的使用仍将保持集中式。
- 另一派则强调隐私、离线能力,以及“够好”的小模型是推动设备端和本地部署的重要动力。
硬件未来:GPU、Apple、ASIC、FPGA
- 关于 GPU FLOPs 和内存带宽趋势的讨论表明,性能会稳步提升,但不会爆炸式增长;内存容量落后于 FLOPs。
- Apple 的统一内存和 NPU 被认为很适合与设备端 LLM 协同设计;有人推测会出现面向 LLM 优化的加速器,甚至把模型直接烙进硅片。
- 文中提到已有“model-on-silicon”产品,并猜测一些私营主体可能已经在面向小众、低延迟关键领域这样做。
模型架构与 RAM 调优
- MoE 和稀疏性被视为在有限 RAM 中容纳大模型的关键,但决定哪些专家模块在内存中保持“热”并不简单。
- 该项目暴露了一个可调的 RAM 缓存;目前瓶颈是 GPU 调度而不是 SSD,所以现在额外 RAM 的帮助没有预期那么大,但随着 kernel 改进,未来可能会更重要。
安全、滥用与 Web 访问
- 有人担心普及化的强大本地模型会更容易被用于黑客攻击和诈骗;也有人认为,防御能力也会随着同样的技术一并提升。
- 对于具备网页感知能力的本地代理,评论者认为搜索 API 或自托管元搜索是现实可行的方案;下载完整网页快照被认为不切实际。
项目细节与署名
- “built in collaboration with Claude Code” 这句话被澄清为:作者大量使用了 AI 编程助手,而不是与该供应商存在正式合作。
- 也有人指出,以前已有类似“第一次在手机上”的流式权重方案说法,因此这一里程碑的独特性并不十分明确。