单块 AMD MI300X 上的 DeepSeek V4 Flash

开发者们正在尝试在单块 AMD MI300X GPU 上运行 DeepSeek V4 Flash 大语言模型,探索高端数据中心硬件是否能让自托管推理在经济和技术上都变得可行。评论者权衡了云 API 与自有或租用 GPU 的取舍,强调 token 定价、利用率、隐私、上下文窗口限制和硬件可得性等因素。讨论也把这些选择放在更广泛的 AI 投资热潮中,质疑当前基础设施支出和补贴定价是否可持续。

硬件可得性与外形规格

  • 单块 MI300X 很难/很贵;常见的是约 €250k 的 8-GPU 机箱。
  • 有人声称能在二级市场找到单独的 OAM 模块,但没有背板/适配器时实际上不实用。
  • MI350P 被强调为更易获得的 PCIe 选项(144 GB HBM),但仍然是面向服务器的:被动散热、高功耗,需要很强的气流或定制散热。
  • 讨论提到 600W+ 加速器的热现实:它们就像空间加热器,能明显把房间加热。

AI 泡沫、需求与融资

  • 争论当前 AI 投资是否是泡沫。
  • 一方观点:万亿级 AI capex 由债务融资(有文章引用约 $3T),利息可能已超过当前 AI 收入 → 若 AI 不能替代大量劳动或引发彻底的社会变化,则不可持续。
  • 反方观点:需求“真实且不会消失”;之前“泡沫很快会破”的预测是错的;据称收入和使用量都在飙升。
  • 有人区分真实需求与依赖补贴定价的需求;担心如果廉价资本枯竭,需求可能下降。

推理经济学与 DeepSeek 定价

  • 讨论 MI300X 云租赁约 ~$2/小时,可能是以原始权重运行 DeepSeek V4 Flash 的最便宜方式,但细算后边际利润很薄,甚至可能比直接用 API 更差。
  • token 成本模型显示,如果实现得当,缓存 token 的服务成本极低;DeepSeek 的低价部分上是由 agentic 工作负载中的高缓存复用所支撑。
  • 对前沿实验室是否有显著利润存在分歧:有人认为 API 推理有正毛利;也有人怀疑这不足以覆盖完整的 R&D 和训练成本。
  • 假定 DeepSeek 几乎按成本运营,并将用户数据货币化用于未来训练。

自托管 vs API 使用

  • 多数人认为,考虑电费、折旧和吞吐量后,对个人而言自托管通常不比 API 访问更便宜。
  • 也有人强调非成本原因:隐私、监管约束、知识产权保护、自定义解码/注意力引导,以及相比高度批处理的商业端点更稳定的延迟和质量。
  • 对团队来说,单块 MI300X 或小型集群可以为多个 coding agents 和批处理工作负载提供服务,并具备很强的隐私保障。

性能与优化

  • 据称 DeepSeek V4 Flash 在 MI300X 上的吞吐量(150–800+ tok/s)表现不错,但仍低于 DeepSeek 自己的 DSpark 论文中 H800 的吞吐量(15k tok/s/GPU)。
  • 需要指出,多 GPU、网络良好且并行度很宽的系统能实现超线性吞吐扩展,所以单 GPU 数字不能直接比较。
  • 有人指出,基于 NVIDIA 的技术栈(例如使用 sglang/dynamo)每 GPU 可以达到高得多的 token 速率;AMD 技术栈仍有优化空间。

模型规模、MoE 与上下文窗口

  • DeepSeek V4 Flash 约有 2840 亿总参数(MoE),并使用 MXFP4 量化;其他中国前沿模型列在 1.6T–2.8T 范围内。
  • 关于美国前沿模型规模的传闻从 5T 到 100T 不等,发帖者一致认为真实数字并不清楚。
  • 在单块 144 GB 卡上以完整规格(1M 上下文、多个用户)提供 V4 Flash 似乎超出承载能力;有人建议至少需要两块 MI350P。
  • 在 MI300X 上采用 256k 上下文被视为实用折中;一些用户表示 1M 上下文过头,而 256k 的质量损失不大。

软件栈、数据与前人工作

  • ROCm 被确认可用于前沿推理,而且据称已被大型实验室使用;有人对绕过更高层栈、直接与硬件命令缓冲区对话很感兴趣。
  • 来自用户交互的数据(尤其是 agent traces、代码库、用户情绪)被认为对训练和 RL 微调极具价值,即使它很嘈杂。
  • 还提到 DwarfStar 等前人工作曾用更少内存实现类似模型,但尚未针对 MI300X 调优,这也解释了它未出现在 repo 的“prior art”部分。