从 AWS 迁移到裸金属每年为我们节省了 23 万美元

从 AWS 迁移到裸金属服务器,据称每年节省约 23 万美元,这一说法引发了对云基础设施与自建基础设施经济性的更广泛讨论。评论者争论,在把迁移工作量、持续运维成本和冗余设计全部算进去之后,这样的节省是否仍然成立,并指出该公司的原 AWS 架构看起来存在过度配置和优化不足的问题。许多人最终认为,对于可预测、稳定的负载,机房托管或专用硬件通常要便宜得多;而云平台在快速迭代、托管服务以及突发或不确定需求方面仍然更有优势。

成本与节省之争

  • 许多人都同意,裸金属 / 机房托管(colo)对于稳定负载而言,本质上比 AWS 更便宜;有人称云的成本通常约为本地部署的 ~2–2.5 倍。
  • 几位评论者认为,所称每年节省 23 万美元被夸大了,因为:
    • 他们使用的是按需 EC2,没有使用预留实例或 Savings Plans(本可节省 ~35%+)。
    • 如果工作负载适合,Spot 实例和 Graviton(m7g)还能进一步大幅降低计算成本。
  • 反方观点:即使对 AWS 做了合理优化,评论者仍然预计裸金属能带来可观节省,尤其是在带宽和存储方面。
  • 有人指出,这笔节省大致相当于每年雇用 1 名美国中级工程师;在美国以外,可能足以雇用数名工程师。

隐藏成本与运维成本

  • 怀疑者强调:
    • 迁移工作量和风险没有被计入。
    • 持续的硬件工作:故障、容量规划、采购交期、远程支持(remote hands)。
    • 高可用存储(Ceph/Longhorn)、网络(Cilium/eBPF)、Kubernetes 控制平面,以及经过测试的备份和 PITR 的严肃数据库配置都很复杂。
  • 其他人回应:
    • AWS 环境同样需要专家(DevOps/SRE、finops、安全、YAML/IaC 工作、供应商管理)。
    • 对于小规模机群(1–2 个机柜),运维开销可以很小,尤其是在使用机房托管和自动化(PXE、Harvester、Proxmox 等)的情况下。

可靠性、高可用与架构

  • 有人强烈批评单机柜 / 单数据中心方案不如 AWS 多 AZ 可靠;在单个机柜上做“正常运行时间监控”被视为一种讽刺。
  • 支持者表示他们维护着一个 AWS 故障切换集群,可以很快拉起,但其他人指出 DNS、数据同步和故障切换演练都绝非小事。
  • 围绕 AWS 中的多区域 / 多云是否属于“Cloud 101”,以及本地部署是否能现实地达到那种韧性展开了争论。

云与裸金属:各自适合什么场景

  • 支持云的观点:
    • 通过托管服务(Fargate、S3、Aurora 等)可以快速试验。
    • 无需处理物理硬件、机房设施、发电机、HVAC。
    • 能够快速扩容,并在无需大量前期资本开支的情况下支持非常高的增长。
  • 支持裸金属 / 机房托管的观点:
    • 带宽和可预测计算成本上的节省非常大。
    • 很适合批处理 / ML、长时间运行的工作负载,以及成熟稳定的产品。
    • 如果避免使用云特定服务,性能可能更好(直接 NVMe、没有“吵闹邻居”),并且供应商锁定更少。

关于这个案例的元讨论与质疑

  • 有人认为他们最初的 AWS 规模(用于一个 uptime 应用的 28 节点 K8s)明显过度配置了。
  • 另一些人说这篇博客缺少关键细节(数据量、HA 设计、RTO/RPO、colo 条款),因此很难全面判断这个决定。
  • 还有几位指出,云在尽快验证业务方面依然有价值;之后再迁移出去,被视为合理的“第二阶段”优化。