仅仅通过关闭一些东西,每年削减 15 万美元 AWS 成本
随着工程师报告仅通过审计基础设施并关闭未使用或过度配置的 AWS 资源,就能削减数万甚至数十万美元,云成本优化正成为一个主要关注点。参与者描述了缺乏成本可见性、错位的激励机制以及管理层文化如何导致多年浪费——而工具、FinOps 实践、标签和自动化可以系统性地降低支出。讨论还涉及更广泛的权衡:从 serverless 与裸金属、厂商锁定,到员工是否应直接分享其带来的财务收益。
观察到的成本节省与容易下手的地方
- 许多评论者报告称,只需关闭未使用的资源或进行适当调整规模,就能获得巨大、甚至“尴尬地容易”的节省:
- 将单个账户的月成本从数十万美元降到其中的一小部分。
- 发现被遗弃的 S3 管道或测试数据库,每年耗费数十万到数百万美元。
- 发现诸如
node_modules之类的 CI 产物被发送到 S3 并由客户端下载,带来六位数的年度传输成本。
- 常见“罪魁祸首”:被遗忘的测试集群、无限保留的日志、过大的开发/测试基础设施、NAT 网关,以及无人认领的旧虚拟机/EBS 卷。
激励、奖金与反向效果
- 反复出现的主题是:真正省下大笔钱的工程师,往往并不会得到相应比例的奖金;最多也只是多一些会议或轻微表扬。
- 有人认为这会抑制成本优化(“何必呢?”),也有人说“这只是你该做的工作”。
- 按节省金额的一定比例发放奖励很有吸引力,但也被认为容易被滥用(“cobra farming”:先把成本人为抬高,再去“优化”)。
可见性、FinOps 与账单访问
- “看不见就无法优化”:大家强烈强调仪表盘、标签、每周成本报告和正式的 FinOps 实践。
- 几位评论者抱怨开发人员被挡在计费控制台之外,导致根本无法发现意外的成本飙升。
- 当成本和私有折扣被管理层保密时,工程师就会停止尝试优化。
开发/预发环境与自动化
- 如果非生产环境一直开着,或塞满测试数据,它们的成本可能比生产环境还高。
- 常见策略:自动关停计划、由标签支持的默认退出政策、强制资源生命周期的机器人,以及清理未使用资源的工具。
- 一些团队更进一步,使用“蓝绿” EKS 集群或可缩放到零的 serverless/Knative 架构。
云平台选择与架构
- 关于从大型云迁移到更便宜的提供商(如 Hetzner)或裸金属的争论:
- 优点:如果你不需要托管服务或严格的 SLA,潜在可节省 10 倍成本。
- 缺点:你需要自己重新实现托管服务,并以工程时间和可靠性风险为代价。
- Serverless 对突发型或开发工作负载可以大幅降低成本,但通常需要大规模重构。
组织文化与优先级
- 许多人认为浪费是文化产物:赶着交付功能、缺乏生产就绪评审,以及削弱成本削减激励的云承诺。
- 对大型企业而言,即使节省数百万美元也可能被视为零头;对小公司而言,这却关乎生存。