AWS Graviton 与定制芯片策略 - 自研芯片改写云的经济性

将 AWS 自研的 Arm 架构 Graviton 处理器以及 Inferentia、Trainium 等 AI 定制芯片如何改变云的成本结构和性能,与 Azure、GCP 进行比较。

云服务商为何自研芯片

在云计算的成本结构中,服务器处理器是最大的成本因素之一。传统上云服务商从 Intel 或 AMD 购买通用处理器装入服务器。但通用处理器为各种工作负载设计,对特定的云工作负载而言存在多余的功能,功耗效率和成本效率并非最优。AWS 对此选择了自研处理器这一根本性的做法。世代更新很快:2018 年 11 月第一代 Graviton 随 A1 实例登场,2019 年 12 月发布 Graviton2(M6g / C6g / R6g 等),2021 年 11 月发布 Graviton3(C7g),2022 年 11 月又为 Hpc7g / C7gn 加入了强化向量运算的 Graviton3E。此后 Graviton4、Graviton5 相继推出,世代数本身还会继续增加(截至 2026 年 9 月)。基于 Arm 架构并针对云工作负载优化的结果是,AWS 公布 Graviton 实例与同等 x86 EC2 实例相比成本最多低 20%,在同等性能下能耗最多少 60%(AWS 官方产品页面,截至 2026 年 9 月)。

Graviton 的技术优势

Graviton 处理器的优势不仅是价格便宜,而在于针对云工作负载的专门设计。Graviton4 每颗芯片搭载 96 个 Arm Neoverse V2 核心,根据 AWS 公布的数据(2023 年 11 月 Graviton4 发布时),与 Graviton3 相比计算性能提升最高 30%,内存带宽提升 75%。2025 年 12 月发布的 Graviton5 拥有 192 核和 5 倍的缓存,核间延迟最多降低 33%(AWS 公布值,截至 2026 年 9 月),面向实时推理、代码生成等持续需要高 CPU 吞吐的工作负载设计。实例系列随世代递增数字,Graviton3 世代的 C7g / M7g / R7g 之后是 Graviton4 世代的 C8g / M8g / R8g,内存优化型 R8g 最多可选 192 vCPU / 1,536 GiB 内存。AWS 公布这些实例与同等 x86 实例相比成本最多低 20%。

与 Azure 和 GCP 定制芯片策略的比较

(截至 2026 年 9 月)三家云服务商都已进入同时自研通用 CPU 和 AI 加速器的阶段,比较的焦点已从「是否拥有定制芯片」转向「积累了多少世代」。Azure 长期依赖 Intel 和 AMD 的通用处理器,但 2023 年发布了自研 Arm 架构处理器 Cobalt 100,搭载 128 核,面向通用工作负载设计,同期还发布了面向 AI 工作负载的 Maia 100。GCP 于 2016 年公开了自用的 TPU(Tensor Processing Unit),2018 年以 Cloud TPU 的形式对外提供。TPU 在 Google 的内部工作负载(搜索、翻译、相册等)中有大规模使用的实绩。在通用计算方面,Google 也推出了自研 Arm 架构 CPU Axion,以 C4A 实例提供。也就是说,「同时自研通用 CPU 和 AI 专用芯片」这一格局已不再是 AWS 独有。事实上仍有差距的是世代数和开始提供的年份。Graviton 自 2018 年第一代起不断更新世代,每一代都把云工作负载的反馈融入设计。在通用 Arm CPU 的谱系上,AWS 比 2023 年的 Cobalt 100 和之后推出的 Axion 积累了更多年数。另一方面,在 AI 专用加速器的对外提供上 GCP 的 TPU 先行,AWS 以 Inferentia 和 Trainium 后来跟上。哪一方更有利取决于工作负载和软件资产所在的位置。与其解读为「只有这一家是全面的」,不如根据自己使用的运行时和框架针对哪种芯片做了优化来选择,这样更为实用。

Inferentia 和 Trainium - AI 时代的定制芯片

(截至 2026 年 9 月)随着生成 AI 的快速普及,AI 工作负载的计算需求爆发式增长。NVIDIA GPU 是 AI 工作负载的事实标准,但需求增长快于供给,采购困难的时期持续了很久。AWS 针对这一课题开发了两种定制芯片:面向 AI 推理的 Inferentia 和面向 AI 训练的 Trainium。对于搭载 Inferentia2 的 Inf2 实例,AWS 公布其与同等 EC2 实例相比性价比最多高 40%,每瓦性能最多高 50%。需要注意的是,这些数字以性价比和能效指标表示,而不是「成本减半」。Inf2 单个实例最多通过 NeuronLink 连接 12 颗 Inferentia2 芯片,提供最多 384 GB 加速器内存,因此可以把数千亿参数规模的模型分布到多颗芯片上推理。它针对大型语言模型(LLM)推理、图像识别、自然语言处理等在生产环境运行已训练模型的工作负载做了优化。训练侧的 Trainium 也在更新世代,在以 Trainium2 构建的 UltraCluster 大规模训练环境之后,采用 3 nm 工艺的 Trainium3 登场。Trn3 UltraServer 单台最多扩展到 144 颗 Trainium3 芯片,AWS 公布其与 Trn2 UltraServer 相比性能最多 4.4 倍、内存带宽 3.9 倍、每瓦性能 4 倍,EC2 UltraCluster 3.0 更可扩展到数十万颗芯片规模。由于每次世代更替规模数字都会更新,与其记住特定的绝对值,不如把握「每台芯片数和带宽每一代都大幅增长」这一趋势更为实用。这些定制芯片有可能减少对 NVIDIA GPU 的依赖,从根本上改变 AI 工作负载的成本结构。NVIDIA GPU 也会继续提供,用户可以根据需求在 GPU 和定制芯片之间选择。

定制芯片的经济影响

定制芯片策略的经济影响不仅限于芯片价格差。使用自研芯片,AWS 可以把处理器规格与服务器设计一体决定,不必为云工作负载不需要的功能付出成本。Graviton 是在获得 Arm Neoverse 核心授权的基础上设计的,零部件成本并不会变为零,但与直接采购通用处理器相比,AWS 获得了自行打磨单位性能成本的空间。其结果就是 AWS 公布的「Graviton 实例与同等 x86 实例相比成本最多低 20%」。此外,能效的提升也降低了数据中心的运营成本。AWS 表示 Graviton 实例在同等性能下比同等 EC2 实例最多少用 60% 的电力。数据中心的电力和冷却成本在运营费用中占比很大,这一效率改善会长期作用于成本结构。再加上以 AWS 的采购规模,每颗芯片的微小差异也会按数量累积。这种规模经济为持续投资定制芯片提供了正当性,形成进一步提升性能和降低成本的循环。

迁移的容易度与生态系统的成熟

定制芯片的优势再高,如果无法迁移现有工作负载就没有意义。向 Graviton 的迁移对许多工作负载来说相对容易。Linux 工作负载只需重新编译为 Arm 兼容二进制即可。主要编程语言(Java、Python、Node.js、Go 等)和框架已完全支持 Arm。容器化工作负载通过多架构镜像可同时支持 x86 和 Arm。AWS 提供迁移指南和兼容性检查工具,支持顺利过渡。Amazon Linux 2023、Ubuntu、RHEL 等主要 Linux 发行版都提供 Arm 版本。

总结

AWS 的定制芯片策略覆盖通用计算(Graviton)、AI 推理(Inferentia)、AI 训练(Trainium)三个领域。Graviton 自 2018 年第一代起不断更新世代,AWS 公布其与同等 x86 实例相比成本最多低 20%,在同等性能下能耗最多少 60%。托管服务和 ISV 产品的支持不断扩大,迁移的门槛已经降低。另一方面,Azure 拥有 Cobalt 100 和 Maia 100,GCP 拥有 Axion 和 TPU,「同时自研通用 CPU 和 AI 专用芯片」的格局已成为三家共同的局面(截至 2026 年 9 月)。差距不再在于是否拥有定制芯片,而转向世代的积累、支持服务的广度,以及自己的软件资产针对哪种芯片做了优化。在定制芯片从根本上改变云成本结构的潮流中,Graviton 凭借迁移的容易度和支持服务的广度,是最容易先纳入考虑的选项。

参考资料(AWS 官方)

本页的第一手信息来源是 AWS 官方网站及官方文档。最新的规格与价格请以下列官方页面为准。

如本页内容与官方文档不一致,请以官方文档为准。