# 速度即竞争力 — Amazon Graviton5 × 当日达电商的性能跃迁

> **合规声明（生成式 AI 服务）**：前述特定亚马逊云科技生成式人工智能相关的服务目前在亚马逊云科技海外区域可用。亚马逊云科技中国区域相关云服务由西云数据和光环新网运营，具体信息以中国区域官网为准。
> 
> **完整资料：如果想了解更多内容可以访问:https://events.amazoncloud.cn/china-summit-on-demand/
> 
> **免责声明**：本摘要仅为便于您了解峰会内容而提供，我们不对其完整性及准确性作出任何保证，且不构成任何建议或结论。相关内容仅供参考，实际内容以峰会回放视频为准。

## 一、基础信息

- **会议类型**：专题演讲
- **Persona**：AI 基础架构师
- **时间信息**：6月23日 | 14:30 - 15:00
- **标题**：速度即竞争力 — Amazon Graviton5 × 当日达电商的性能跃迁
- **PDF 资料**：无
- **视频回放**：有

## 演讲人信息

### 会议信息
- **地点**：上海世博中心（2026 亚马逊云科技中国峰会）
- **日期**：2026年6月23日（Day 1）
- **时间**：14:30 - 15:00
- **会议类型**：专题演讲
- **面向 Persona**：AI 基础架构师

### 亚马逊云科技演讲人
- **袁泉**：计算解决方案架构师

### 客户 / 合作伙伴演讲人
- **王中博/Wang Zhongbo**(Joybuy):SRE 工程师

## 二、会议资料 PDF 转录内容

（本场次无 PDF 资料）

## 三、会议回放视频转录内容

各位好，接下来由我来为大家分享另外一个主题
有感谢刚才 Windy 给大家分享的 GPU 的这个
这个案例以及刚才由苏伟老师给大家讲的 EKS 和 Kata
那么我在这里呢给各位来分享一个
我们有另外一个主题就是 Graviton
那它和前面产品的区别是，它是一款 CPU 处理器
基于这款 CPU 处理器，我们向各位提供云服务器产品
那我本身呢是这个亚马逊云科技解决方案架构师袁泉
今天还会和另外一位我们的客户王中博给各位来一起分享这样的一个这个话题啊
那我们今天这个 Agenda 其实也比较简洁
第一 Part 就是我向各位来分享一下
我们有 Graviton 的处理器的最新的一些这个进展
然后会由我们的客户王中博老师向各位分享在电商线上零售这个行业
他们在使用有的 Graviton 的一些收益以及一些这个洞察啊
那我们在介绍第一 Part 我们 Graviton 的最新进展之前
我们还是来看一下我们现在所处的一个时代
无疑我们现在是处于一个 Agentic AI 大爆发的时代
无论去年的 Manus 还是由今年年初的 AI Agent 产品以及我们的 Hermes
所有这些都意味着我们的 Agent AI 这个领域在一个前所未有的爆发的一个这个阶段
那我们的由亚马逊云科技的 CEO Andy Jassy 说过
在这个时代 CPU 会有一个像 GPU 一样伟大的故事
这个呢是我们现在所处时代的一个这个背景
那我再向各位分享两个我们在由最近三个月的这个时间内
我们的一些这个进展
这个里面有列举两个这个客户
第一个客户呢就是这个 Meta
Meta 即将成为我们全球最大的 Graviton 用户之一
那他在那他现在已经计划去部署数千万核的
有 Graviton 来承载他的实时推理
然后还有他的代码生成的一些上线的一些业务
以及一些 Agent 编排这样的场景
那所有这些业务都是通过我们的 Graviton 的这个
这款由这处理器的服务来进行这个承载的
第二个就是由这 Snowflake
Snowflake 大家可能也比较了解
他是一个传统做数据分析
这样的一个这个厂商
那他呢
在最近也刚刚和亚马逊云科技签署了一个五年的协议
那这个那这是一个6 Billion 这样的一个 Deal
那亚马逊也会为他提供大量的 Graviton 实例来承载他数仓的工作负载
以及 AI 推理以及他自有的 Cortex AI 这样的解决方案的一些这个负载
那所有这些案例都表示我们有 Graviton 正在以一个非常快的速度
被全球头部企业来进行采用和这个部署
OK
那我们在介绍有的
我们在介绍 Graviton 之前
我们还是来看一下亚马逊云科技过去十年芯片创新的历程
这张图呢是我们三个主要的这个由自研芯片的这个产品
由第一排的是我们 Nitro 的这个演化
所有大家在亚马逊云科技上使用的 EC2 云服务器都是以 Nitro 为基础的
第二排呢就是我们今天的这个重点 Graviton 的这个处理器
那他的这个定位呢是一款通用的 CPU 的这个处理器
他和我们在用的英特尔的由至强 AMD 的 EPYC
所有这些处理器的定位都是完全一样的
那由第三排就是我们近些年经常在用到的一些 AI 芯片的一些这个产品
Inferentia, Trainium 这样的一些这个产品
那我们接下来由主要来看有 Graviton
我们为什么要提供有 Graviton 这样一款产品
那最核心的一个目的就是我们有 Graviton 要引领云上处理器云上云服务器的一个这个性价比
我们每一代产品的迭代和更新都是以一个非常好的性价比的提升
作为这个基础来进行这个演进的
那我们也在这个图里面也可以看到我们自2018年以来
由第一代有 Graviton 发布到现在已经有八年的这个时间
我们在去年的 re:Invent 大会上发布了由第五代的 Graviton 这个处理器
我们可以看到在这个图里面在这个处理器我们从一颗比较小的这个处理器
只有16 核心演进到由第五代有192 核心
以及我们演进到三纳米这样的一个工艺
还是在这个领域是一个有比较好的一个这个进展
那我在这里面再给大家有分享两个数字
那由这第一个数字呢
是我们在过去的两年
由这两年中我们亚马逊所有的云数据中心中超过一半的 CPU 的容量
是我们自研的这款有 Graviton 的这个处理器
那第二个数字呢
是全球 top 1000 的这个客户中已经有接近
98% 这些客户都在采用有 Graviton 所提供的服务
不管是云的服务器还是托管服务
那这里那这个两个数字背后有代表什么呢
我认为由这第一个数字50% 这个背后是代表我们亚马逊自己的一个决心和这个态度
第二个呢是我们98% 这个数字有代表我们所有客户的一些这个反馈以及这个成绩
那我们再来看一下这款这个处理器能承载什么样的应用
你能将什么服务部署在这样一款处理器的这个云服务器上面
那我刚才其实有提到有 Graviton 的一个定位就是一款通用的这个处理器和至强和 EPYC 没有任何的这个区别
所以我们在云上提供的 Graviton 的这款云服务器的这个服务
它可以承载广泛的工作负载
几乎在你的生产服务中所有的工作负载它完全都可以来进行承担
有小到有比较简单的像我们的 Web 和应用的服务器
还有一些像由其他的由这个数据分析机器学习视频转码以及还有一些缓存、容器这样的微服务所有这样的你生产中可能会用到这些负载在 Graviton 的这个服务上都可以有进行这个承载和这个部署
OK 那我们大概看了有 Graviton 的一个发展以及它的适用范围之后
我们可以在专门来看一下我们 Graviton5 这款最新的这个处理器
那大家在这里面看到的这个就是我们192 核的这款处理器的一个逻辑的一个框图
那在这个处理器的这个周围我们也看到分布着12个 DDR5 的内存的这个通道
以及我们由最新的 PCIe6 的这样的外设的这种这个通道
那我们在这里面和 Graviton4 去对比有一些比较主要的这个参数
大家可以来看一下第一我们刚才提到这是一款192 核的这个处理器
这个数字是可以去对比可以对比主流的英特尔的第 6 代、AMD 的第 5 代这样处理器的一个这个 size
然后由第二点呢就是我们大幅度的将主频由以前的 2.8 GHz 提高到了 3.3 GHz
这样的一个主频
而且这个主频是一个固定频率的主频在运行
它不像英特尔 AMD X86 的一些实例
它可能在有负载比较高的时候
它这个频率会降低
那么我们这个主频是一个有固定恒定的一个主频在运行
那由第三点呢
就是我们也可以看到了
在整个这个 socket 的我所有的物理核心都要去共享我的 L3 的这个缓存
那我们也有针对性的将 L3 Cache 的容量提高到了五倍
那么这样的话
整个我整个这个 socket 可以有192M
这样的一个 L3 Cache
这意味着什么呢
这有意味着你可以将更多的数据缓存到我的 CPU 处理器的内部
我不用去等待
它从这个内存中去读取
这个数据再进行处理
那这个延时是会以一个很大的量级在这个降低的
那在最后呢
就是我们这款处理器的 NUMA 之间的延时
那么也可以减少33% 这样的一个下降
那有除了由刚才我们分享的几个最主要的这个参数之外
我们还有其他的一些指标也给各位来看一下
第一呢
是我们这款处理器的物理核心是采用 Arm Neoverse V3 这样的一个架构
这个在目前也是由这个最新的
第二呢
是我们可以完全兼容 Armv9.2 的指令集
那那像由其他的由刚才我们提到了 L3 Cache 已经有192M
那我们 L2 Cache
也就是每个物理核心的缓存还是有保持两兆这样的一个这个容量
那在由这个内存这块呢
我们现在是云上最快的 DDR5-8800 频率这样的一个
一个这个速度
那么内存的这个延时
我们也可以做到有100 纳秒以下的这个延迟
那像在最后就是我们还有这个 PCIe 6 这样的一个配置
那尤其不管是你去对网络呀
还是存储啊
这样的一些这个速度
访问速度都会有这更快
那我们除了这款 CPU 处理器之外
我们基于这款处理器的 EC2 云服务器的实例
那么在目前现在也已经全球可用
那我们最初给客户提供的是 M9g 和 M9gD 这两款这个实例
那这个实例呢
它本身是 VCPU 和由这个内存的比例是1 比4 这样的一个比例
那也比较适合你跑一些通用的工作负载
这样的一些服务啊
这个大家现在美国的一个 Region
以及在欧洲的一个 Region 都可以有买到啊
OK
那我们来看一下 Graviton5 的性能的一些这个提升
那我们在做发
那我们在由去年发布这款实例的时候
尤其是给有提供了一些这个参考
有比如说我们在最常用的 Python Ruby on Rails
Java Web 单体应用 Load Balancer、NGINX Load Balancer 以及 MySQL 数据库
这样的一些服务上我们都可以看到
那它相比于第四代的有 Graviton 性能提升
基本上都能做到27% 到 47%
这样的一个这个范围
那我们也不强调说一定你的应用就能达到一个什么样的一个效果
我们也提倡用户
也推荐用户
用你自己的这个负载来运行一下
来看一下能给你带来怎么样的一个性价比的提升成本的这个节省
那我们也会有一些很早期的客户
有提供了一些这个反馈
包括有 SAP HANA
有 Snowflake
Airbnb
这些有国外的客户
有提供了一些这样的这个反馈
那我们所有
我们现在随着第五代有 Graviton 的这个发布
我们整个 Graviton 实例其实已经覆盖了
基本上有四代了
第二代
第三代
第四代
和第五代
那么在这个
那么在这个数字中
其实我们可以看到
如果是 M8g 的话
是现在我们最主流在使用的第四代的有 Graviton 实例
那么 M9g
就是我们现在刚刚 GA 的第五代有 Graviton 的这个实例
那同样
我们 Graviton 实例也覆盖了现在 EC2 这个实例里面
所有的这个类型
不管是通用型
计算优化型
内存优化型
存储优化型
也都已经有覆盖了
这个大家如果有兴趣来做的话
可以去看一看
OK
那有除了我们在云服务器上来提供这样的服务
之外
我们在亚马逊
几乎最主流的所有的这些托管服务上面
也都提供了 Graviton 的这个选项
那这个里面像
像一些比较常用的
有在 Aurora
Aurora 数据库
ElastiCache 缓存
DocumentDB 文档数据库
那所有这些我们都提供了一个有 Graviton 选项
而且我们可以看到在这个里面的数字
那所有的这个实例中
在使用有 Graviton 选项的实例
基本上都超过了一半
这个是一个比较大的一个进展
OK
那我们再来看一下 ARM 的这个生态
尤其是我们在谈有 Graviton 之前
有一个非常好的这个案例
就是我们的苹果电脑
大家都知道在现在 AI 的这个时代
很多的有开发者
无论是有个人开发者
还是在企业中
几乎所有做开发的同学都会用苹果电脑
那苹果电脑现在几乎全
全都是基于 ARM 这样的一个架构
那第二
这大家所有使用的最主流的
现在的一些编程语言
Node
Node.js 也好
Golang 也好
Rust 也好
这些语言都是对 ARM 开箱即用的一个语言
那这就有了一个非常好的基础
我的这个软件是基于 ARM 去进行开发
去基于 ARM 这种这个天
很天然的有适配的这样的一个语言来开发
那我在云上去部署我的服务的时候
自然有的 Graviton ARM 就是第一的这样的一个选项
这个是一个非常顺畅的一个逻辑
那现在的 ARM
现在 ARM 的生态已经不再像十年前了
在现在的这个生态
我们现在联合 ARM 这个公司
不管是我们去完善开源的软件也好
还是很多去推动很多商业公司
去适配它的软件也好
我们现在 ARM 的这个生态中已经有
已经有超过1160个
不管是开源还是商业的软件
能够覆盖我们 ARM 的这个生态
那这个里面有大家经常用到的
像有容器
有 DB Big Data
所有这些大家经常用到的软件的
这个范畴内基本上都是能够支持 ARM64 的生态的
那在其他的我只有了这个处理器
有了这个云的这个服务器之外
那么还不够
我还要通过 ARMOS 去进行部署
所以 ARMOS 的现在这些主流的发行版
都支持 ARM64
那它会帮助用户解决很多
屏蔽掉很多架构这方面的一些
这个细节来进行这个使用
第二就是经常使用到的容器的这个生态
不管是你去看
我的 Orchestrator EKS 也好还是 Kubernetes 也好
都能够支持 ARM64
这个有这个生态
那你的这个容器的这个镜像
镜像仓库
Docker 不管是有 ECR
所有这些也都能支持这个 ARM
像有其他的
还有一些 Docker 的一些
Bottlerocket 的这样一些 OS
Service 的一些服务
都能够支持有 Graviton 的这个选项
那在最后就是我们的 DevOps 这个生态
那我可以一份代码
然后通过 DevOpsCI 的这个方式
去生成我两个架构不同的这个镜像
DevOps 不管这里面主流的
像 GitHub 啊 Travis
Jenkins 所有现在这些在用的
CICD 主流的方案都能够支持
有这个 Graviton
那我们其实刚才谈了
我的这个处理器
我的这款云的这个服务器
我的托管服务
都能够支持有 Graviton
那我们最终还是要交付给客户的
那我们在这样一个电商服务
是我们几乎每天都要使用到的一个
产品和这个服务
那由对于电商行业的这个格局
我们有什么样的改进
有使用有 Graviton 会有什么样的受益
那由这接下来呢
我们有请 Joybuy 的
SRE 工程专家王中博
给大家来做一个这个分享
谢谢各位
下一页
OK
Hello 大家好
我是来自 Joybuy
SRE 团队的中博
感谢袁泉老师刚才的这个分享
那接下来我来分享一下
我们 Joybuy 团队在
Graviton 里的一些实践的案例
那首先做个介绍吧
对
然后 Joybuy 呢
是京东旗下面向欧洲市场的
一个在线零售业务
那京东大家其实非常熟悉
那 Joybuy 呢
其实也是承袭了
京东在零售以及技术上
还有物流上的能力
坚守着同样品质
与速度与信任的原则
那说到速度
那从业务的角度来讲
那速度可能是说
用户下单更快
那用户的这个搜索更快
用户收货更快
那我们就在想
通过 SRE 的角度
如何能够把我们的基础设施的快
赋能给用户
赋能给业务
那首先
那接下来就是围绕着这个 Graviton
来讲一下
那首先我们为什么会选择
Graviton 这个处理器
就是首先随着业务的不断增长
那我们的云账单数据
其实也会不断的增长
那我们其实面临了一件
所有 SRE 团队都会有一件事
就是成本治理
那我们在做成本治理的过程中呢
其实就是秉持了一个
开源跟节流的一个思想
那一方面我们去提升资源的利用率
那另一方面我们其实也在想
有没有一种更便宜的
然后它又能承担现有的流量
或者承担更多流量的一个计算资源
那我们就看着有点不太可能
但是我们把这个问题
就提给了我们的 SA 的同学
那跟 SA 的同学共同去讨论之后
它给出了我们一个答案
就是 Graviton
说这个 Graviton 的处理器
它的单价更便宜
然后性能又更强
那在 Graviton 4 的时代
我们其实就开始去尝试
去部署跟使用
那首先呢
我们在太低币上
Storage
以及一些常见的中间件
或者是数据库的数据服务上
去使用了一些 Graviton 4 的处理器
那首次使用下来之后
发现平均单核的成本能够降低30%
整个的成本下降了30%
对
然后
所以在做这件事的过程中呢
当然也会涉及到
也不是一帆风顺
它会涉及到
比如刚才说到的 CICD
然后一些 JDK
一些依赖的一些兼容性的改造
但是这个其实就算是一次性投资
那在后面的过程中
比如我们现在迁移 Graviton 5 的过程中
这个变更成本就几乎为零了
然后在年初的时候
我们看到了 Graviton 5
它的一个 Preview 版本的发布
那我们当时就联系了
我们这个 SA 的团队的伙伴
那就我们共同去讨论了一下
就是这个东西
我们能不能去测一下
因为我期待它是一款性能更强
单价更低的一个处理器
所以我们就开启了这轮 Graviton 5 的性能测试
那我先讲一下我们这个测试环境
我们这个测试环境主要是拉了刚才的
刚才说到的 R8i、R7i
就是两款最新的 X86 的处理器
以及 R8g 和 M9g
两款最新的 Graviton 的处理器
那为了
那当时我们的测试环境其实比较有限
所以它的机型不是完全一致
但我们没有直接在裸机上测试
我们也是把它加入到了 EKS 的集群里
然后创建了从2C4G
2C4G
一直到 32C64G
它是不同规格的 POD 规格
然后在不同的场景下进行测试
我们想知道这四款处理器
在不同的 POD 规格下
不同的业务场景里
究竟哪个更适合我们的业务场景
那我们的测试内容主要是
围绕着 Redis, MySQL，还有 ES 去做的
那同时我们还做了一轮系统的基准测试
那这个基准测试其实更多的就是为了
给我们来去解释在上面的三个业务测试中
那哪些的好是为什么好
那不足是为什么不足
OK，那首先来看到第一组测试结果
就是 Redis 的峰值吞吐
那做，大家可以看到
其实红色的这根柱子
它就是 Graviton5 的测试数据
它从最左侧的2C4G
2C4G 一直到 32C64G
它在每一种的 POD 规格的实例中
都会是优于橘黄色的 Graviton4 的机型
大概优于20% 左右吧
当然这个实际上是一个空库的测试
那为了让它更加能贴合业务
于是我们做了一个满库场景的测试
那在满库场景的测试中
我们限定了一个变量
就是在8C16G 的这个场景
然后填充了200万的4K 的 Key
以及采用一个 LRU 的淘汰机制
进行了一个测试
那综合测试下来 Graviton5
在满库的场景下
它既往里头写又淘汰旧 Key 的时候
它相比 Graviton4 的吞吐
提升大概在32%
那我们就发现在 Redis 这个场景下
那它越是对 CPU 有依赖的场景
就是短请求高并发
以及满库淘汰这种
那 Graviton5 所能带来的优势也就越大
OK
那接下来看这个 MySQL 的测试结果
那 MySQL 第一个呢
就是我们测试了它的 OLTP 的读写性能
那从这样图一其实也可以看到
从最左侧的1C2G 到一直到 32C64G
它这个 Graviton5 的 TPS 一直是优于
第四代的 Graviton4
对 但是我们发现一个有意思的点
就是它的优势其实更多的集中在
相对小规格一点的 POD 里
然后在随着 POD 的规格的增大
那这个优势也逐渐的降低了
我们对于这个问题也跟袁泉老师
还有我们的 SA 的老师一块进行了讨论
那我们发现说
那在小规格 POD 的时候
它的木桶的短板可能更多的是 CPU
所以 CPU 的优势能够直接透传到最终的结果里
那随着 POD 的规格的逐渐增大
那到了这个
比如32C64G
那它的短板可能逐渐的就从 CPU
转移到了 MySQL 自身
对 所以 CPU 的这个规格
所以 CPU 的这个优势相对就没有那么明显
那为了贴合业务场景
其实我们要做了一个 MySQL 的满库的测试
那这张图其实还可以看到 Graviton5 的这个 TPS
这个吞吐
其实是远高于 Graviton4
以及同代的这个 X86 的机型
它对比 Graviton4 大概能提升到86%
对比
R8i 就是最新一代的 x86
提升了60%
那我们其实在想这个为什么之前是20% 30%
现在怎么能达到80% 60%
我们在这个问题又找到了袁泉老师
跟我们的 SA 的老师去讨论
那发现说这个优势
其实除了 CPU 带来的这个性能提升之外
它还有说
这个是它的 L3 缓存
它 L3 的缓存也带来了
就是因为 L3 的缓存的变大
然后带来了整个性能的巨大提升
因为 Graviton5 它采用了一个192M 的 L3 的缓存
所以它在这种大数据集的缓存下
能够带来大幅度的读性能的提升
那接下来就是关于 ES 场景
那关于 ES 这个场景下
其实我们除了测了吞吐跟并发
然后更多的其实关注了一个搜索延迟的对比
然后在三种的这种搜索的场景下
其实我们都发现 Graviton5 它的延迟是最低的
对 这张图是越低越好
那 Graviton5 相比于 Graviton4 它的搜索延迟
在 ES 能提升0.5 到 0.7 毫秒
那对比 X86 的机器的话
基本上提升在1 毫秒以内
那这个1 毫秒看似不是很多
但如果是多轮搜索下来
那我们计算的这个 buffer
不管是给到网络链路去做 buffer
还是说去做一轮重排序或者召回
那其实对于用户来讲都是一件比较好的体验
那比如说用户可以更快的拿到搜索结果
或者说在不改变用户无感知的情况下
那我们用户可以拿到更
质量更高的这种搜索结果
其实这个就是我们能把
infra 的价值带给业务产生的一个价值
那最后呢
汇总所有的这个测试结果
我们发现 Graviton5 的提升最主要的是
有两点
那第一个呢就是它更强的这个 CPU
不管是主频更强
还是说它的核心数
对那带来了20%-30% 的普遍提升
那另一点跟我们很大的一个惊喜的
就是它的这个 L3 的缓存
对然后可以把一些大数据集的场景
优势直接拉到 80% 甚至更多
对然后 ok
然后那随着 Graviton5 的这个 GA 版本的发布
那我们也会继续去推荐 Graviton5
在我们 X86 服务器的替换的这个工作
对然后也希望这个 GA 版本的 Graviton5
给我们带来更多的成本
效率跟质量的提升
好感谢大家