
人工智能正在推动下一个计算时代
人工智能正迅速成为历史上推动计算需求增长的最大动力之一。各行各业的组织都在对 AI 进行巨额投资,因为它展现出了前所未有的规模化创造可衡量价值的能力。从金融服务到医疗卫生,从软件工程到自主系统,AI 正在重塑产品的构建方式、决策的制定方式以及企业的运营方式。尽管计算机产业的规模已经非常庞大,但 AI 有望推动一场规模远为浩大的增长浪潮。AI 是通过海量的数值计算和内存操作来实现其成果的。随着大型语言模型(LLM)的参数规模增长到数万亿级别,每一个输出 Token(可以是一个数字、一个单词、甚至只是单词的一部分)都需要大量的计算和DRAM 请求。
随着 AI 工作负载的持续扩展,挑战不再仅仅是提供更多的算力。客户再也无法通过一次部署一台 GPU 系统来满足前沿模型训练、大规模推理、微调以及新兴 Agentic AI(智能体 AI)工作负载的需求。性能越来越取决于算力、内存、网络、电源、散热、软件和运维如何作为一个统一的机架级系统协同工作。
同时,模型也在持续增长和演进。例如,混合专家(MoE)模型在系统中的表现与传统的密集模型不同,虽然它的总参数量更多,但生成每个 Token 时仅访问其中的一小部分。这改变了计算与内存带宽之间的典型关系。基础模型中对象类型(文本、音频、图像、视频、3D 模型等)的激增以及新的特定应用模型,带来了 AI 数据中心运营者必须应对的额外复杂性。
AMD 迎难而上
基于 AMD CDNA 5 架构的 AMD Instinct MI455X GPU 和 AMD Helios 机架级解决方案,扩展了 AMD AI 加速器产品组合,提供了一种可从单颗芯片扩展至单个机架,进而填满GW级 AI 工厂的开放式解决方案。

图 1 展示了这两款新品。
正如 AMD Helios 机架级解决方案所展示的那样,AMD Instinct MI455X GPU 是首款专为机架级 AI 部署设计的 GPU。在同一个 Scale-Up垂直扩展共享内存的算力集群(Pod)内拥有 72 颗 GPU,显著提高了无法装入 8-GPU 节点的模型的推理吞吐量。凭借新芯片大幅提升的 Scale-Up 和 Scale-Out 能力,对训练带来的收益甚至更大。
AMD Instinct MI355X GPU 也可用于机架级实现,但通常这些集群由多个通过以太网 RDMA 在 Scale-Out 域中连接的 8-GPU 系统组成。与前几代 AMD Instinct GPU 相比,AMD Instinct MI455X GPU 背后的工程设计大幅扩展了 Scale-Up 域、共享内存容量、通信带宽以及 Scale-Out横向扩展的 连接性,从而能够实现大得多的机架级 AI 系统。
与 AMD Instinct MI455X GPU 和 AMD Helios 机架级解决方案相辅相成的是 AMD ROCm 开放 AI 软件栈。AMD ROCm 软件结合了经过优化的编译器、运行时、通信库、AI 框架和开发者工具,以提供高性能、开放生态系统创新、易于采用以及生产级可扩展性。通过将 AMD ROCm 软件与 AMD Instinct MI455X GPU 和 AMD Helios 机架级解决方案协同设计,AMD 使客户能够高效地部署、训练、微调和提供 AI 模型服务,而不会受到专有软件的锁定。

图 1. AMD Helios 机架级解决方案中的 AMD Instinct MI455X GPU。
AMD Instinct MI455X GPU
为了满足现代 AI 工作负载日益增长的需求,AMD 开发了 AMD Instinct MI455X GPU,它在计算性能、内存容量、内存带宽、可扩展性和效率方面取得了重大突破,能够支持许多竞争解决方案遥不可及的新型工作负载,包括前沿 AI 训练、大规模推理和大规格 Agentic AI。
AMD Instinct MI455X GPU 通过七项关键架构创新和 CoWoS-L 先进封装技术实现了这些飞跃:
第一,AMD Instinct MI455X GPU 提供了比前代 AMD GPU 显著更高的 AI 计算性能。 在开放计算项目(OCP)微缩放 MXFP4 和 MXFP8 数据格式上,其峰值 FLOPS 是 Instinct MI355X 的 4 倍。这种额外的计算能力旨在实现高推理吞吐量、支持大 Batch Size、加速模型训练,并在固定的基础设施占地面积内最大化 AI 工厂的输出。
第二,AMD Instinct MI455X GPU 提高了计算资源的有效利用率。 得益于基于前四代 AMD CDNA 微架构的客户经验和反馈所做出的数十项内部改进,AMD Instinct MI455X GPU 受益匪浅。该架构支持灵活的数据格式,简化了软件开发,并实现了计算、内存和网络资源的有效利用。
第三,内存子系统得到了大幅升级。 每颗 AMD Instinct MI455X GPU 集成了 432 GB 的 HBM4 内存,容量比 AMD Instinct MI355X 的 288 GB HBM3E 增加了 1.5 倍,同时提供了约 2.9 倍的峰值内存带宽。2 更大的缓存、更高的缓存带宽以及新的带宽放大技术进一步提升了有效内存性能。这些进步使得在机架规模下能够支持更大的模型、更长的上下文窗口、更高的用户并发度、单系统内更多的 AI Agent,并减少了由内存驱动的限制。
第四,新 GPU 大幅增加了 Scale-Up 带宽, 即用于将多颗 GPU 组合成单个共享内存 Pod 的带宽。每颗 AMD Instinct MI455X GPU 在 36 个链路上传输高达 3.6 TB/s 的低延迟 Scale-Up 带宽。每个 UALoE(基于以太网的超加速器链路)链路使用两个通道和 AMD Infinity Fabric 协议,在每个方向上提供 400 Gbit/s 的带宽。最多可将 72 颗 AMD Instinct MI455X GPU 组合成一个算力集群 Pod,这是一项重大改进,扩大了单个工作负载可用的计算和内存资源,同时降低了与分布式执行相关的通信开销。
第五,AMD Instinct MI455X GPU 提供了大幅提升的 Scale-Out 带宽。 每颗 AMD Instinct MI455X GPU 最多支持三个 AMD Pensando Vulcano 800 AI-NIC,每颗 GPU 提供 600 GB/s 的双向 Scale-Out 带宽,是 AMD Instinct MI355X GPU 所提供带宽的六倍。结合 AMD 的开放网络策略和对行业标准以太网技术的支持,这种连接性能够实现从单个机架到大型多机架 AI 集群的高效扩展,同时保持生态系统的灵活性并避免专有网络锁定。
第六,AMD Instinct MI455X GPU 拥有专用的高速 AMD Infinity Fabric 接口,以强化 CPU-GPU 通信。 该 GPU 是与 AMD EPYC 9006 SP7 服务器 CPU 联合开发的。该接口提供 256 GB/s 的双向峰值传输速率,并赋予 CPU 对 GPU 内存的缓存一致性访问权限。与前代架构相比,这允许更大的内存池、更高效的数据共享,并改善了对内存密集型 AI 工作负载的支持。
第七,也是最后一点,是提高的能源效率。 从最基础的晶体管到网络接口,AMD Instinct MI455X GPU 的各个方面都经过了重新设计,以使其更加高效。结果是整个平台的能源效率得到提升,使客户能够在给定的功耗包络内部署更多的计算能力。
图 2 展示了 AMD Instinct MI455X GPU 中子系统的总体概念图。左侧显示了通过 AMD Infinity Fabric 进行的 CPU-GPU 通信以及通过 PCIe® Gen 6 和 UALink 进行的 Scale-Out 接口,右侧显示了 UALoE Scale-Up 通道。

图 2. AMD Instinct MI455X GPU 总体概念图。

图 3. AMD Instinct MI系列 GPU 研发路线图