代理式 AI 不仅推动了 AI 的发展,更彻底颠覆了为传统推理而构建的基础架构。代理式 AI 是一种能够自主推理、规划、使用工具和执行多步骤任务的系统,正迅速从研究阶段迈向生产阶段。
这一转变不仅关乎算力的提升,更从根本上改变了基础架构在持续的多阶段推理工作流中的性能表现、扩展方式以及优化方向。
但代理是完全不同的工作负载,它们会重复调用模型,跨各种工具和数据源并行处理,并且需要持续且经济高效地运行。
这需要一种新型基础架构,既涵盖用于复杂推理的高性能 GPU、用于推理任务的 CPU,也包括能将所有这些整合在一起的编排与智能调度机制。
AMD 与红帽携手推动这一转型,共同打造了一个开放、高性能的基础架构平台,旨在帮助企业大规模实现代理式 AI 运营化落地。
借助 AMD Instinct MI355X 和红帽 AI 3.4 实现高吞吐量 AI 推理
代理式工作负载本质上属于推理密集型。代理所做的每一步推理、每次工具调用以及每项决策,都属于模型推理。当代理编排复杂的工作流(包括检索文档、生成代码、验证输出)时,它们可能会针对单个任务发出数十次推理调用。因此,GPU 吞吐量和内存容量至关重要。
红帽 AI 3.4 现已支持在 AMD Instinct™ MI355X 上进行推理,这是基于 AMD CDNA™ 4 架构打造的 AMD 旗舰数据中心 GPU。凭借 288 GB 的 HBM3E 内存和 8 TB/s 的带宽,它能够支持当今最大的开源模型,即支撑高级代理推理的前沿模型,同时减少所需的加速器数量,并降低总拥有成本。它基于 TSMC 3 纳米工艺技术打造,FP16 性能高达 5 PF,为高效扩展代理式工作负载提供了所需的吞吐量。
借助全面集成 ROCm 7 的红帽 AI,企业组织可使用 AMD GPU Operator 在红帽 OpenShift 上部署由 AMD Instinct MI355X 加速的推理服务,以实现精简的 Day 0 配置。对 MXFP6 和 MXFP4 这两种数据类型的扩展支持,使量化模型服务更加高效,帮助团队在每个 GPU 上运行更多代理,而不会牺牲代理赖以发挥价值的推理质量。
在实践中,这意味着企业可以使用更少的加速器运行更大的模型,从而减少基础架构占用空间,降低功耗,并降低每次推理的成本。对于代理式 AI 而言,其工作流中每个任务可能产生数十次模型调用,这种效率直接转化为更快的响应时间和更低的单次交互成本。
借助 AMD Instinct MI350P PCIe 卡(预览版)提升 AI 部署灵活性
红帽 AI 增加了对 AMD Instinct MI350P PCIeⓇ 加速卡的预览版支持,将 AMD CDNA™ 4 架构引入标准化数据中心服务器基础架构。该加速卡采用双插槽 PCIe 设计,支持可配置的 600W 总板功耗(TBP)及被动风冷散热,可无缝集成到企业数据中心,无需对电力和散热系统进行大规模改造。
AMD Instinct MI350P PCIe 卡支持传统的 16 位和 8 位格式,以及用于高效模型服务的 MXFP6 和 MXFP4 格式,并配备 144GB HBM3E 内存,峰值内存带宽高达 4.0TB/s,可在基于开放加速器模块(OAM)的系统难以部署的环境中实现高性能推理。这意味着,任何规模的企业都可以将尖端 GPU 技术融入到其基础架构中,并轻松高效地运行各种规模的基于模型的工作负载。
借助 AMD Instinct MI350P PCIe 卡,企业能够以可管理、经济高效且可扩展的方式,跨多个工作负载扩展 AI 采用。这些加速器卡提高了代理式 AI 的部署灵活性,使企业组织能够在更靠近数据的地方运行推理,从而减少延迟,并支持实时的分布式代理工作流,而无需对现有基础架构进行重构。
AMD Instinct MI350P PCIe 卡
面向代理式 AI 的分布式推理和工作负载放置
代理式 AI 需要为工作流的每个环节协调合适的基础架构。红帽 AI 提供 Kubernetes 原生功能,可在加速器支持且基于 CPU 的基础架构上部署、扩展、监控和管理 AI 工作负载。平台团队能够配置加速器配置文件,启用 AMD GPU 支持的模型服务,定义项目级硬件资源,并使用 OpenShift 的调度、队列配额和工作负载管理功能,将工作负载放置到适当的基础架构上。
在模型服务方面,红帽 AI 支持在 AMD GPU(包括 AMD Instinct 加速器)上运行基于 KServe 和 vLLM 的运行时,而基于 CPU 的基础架构则可用于编排、检索、预处理、路由和更轻量级的推理任务。OpenShift AI 还包含 llm-d,用于大规模的分布式 AI 推理。llm-d 通过引入 Kubernetes 原生分布式推理功能(例如预填充与解码分离,以及 KV 缓存感知路由),扩展了基于 vLLM 的服务。OpenShift AI 和 llm-d 与 AMD Instinct GPU 和 AMD EPYC™ CPU 相结合,为企业构建代理式 AI 平台提供了实用基础,该平台能够将 GPU 加速推理与基于 CPU 的高效工作流执行相结合。
最终打造出一个更高效的系统,不仅提升了效率、减少了不必要的 GPU 消耗,还能在不导致成本线性增长的情况下扩展 AI 服务。
借助 AMD EPYC 和 AMD ZenDNN 实现高性能 vLLM CPU 推理
并非每次代理调用都需要 GPU。代理式系统本质上是可组合的,单个工作流可能会将复杂的推理路由到 GPU 上的大型模型,而将分类、提取或路由等较简单的任务分派给较小的模型。如果 CPU 能够高效处理延迟较低的步骤,则通过 GPU 运行每次调用的效率会很低。在现代 AI 系统中,CPU 不再只是支持性的基础架构,还是可扩展推理的关键引擎。
红帽 AI 3.4 引入了搭载 ZenDNN 后端的 vLLM-CPU,为 AMD EPYC 处理器带来了高性能的 CPU 推理能力。ZenDNN 提供经过调优的内核和优化的原语,使 PyTorch 等框架能够在 AMD EPYC CPU 上高效运行,从而为可扩展的 AI 工作负载提供强大的引擎。
通过使用 AMD EPYC 优化的图形和 Operator 增强功能(包括融合模式、向量化执行和 AMD 优化 CPU 库(AOCL)DLP 微内核)来扩展原生框架,ZenDNN 实现了零代码更改加速,具体方法是上游集成到 vLLM 中。最终,用户能够在现有基础架构上获得即插即用的高吞吐量推理能力,并通过 PyTorch torch.compile和 vLLM 0.18.0 中的上游支持实现广泛兼容。
借助 INT8/INT4 量化和优化的 vLLM 集成,生成式 AI(gen AI)模型可以在 CPU 基础架构上高效运行,为没有严格延迟限制的混合工作负载提供低成本、低功耗的解决方案。这使得 AI 推理能够在现有的 AMD EPYC CPU 机群上与通用计算一起运行,从而提高基础架构利用率,并减少每次部署时对专用加速器的需求。
CPU 推理在多种企业场景下具有特别重要的价值,例如非高峰时段批量处理、AI 仅占总计算量一部分的混合工作负载,以及借助现有基础架构、技能和风冷环境即可实现的低门槛 AI 采用。
AMD 9005 系列处理器专为代理式 AI 所需的不间断的并行计算而打造。凭借多达 192 个核心(384 个 SMT 线程)、高内存带宽、大容量缓存、更强的核心性能以及强大的 I/O 扩展能力,该处理器提供了强劲的 CPU 算力,让您能够大规模处理编排、检索、预处理、工具调用、路由及模型推理等任务。
即将推出的新一代 AMD EPYC 处理器(代号为“Venice”)将进一步扩展这些能力:最高支持 256 个核心(512 个线程),支持 MRDIMM 实现高达 12.8MT/s 的内存速度、高达 1.64TB/s 的内存带宽,并配备 PCie Gen 6 以实现高吞吐量 I/O。
在实践中,这可以让 GPU 专注于复杂推理,而 AMD EPYC CPU 可以有效管理周围的代理工作流,处理大量并发请求,保持低延迟,并提高整体基础架构的利用率。
性能:AMD EPYC 9R45 的实际应用
为了演示 ZenDNN 后端的功能,我们使用 AMD EPYC 9R45 96 核处理器进行了性能基准测试。评估重点是基于短上下文 128:128 工作负载的“chat_lite”CPU 推理基准测试。
测试配置
测试环境使用 AWS m8a.metal-48xl 实例。该架构利用了 5 个不同的红帽 AI 推理 3.4 实例,每个实例分配了 32 个核心,并启用了前缀缓存来优化吞吐量。 GuideLLM 作为主要的评估工具,通过 NGINX 负载平衡器进行路由,以编排 vLLM-CPU 性能评估。
高吞吐量扩展
随着并发量的增加,AMD EPYC 展现出令人瞩目的扩展能力:
- 量化效率: 量化后的 W8A8 模型在并发数为 160 时,实现了约 2,421 个词元/秒的平均吞吐量。
- 峰值性能:在相同的并发水平下,量化模型的 P95 吞吐量攀升至超过 3,260 个词元/秒,这充分展现出该处理器处理突发性代理工作负载的能力。
- 基础性能:即使是标准的 FP16 Llama-3.1-8B 模型,在并发数为 160 时也能稳定地保持大约 1,500 个词元/秒的平均吞吐量。
代理式工作流的可预测延迟
要让 AI 代理给人响应迅速的感觉,首个词元生成时间(TTFT)和词元间延迟(ITL)至关重要:
- 响应速度:量化模型保持了非常低的平均 TTFT,即使在并发数为 160 时,该值也远低于 2 秒的阈值。
- 流畅度:量化模型的平均 ITL 保持高度一致,在整个测试范围内保持在 100 毫秒至 130 毫秒之间。
- 端到端效率:在最大并发数下,量化模型上完整生成过程的平均端到端(E2E)延迟约为 16.8 秒,而非量化版本的延迟则超过 27 秒。
我们将继续与 AMD 密切合作,在未来的版本中进一步调优和优化 AMD EPYC 处理器上的性能,并将 vLLM 和 ZenDNN 集成到红帽 AI 推理中。这些优化将逐步推出,敬请关注后续更新。
代理式 AI 所需的基础架构
在 2026 年红帽全球峰会上,AMD 和红帽宣布推出面向代理式 AI 的集成式企业就绪型基础。基于将 AMD Instinct GPU 和 AMD EPYC CPU 融入红帽 AI 核心的战略合作,我们共同为企业代理式 AI 奠定了计算基础。
从推理到代理的转变不仅是软件层面的变化,更是基础架构发展的转折点。代理需要高吞吐量的 GPU 来进行复杂推理,需要 CPU 来执行轻量级任务,需要灵活的设计以适应多样化部署,还需要智能调度来实时匹配计算与需求。
AMD 和红帽现可提供这样的基础:用于前沿模型推理的 MI355X,用于经济高效的轻量级调用的 AMD EPYC vLLM-CPU,以及用于将 GPU 加速引入新环境的 MI350P。这一切均基于开源构建,处于企业就绪状态,且可通过红帽 AI 获取。
代理式 AI 正在重新定义企业的运营方式,而基础架构现已成为战略性的差异化优势。通过将 AMD Instinct 加速器和 AMD EPYC(EPYC)处理器深度集成到红帽 AI 中,企业组织能够部署可扩展、高效且开放的 AI 平台,为实际业务带来积极影响。AMD 与红帽携手合作,不仅在代理时代提供支持,更助力企业实现代理运营化落地。
关于作者
Erwan Gallen is Senior Principal Product Manager, Generative AI, at Red Hat, where he follows Red Hat AI Inference Server product and manages hardware-accelerator enablement across OpenShift, RHEL AI, and OpenShift AI. His remit covers strategy, roadmap, and lifecycle management for GPUs, NPUs, and emerging silicon, ensuring customers can run state-of-the-art generative workloads seamlessly in hybrid clouds.
Before joining Red Hat, Erwan was CTO and Director of Engineering at a media firm, guiding distributed teams that built and operated 100 % open-source platforms serving more than 60 million monthly visitors. The experience sharpened his skills in hyperscale infrastructure, real-time content delivery, and data-driven decision-making.
Since moving to Red Hat he has launched foundational accelerator plugins, expanded the company’s AI partner ecosystem, and advised Fortune 500 global enterprises on production AI adoption. An active voice in the community, he speaks regularly at NVIDIA GTC, Red Hat Summit, OpenShift Commons, CERN, and the Open Infra Summit.
Priya Vasudevan is a Senior AI Product Manager focused on AI solutions, CPU-based AI inference, and Agentic AI. She works at the intersection of AI infrastructure, hardware, and enterprise software, helping bring scalable and efficient AI capabilities to real-world deployments.