AMD发布ROCm.ai开发平台:利用智能体AI加速软件开发

当地时间7月23日,AMD 在年度 Advancing AI 2026 大会上正式发布了 ROCm.ai 代理式 AI 原生开发平台,旨在利用 AI 智能体加速 GPU 开发与模型优化。该平台预计 8 月正式推出。

众所周知,在AI加速市场,英伟达之所以能够占据大部分市场,与其强大的CUDA软件生态密不可分。其他在这个市场的AI加速器厂商只有两个选择,要么想办法去兼容CUDA生态,要么去费时费力地打造自己的生态,但不论选择哪条路线,最为关键的都是“开发者”。

所以,AMD公司副总裁Ramine Roane在关于AMD ROCm软件栈的演讲开篇就定下基调,强调“Relentless focus on Developers”(始终专注于开发者)。

AMD披露的一组数据颇为亮眼:Hugging Face上超过300万个模型可在AMD平台上“开箱即用”,前十大AI开源项目均已原生支持AMD,开源贡献量实现了超过10倍的增长。这些客观的数据直接回应了外界长期以来对AMD软件生态“不好用”的刻板印象。

文章配图-1

AMD在此次大会上清晰阐述了其ROCm软件栈的核心战略:以开源社区驱动快速迭代,以抽象化层提升开发者生产力。前者比较容易理解,就是融入开源生态,加大对于开源生态的支持;后者则是指ROCm正在向更高层次的抽象演进,让开发者“在每一层级都能编程”,可以充分利用丰富的生态系统。

尽管当前英伟达仍占据数据中心GPU市场超过95%的份额,但AMD正在以软件兼容性和性价比逐步撬动客户。据AMD财报显示,其2026年第一季度数据中心营收达58亿美元,同比增长57%。

AMD在此次大会还重点介绍了FlyDSL——一种在Python中实现GPU编程的新方案,核心卖点是“聚焦算法,而非底层GPU编程”。这一工具旨在降低开发者上手AMD硬件的门槛,是其ROCm软件栈“抽象化提升生产力”战略的具体落地。

本次大会最重磅的软件发布当属ROCm.AI平台。这并非单一工具,而是一个涵盖AI辅助编程、自动化优化和底层运行时支持的完整平台。

ROCm.AI平台核心架构分为三层:

AI Skills层:将Claude、Codex、Cursor、Gemini等主流AI编程助手深度集成,使其成为“ROCm超级用户”;

AI Assisted Optimization层:名为“Hyperloom”的自动化优化工具,能够在"无人干预"的情况下完成代码和内核的优化工作;

ROCm Core层:底层的编译器、工具、库和框架集成,包括vLLM、SGL等关键组件。

文章配图-1

这一布局表明,AMD正试图通过将AI能力注入开发工具链本身来弥补其在开发者生态成熟度上与英伟达的差距。

其中,Hyperloom是ROCm.AI平台中最具突破性的智能体优化工具,其闭环流程为:建立性能基线 → 分析定位瓶颈 → 调优服务配置 → 生成与重写GPU内核 → 验证性能提升。这一“智能体优化”理念的实际价值在于:将大量繁琐的性能调优工作自动化,极大降低了在AMD平台上获得最优性能的专业门槛。

文章配图-1

在推理场景中,ROCm.AI针对并行调度、内存管理(分页注意力、KV Cache量化)和内核(MHA预填、MLA解码)进行了专项优化;在训练场景中,则覆盖了流水线并行、分片数据并行、激活检查点、FP8混合精度等关键技术。

文章配图-2

文章配图-1

在ROCm.AI的加持之下,刚推出的MI455X就能够实现对于众多大模型的“Day 0”支持。

文章配图-1

ROCm.AI还能够帮助开发者更快地利用硬件的性能,当前MI450X相比MI355X的MLA解码(FP8)性能提升到了3.8倍;FP4算力提升到了3.3倍;Scale-Up网络带宽提升到了3.5倍;Scale-Out网络带宽提升到了2倍。值得注意的是,这些是“实测”数据,而非理论峰值。

文章配图-1

AMD强调“软件速度优势正转化为性能领导力”,并称“性能每周都在提升”——这无疑是在向外界传递“AMD的软件优化正在加速”的信号。

为了打破CUDA的生态壁垒,AMD还在ROCm上大力推进SPIR-V中间语言支持,旨在实现“一次编译,多GPU运行”,并推出“ROCm认证工程师”计划以降低开发者的迁移门槛。

需要强调的是,AMD ROCm软件栈是一套面向所有AMD设备的软件栈,AMD的理念是“One Software Stack. Every AMD Device.”(一个软件栈,覆盖所有AMD设备)。

文章配图-1

为了助力开发者开发端侧AI应用,AMD还在本次大会上还推出了全新的面向开发者的个人AI推理工作站“Gorgon Halo”。它在外观上与初代版本相近,将配备 Ryzen AI Max+ 495 处理器、192GB 统一内存、Wi-Fi 7、2TB PCIe 4.0 SSD,并可选配 Windows 11 或 Linux 操作系统,支持3000亿参数的大模型端侧运行。

编辑:芯智讯-浪客剑

留下评论