Copied


AMD ROCm 10发布,带来ROCm.AI并承诺实现3.3倍AI性能提升

realtime news   Aug 27, 2026 22:47 1 Min Read


AMD正式发布了ROCm 10,这是其GPU计算软件堆栈的最新版本,旨在简化在AMD Instinct GPU上部署AI工作负载。该版本于2026年8月27日宣布,庆祝ROCm十周年,同时引入了ROCm.AI,这是一款AI原生开发者工具包。据称,与上一代ROCm 7系列相比,ROCm.AI显著提升了性能:推理吞吐量提高了3.3倍,训练效率提升了2.4倍。

通过ROCm.AI简化AI开发

ROCm.AI是此次发布的核心亮点,它结合了AMD Skills、ROCm CLI和Hyperloom等工具,以简化AI开发、部署和优化流程。这些工具允许开发者使用熟悉的AI助手,如Claude和Codex,并简化从环境验证到工作负载优化的任务。例如,Hyperloom会分析推理工作负载,识别瓶颈并自动进行性能调优,使优化过程从复杂的手动任务转变为可重复的自动化流程。

AMD通过ROCm.AI的策略非常明确:减少配置和集成所花费的时间,使团队能够专注于部署AI模型。这在组织优先考虑更快的AI应用上市时间时尤为重要。

性能提升通过测试验证

在AMD性能实验室的测试中,ROCm.AI在一台配备8个AMD Instinct MI355X GPU的平台上展示了其潜力。推理吞吐量在如GLM-5和DeepSeek-R1等模型上平均提高了3.3倍,而如DeepSeek-V3等模型的训练吞吐量则提升了2.4倍。这些性能提升得益于内核执行、内存管理和工作负载调度的优化。然而,AMD指出,这些结果是特定配置下的表现,并非适用于所有工作负载。

与NVIDIA CUDA竞争

ROCm 10将AMD定位为NVIDIA CUDA生态系统在AI和高性能计算(HPC)工作负载上的更可行替代方案。通过集成如模块化的ROCm Core SDK和通过RCCL实现的可扩展通信增强,AMD旨在解决大规模AI训练和推理环境中的可扩展性和一致性问题。公司希望通过开源的灵活性和性能改进,吸引那些需要专有解决方案替代品的客户。

为什么这很重要

随着AI采用速度的加快,对高效且可扩展的软件堆栈的需求也在增长。AMD的ROCm 10发布正值关键时刻,组织正在寻找最大化现有硬件效用,同时最小化集成复杂性的途径。通过Instinct MI355X GPU平台和ROCm.AI,AMD瞄准了希望在不牺牲性能的情况下加快部署周期的企业用户。这可能增强AMD在竞争激烈的AI硬件市场中的吸引力,目前在市场份额上,AMD落后于NVIDIA。

市场背景

AMD股票在8月27日以476.67美元收盘,过去24小时内下跌0.86%,反映了更广泛的市场趋势,而非对这一发布的特定担忧。然而,如果ROCm 10能够成功进入企业AI市场,其长期影响可能会对AMD的估值产生积极作用。

展望未来

ROCm 10的成功将取决于企业采纳情况和实际性能验证。即将推出的更新版本,如ROCm 10.1,预计将进一步完善其功能。对于考虑AMD硬件的AI开发者和企业来说,此次发布标志着在硬件访问与生产就绪AI工作负载之间架起桥梁的重要一步。


Read More