Copied


TileRT 在 AMD Instinct MI355X GPU 上达到 469 tok/s

realtime news   Sep 24, 2026 18:12 1 Min Read


TileRT 在 AI 推理性能方面达到了一个新的里程碑,在 AgentX 基准测试中单用户生成吞吐量实现了每秒 469 个 token (tok/s)。这一结果是通过在 8 个 AMD Instinct MI355X GPU 上运行 GLM-5.3 实现的,并且根据 2026 年 9 月 24 日发布的数据,比 NVIDIA 的 GB300 NVL72 系统高出 100 多 tok/s。

由 SemiAnalysis 开发的 AgentX 基准测试专注于反映编码代理运行动态的真实世界长周期代理工作负载。与传统基准测试受限于固定提示长度不同,AgentX 测试了系统在多轮交互、扩展上下文和代理组件之间依赖关系方面的处理能力。

为何 469 tok/s 的里程碑意义重大

TileRT 的性能不仅因其原始速度而出色,还因其在长上下文中的效率表现令人瞩目。测试显示,当输入上下文从 1,000 token 增加到 1 百万 token(增长 1,000 倍)时,TileRT 仍保持了其短上下文性能的约三分之二,在最大上下文长度下实现了 425 tok/s 的吞吐量。这种持续的吞吐性能对于代理型 AI 应用至关重要,因为这些任务通常涉及动态增长的上下文和交互式响应。

TileRT 团队将这些结果归功于其针对 AMD 的 CDNA 4 架构(MI355X GPU 的核心技术)优化的策略。关键创新包括:

  • 流式同步,通过重叠计算和通信来减少延迟。
  • 持久化引擎内核,消除逐内核执行的开销。
  • 融合的通信-计算模型,在数据传输期间最小化同步瓶颈。

这些创新与 AMD 的硬件能力特别契合,例如更大的寄存器文件、精细控制的内存管理以及通过内联汇编实现指令级优化。

对 AI 和推理市场的影响

TileRT 的进步突显了在 AI 部署中优化推理速度的重要性。在长上下文工作负载中持续实现高性能的能力,使 TileRT 成为响应延迟敏感型应用的有力竞争者,例如 AI 辅助编程、高频交易和实时决策。这也反映出一个更广泛的行业趋势:随着 AI 系统的扩展,推理效率的重要性与训练效率同样关键。

对于 AMD 来说,TileRT 在 Instinct MI355X GPU 上的成功验证了其在高性能 AI 硬件市场中与 NVIDIA 竞争的努力。MI355X 的架构特点(如分区缓存和增强的寄存器容量)在支持 TileRT 的创新方面发挥了重要作用。这可能会转化为 AMD 硬件在专用 AI 工作负载中的采用率提高——这是 NVIDIA 传统占优的领域。

TileRT 的下一步计划是什么?

展望未来,TileRT 团队计划扩大对 AMD ROCm 软件生态系统的支持,并引入针对更大批量尺寸的优化。这些更新旨在满足更广泛的工作负载需求,同时保持其对超低延迟推理的专注。此外,与 AMD 的持续合作表明,推理性能将进一步提升。

TileRT 已经在 PyPI 上可用,开发者可以将其运行时整合到他们的 AI 工作流中。对于那些关注 AI 硬件和软件竞赛的人来说,TileRT 的最新结果明确表明,由 AMD 支持的解决方案正在高风险的推理领域获得越来越多的关注。


Read More