Copied


ThunderAgent 将合成数据生成速度提升至 2.5 倍

realtime news   Jul 29, 2026 22:19 1 Min Read


Together.ai 推出了 ThunderAgent,这是一种专为优化合成数据生成中的代理推理设计的系统。通过重新设计推理工作流的调度方式,ThunderAgent 在单节点上提供了 2.5 倍的吞吐量改进,并在多节点 GPU 集群中实现了近线性扩展。该系统已被 ICML 2026 接收为 Spotlight 论文,有望简化现代 AI 应用所需的大规模合成数据管道。

ThunderAgent 的核心创新在于将每个代理工作流视为可调度的程序,而不是一系列独立的请求。这种方法消除了诸如 KV 缓存频繁置换的低效问题——在工具调用暂停期间,内存反复存储和清除对话记录,从而浪费资源。这带来了显著的延迟减少和资源利用率的提升。

解决代理推理中的瓶颈

代理推理在运行时进行多步推理和工具使用,是生成合成数据集的关键环节。与静态提示不同,代理系统模拟动态的多轮场景,通常与外部工具或环境交互。然而,现有的推理引擎(如 SGLang 和 TensorRT-LLM)在高并发情况下由于 KV 缓存低效而表现不佳。这些引擎将每次模型调用视为独立事件,导致缓存置换和代理恢复工作流时的高昂重新计算成本。

ThunderAgent 通过添加一个程序感知的调度层解决了这一问题,该调度层跟踪每个工作流的执行阶段、内存占用和集群分配。通过在内存压力下暂停低优先级工作流,并智能地将它们重新分配到 GPU 节点,ThunderAgent 最大限度地减少了缓存置换,同时平衡了工作负载。在一个 8 节点 H100 集群上的测试显示,ThunderAgent 比 SGLang Gateway 提高了 2.4 倍的速度,当集群规模扩大到 64 个 GPU 时,每分钟实现了 2,248 步的出色表现。

对 AI 和合成数据的意义

高效的合成数据生成对于 AI 研究和部署变得越来越重要。自然数据集通常缺乏训练代理系统所需的复杂性,因此需要大规模的合成替代方案。ThunderAgent 支持 Together.ai 的 CoderForge 等管道,其中数百个并发代理模拟多轮编码场景以生成高质量数据。这与最近的进展相一致,例如苹果公司的无环境合成数据生成,用于 API 调用代理,以及用于稀有事件数据增强的本体指导框架。

ThunderAgent 的开源设计使其更易于广泛采用。它通过 OpenAI 兼容的 API 无缝集成到现有推理后端中,并能与量化和推测解码等优化协同工作。Together.ai 强调,客户端只需添加一个简单的程序 ID 字段即可完成集成。

市场和研究影响

随着合成数据生成成为 AI 开发的基石,像 ThunderAgent 这样的系统能够显著降低成本并提高效率。最近的研究表明,代理系统能够以个位数美元的运行成本生成数据集,这使其在安全关键感知、网络自动化和科学研究等领域极具经济性。ThunderAgent 通过在不需要额外硬件投资的情况下提高吞吐量和可扩展性,进一步扩大了这些优势。

ThunderAgent 有望塑造下一代代理推理系统。凭借其在 ICML 2026 的认可以及在实际管道中的适用性,它可能吸引学术研究者和行业从业者的广泛关注。对于运行大规模代理工作负载的人来说,该系统提供了一种利用现有硬件实现“免费加速”的诱人价值主张,这在当今计算密集型 AI 领域尤为重要。

开发者和研究人员可以通过其 GitHub 仓库 探索 ThunderAgent,或查阅详细的 研究论文


Read More