Copied


Together AI 推出高级LLM推理自动扩展功能

realtime news   Jul 31, 2026 18:17 1 Min Read


Together AI 推出了一个新的自动扩展框架,旨在优化大型语言模型(LLM)推理,解决管理GPU密集型工作负载的独特挑战。该系统允许部署根据诸如未完成请求数、GPU利用率和令牌吞吐量等指标动态扩展,在需求波动的情况下提升性能,同时将成本降至最低。

自动扩展是云计算中的一个熟悉概念,但LLM推理面临独特的挑战。与传统的网络服务不同,LLM工作负载对延迟高度敏感且依赖GPU,冷启动需要几分钟时间,因为新副本需要将模型权重加载到VRAM并进行预热。Together AI 的方法专注于诸如队列压力等领先指标,从而在用户面临性能下降之前预先进行扩展。

扩展管理不当的代价

LLM推理常常在过度配置和不足配置之间处于微妙的平衡状态。过度配置可能导致GPU未被充分利用,从而浪费资源,而市场已经因GPU短缺而受限。相反,不足配置会导致当副本达到并发限制时出现严重的延迟峰值。例如,在高负载下,首次令牌响应时间(TTFT)可能从200毫秒骤增至超过15秒,严重影响用户体验。

Together AI 的系统通过允许用户微调扩展策略来缓解这些风险。开发人员可以设置副本上下限、选择扩展指标,并定义扩展和缩减决策的时间窗口。例如,较短的扩展窗口确保对流量激增的快速响应,而较长的缩减窗口可避免频繁且代价高昂的冷启动。

选择正确的指标

该平台支持八种自动扩展指标,每种指标都适合特定的工作负载特性。诸如inflight_requests这样的指标提供需求的领先指标,使其成为一个强大的默认选项。而像TTFT这样的服务水平目标(SLO)驱动指标,则适合优先考虑低延迟的部署。以效率为主导的指标(如GPU利用率)优化成本,但需要谨慎校准以避免影响性能。

Together AI 博客中的一项实验强调了选择指标的重要性。在相同的流量条件下,基于inflight_requests扩展的部署动态添加了副本,从而减少了延迟峰值。相比之下,基于TTFT和GPU利用率的策略未能进行扩展,因为它们的滞后指标未能捕捉系统的实时饱和状态。

市场背景

这一公告发布之际,企业正日益将AI系统投入生产。2026年的市场研究强调,高效的自动扩展现在已成为企业AI战略的核心,特别是当组织面临不断上升的GPU集群成本时。今年早些时候发表在arXiv上的研究突出了传统自动扩展方法在现代LLM架构中的局限性,进一步说明了需要像Together AI这样的推理原生解决方案。

值得注意的是,该平台的自动扩展功能与更广泛的行业趋势相符,如无服务器执行和MLOps集成,这些趋势已在Salesforce和其他公司的近期研究中得到体现。这些创新旨在平衡成本效率与多代理AI系统所需的高性能。

未来展望

随着组织采用LLM推理的自动扩展,理解流量模式和工作负载特性将是优化部署的关键。Together AI 的框架提供了一个灵活的基础,但成功将依赖于策略的精细调整以及对成本与延迟之间权衡的清晰理解。

对于开发人员来说,建议非常明确:从诸如inflight_requests这样的默认指标开始,监控实际性能,并在此基础上进行迭代。在GPU资源稀缺的情况下,这样的工具可能对于在扩展需求时代维持竞争力的AI部署至关重要。


Read More