Copied


Ray Serve LLM 引入基于Token负载感知的路由以提升LLM效率

realtime news   Aug 25, 2026 19:01 1 Min Read


Ray Serve LLM 推出了优化大规模语言模型(LLM)服务的新方法,引入了基于Token负载感知的路由。这种方法超越了传统的KV缓存重用优化,通过改进吞吐量、减少尾延迟以及平衡处理高度可变的LLM请求的工作负载,提高了系统的效率。这项新的路由策略被称为KVAwareRouter,具体细节由Anyscale在8月25日的博客文章中进行了介绍。

与传统的微服务相比,LLM服务面临独特的挑战。由于输入/输出序列长度的变化和不可预测的Token生成,请求的计算需求可能会有显著差异。历史上,路由策略优先考虑最大化KV缓存重用以减少预填计算,因为从之前请求中缓存的Tokens可以显著节省GPU资源。然而,仅依靠该方法不足以平衡LLM副本之间的工作负载。

为什么Token负载感知很重要

与传统路由不同,基于Token负载感知的路由考虑了每个请求实际所需的工作量。这包括预填工作(未缓存的输入Tokens)和解码工作(正在进行的Token生成)。通过将这些指标组合成一个单一的“Token负载”值,KVAwareRouter可以动态地将请求分配到各副本,从而最小化因工作负载不均导致的瓶颈。

例如,在异步多轮次强化学习回合中,请求的资源消耗通常会有很大差异。基于Token负载感知的路由确保没有单个GPU因处理生成过多Tokens的拖延请求而不堪重负。Anyscale分享的测试显示,KVAwareRouter在提供更低的p99端到端延迟和更高吞吐量方面,优于传统的以KV缓存为中心的路由器。

相比传统KV缓存重用的优势

虽然最大化KV缓存重用仍然是一个重要因素,但Ray Serve LLM将其角色从路由目标转变为估算负载的代理。传统方法(如会话亲和性)将来自同一会话的请求路由到单个副本,往往无法平衡实际的计算负载。而基于Token负载感知的路由能够自动考虑被缓存和未缓存的工作负载,从而避免了“请求聚集”效应,即使缓存利用率很高,副本仍可能过载。

此外,与基于一致性哈希的方法不同,KVAwareRouter不需要显式的会话ID。这使得它能够更灵活地适应各种工作负载,包括那些具有跨会话KV缓存重用机会或高度异质的请求模式的场景。

竞争力和行业背景

Ray Serve LLM推出的基于Token负载感知的路由,与行业内优化LLM服务的新进展保持一致。近期的发展(如8月18日宣布的llm-d的基于Token感知的路由,以及vLLM的基于负载感知的路由策略)凸显了平衡Token负载对提高大规模系统效率的重要性。这些路由创新正在被包括Google Cloud Vertex AI和Red Hat在内的主要平台采用,突显出提升LLM服务性能的竞争压力。

基于Token负载感知的路由可能对在生产环境中部署LLM的企业产生重大影响。通过减少尾延迟和提高吞吐量,企业可以为客户支持、代码代理和生成式AI工具等应用提供更快的响应时间。随着LLM的规模和复杂性不断增长,确保高效服务将是一个持续的技术和经济挑战。

未来展望

Ray Serve LLM计划将KVAwareRouter扩展支持其他部署架构,包括预填-解码分离的设置和多模态工作负载。然而,仍然存在一些未解决的挑战,特别是对于输出长度未知的请求进行Token负载预测。未来在负载估算方面的改进(可能结合从智能化执行框架中获得的生成行为提示)可以进一步优化路由策略。

目前,Ray Serve LLM的基于Token负载感知的路由在解决大规模LLM服务的复杂性方面迈出了重要一步。采用这一方法的企业可能在部署高性能AI应用时获得竞争优势。


Read More