华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%-麦享科技
麦享科技
前沿资讯网站

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

麦享科技8月12日消息,由华为2012实验室、华为云、计算、终端等团队联合打造的开源智能体平台openJiuwen,近日联合昇腾推出了一项名为“算力亲和”的全链路协同技术。

该技术打通了Agent框架、推理引擎与底层算力之间的协同壁垒,通过让KV Cache(键值缓存)从被动管理走向主动协同,使Agent推理的首Token时延降低57%以上,推理存储占用峰值下降25%。

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

随着AI Agent应用日益复杂,单个任务可能持续数十分钟甚至数小时,多个Agent还需分工协作。任务越长、协作的Agent越多,推理过程中产生的KV Cache就越庞大,推理时延也越久。

然而,传统推理引擎只能看到请求和缓存,却看不懂Agent正在做什么。如果子任务已经结束,缓存可能还停留在昂贵的NPU显存里;如果会话暂时挂起时,缓存却继续占着最贵的资源位置。

这背后的核心问题是:Agent掌握任务状态,引擎掌握算力资源,两者之间缺一条传递语义的通道。openJiuwen的解法是在Agent与推理引擎之间建立一套“状态契约”,即Agent Hint。

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

Agent在关键状态变化时发出Hint信号,告诉引擎当前会话的生命周期状态;引擎据此执行对应的缓存动作:驱逐、卸载、预取。缓存不再只有“留在显存”或“排队等淘汰”两种命运,而是随任务节奏在存储层级间主动流动。

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

测试结果显示,开启算力亲和后,模型请求端到端时延降低27.61%,前缀缓存命中率提升33%,池化缓存使用量峰值降低25.24%。

当前这套能力即将开源,感兴趣的开发者可以关注openJiuwen开源社区。

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

💡 网购省钱小技巧
下单前先查历史价格,再领隐藏优惠券,还能享受购物返利,让每一次购物都更划算。


麦享生活

网购先比价 · 查优惠券 · 查返利 · 查历史价格,就用麦享生活 APP。


麦享生活下载

麦享生活已上架各大应用商店,免费下载,安装即可使用。

未经允许不得转载:麦享科技 » 华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

相关推荐

  • 暂无文章