智能AI
morning
投机宏提交以加快工具使用代理的速度
摘要
arXiv:2609.03236v1 Announce Type: new Abstract: Tool-using LLM agents spend wall-clock time not only on model inference but also in serial action--observation turns, where each tool call, environment ...
the
and
SMC
model
action
speculative
over
agent
actor
drafter
2026-09-04
1 阅读
约2分钟阅读
Zeyu Liu, Souvik Kundu, Peter A. Beerel
字号:
arXiv:2609.03236v1 公告类型:新摘要:使用工具的 LLM 代理不仅将挂钟时间花在模型推理上,而且还花在串行操作上——观察轮流,其中每个工具调用、环境转换和观察都可能延迟后续决策。我们引入\textbf{推测宏提交}(SMC),这是一种两层代理系统的运行时机制:大型权威参与者模型产生官方轨迹,而更快的推测起草者模型在隔离环境快照上持续预测和执行未来的动作链。 SMC 从训练轨迹中挖掘重复的多动作骨架,并将它们存储在宏库中,用于与绘图者在运行时预测的动作链进行匹配。当参与者的下一个工具调用与第一个起草的操作相匹配时,SMC 会将剩余的预执行的草案步骤及其观察结果提交到官方轨迹。使用 Qwen3.5-27B INT4 作为权威参与者模型,使用 Qwen3.5-4B 作为推测起草者模型,SMC 可以匹配顺序代理的整体准确性,同时比推测操作 (SA) 基线减少 10.23\% 的延迟,比 $\tau^2$-Bench Telecom 子集上的顺序执行减少 18.59\% 的延迟。在 AppWorld 上,SMC 比 SA 基线减少了 7.7% 的挂起时间,比顺序执行减少了 44.9%,任务完成率略有减少。总体而言,SMC 提供了一种实用的方法来重用多步推测执行并减少单步推测操作之外的代理延迟。我们的代码是公开的\href{https://github.com/zeyuliu1037/speculative-macro-commit}{\textcolor{magenta}{here}}。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱