智能AI
morning
UserToolBench:工具使用法学硕士中个性化决策的用户配置文件隐藏基准
摘要
arXiv:2608.10042v1 Announce Type: new Abstract: Tool-use LLMs are increasingly asked to act on users' behalf, but existing benchmarks usually focus on profile recall, style imitation, generic tool use...
tool
and
use
LLMs
user
whether
users
style
personalization
UserToolBench
2026-08-12
1 阅读
约1分钟阅读
Xuexiong Yin, Zechuan Chen, Yongsen Zheng, Yuxiang Zhang, Jingyuan Yang, Bin Wang, Yubin Wang, Keze Wang
字号:
arXiv:2608.10042v1 公告类型:新 摘要:工具使用法学硕士越来越多地被要求代表用户行事,但现有基准通常侧重于个人资料回忆、风格模仿、通用工具使用或响应级别个性化。我们推出 UserToolBench,这是工具使用法学硕士中个性化决策的基准。 UserToolBench 测试模型是否可以从交互历史记录中推断潜在的用户偏好,识别何时需要澄清,并在不完整信息下生成与用户对齐的工具调用轨迹。该基准测试是根据经过隐私保护的真实交互痕迹构建的,并结合了结构化的角色配置文件、公共 API 式工具生态系统和长期多轮轨迹。它包括 10 个用户配置文件、36 个工具集、1,065 个回合、170 个独特工具以及以评估为中心的任务类型,涵盖信息缺乏、单一工具和多工具设置。强大的工具使用法学硕士的实验表明,当前模型在个性化授权方面仍然存在困难。多工具协调、缺失约束推理和长期行为一致性仍然是主要瓶颈。这些结果表明,个性化评估不应仅询问输出是否针对特定用户,而应询问法学硕士是否为他们所代表的用户做出正确的决策。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱