首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

在具有挑战性的现实场景中对通用移动助理进行基准测试

摘要

arXiv:2608.27477v1 Announce Type: new Abstract: Graphical user interfaces have emerged as an important environment for evaluating autonomous AI agents on multimodal interactive tasks. Existing benchma...

and mobile for task evaluating agents design complexity GMA workflows
2026-08-31 1 阅读 约1分钟阅读 Yiqi Zhu, Feiyu Gao, Jiaxing Fan, Jiahui Zeng, Minggang Wu, Chenliang Li, Haiyang Xu, Peng Li, Ming Yan, Yang Liu
分享:
字号:
arXiv:2608.27477v1 公告类型:新 摘要:图形用户界面已成为评估多模式交互任务上的自主 AI 代理的重要环境。 AndroidWorld 和 MobileWorld 等现有基准为移动代理评估提供了坚实的基础,但它们的应用程序覆盖范围和任务设计尚未完全捕捉实际移动使用的多样性和复杂性。我们提出了 GMA,这是一个在具有挑战性的现实场景中评估通用移动助理的基准。 GMA 推出了 7 个基于开源项目的应用程序,涵盖生活方式共享和旅行规划等领域,以及跨越四个难度级别的 300 项任务,从原子操作到复杂的多步骤工作流程。我们评估了八个前沿模型,发现随着任务复杂性的增加,性能大幅下降,当前的代理还远远不能可靠地处理实际的用户需求。我们进一步在共享环境、模型设置和任务分类下对智能体控制选择进行受控消融研究,包括上下文保留和显式状态跟踪。结果表明,适当的线束设计可以显着提高性能,特别是在要求苛刻的工作流程中,而特定设计的有效性可能因基础模型而异。总体而言,GMA 通过扩展应用程序覆盖范围和任务复杂性来补充现有基准,为评估移动代理和研究线束设计如何支持复杂移动工作流程中的可靠执行提供具有挑战性的测试平台。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱