首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

FinSkillBench:评估投资管理的人工智能代理和领域技能

摘要

arXiv:2608.18099v1 Announce Type: new Abstract: Investment management is a high-stakes domain in which agentic AI systems must do more than generate plausible text. They must retrieve point-in-time da...

and skills management the evaluation skill three with curated self
2026-08-20 1 阅读 约1分钟阅读 Jermyn Zhen Yong Bek, Zhuang Qiang Bok, Zhongtian Sun
分享:
字号:
arXiv:2608.18099v1 公告类型:新 摘要:投资管理是一个高风险领域,代理人工智能系统必须做的不仅仅是生成可信的文本。他们必须检索时间点数据、组装正确的计算输入、调用专门的方法并生成可审计的结构化输出。我们推出了 FinSkillBench,这是一个评估套件,旨在衡量语言模型代理是否能够有效地利用金融领域技能来解决投资管理任务。该基准涵盖投资组合构建、风险管理和基本面分析三个领域,包括 12 个子任务和 2,603 个任务片段。每个情节都提供时间点输入、隐藏的事实真相和特定于任务的验证器。我们比较三种情况:无技能、由程序文档和可执行组件组成的策划技能包,以及代理在情节中编写和重用自己的程序的自我生成技能。在 9 个模型和大规模评估中,策划的技能不断提高绩效,将平均分从 0.366 提高到 0.528,其中投资组合构建和风险管理方面的收益最大。相比之下,尽管计算成本较高,但自生技能几乎没有带来什么好处。使用单独的代理框架(Hermes Agent,8 个模型,总共 5,280 集)进行的独立评估重现了所有三个领域的方向模式,技能效果的大小因子任务和工具而异。这些结果表明,在投资管理代理人中,获得可靠的程序技能与模型选择一样重要,而天真的自我生成技能往往是无效的。我们发布基准、评估工具、策划的技能包和完整的轨迹来支持进一步的研究。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱