智能AI
morning
FinProBench:使用源自专业交付成果的基于角色的标准评估金融人工智能代理
摘要
arXiv:2608.04077v1 Announce Type: new Abstract: Evaluating financial AI agents requires criteria aligned with real professional work. Existing rubric methods typically derive criteria from task prompt...
and
role
roles
rubrics
from
deliverables
for
RGRC
financial
professional
2026-08-06
1 阅读
约2分钟阅读
Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang
字号:
arXiv:2608.04077v1 公告类型:新 摘要:评估金融人工智能代理需要与实际专业工作相一致的标准。现有的评估标准方法通常从任务提示或模型输出中得出标准,而忽略了仅在从业者可交付成果中可见的默认标准。我们引入了 FinProBench(专业财务任务的基准)和基于角色的评分标准构建(RGRC),这是一个可重复使用的管道,可从同一角色的从业者产生的可交付成果中派生评分标准。 RGRC 包括四个阶段:可交付成果收集、能力提取、Rubric 综合和验证。它的标准体现了默会标准,区分了质量水平,并在角色内跨任务转移。在分析之前,我们根据可交付类型将 57 个职业分为 30 个先验丰富的传统角色和 27 个先验稀疏的专业角色。在所有角色中,对于传统角色,仅提示几乎与 RGRC 相匹配(89.2% 对 90.7%),但对于角色专业角色,RGRC 的表现远远优于它(99.1% 对 78.0%)。这种分裂表明,当惯例在模型先验中得到很好的体现时,即时工程可以近似于规则,而专业基础对于超越这些先验的标准至关重要。 FinProBench 由涵盖 57 个职业、8 个金融子行业和 161 个可交付类型的 1,723 个精选可交付成果构建而成,并发布了包含 20 个完整任务的初始评估集,涵盖 7 个子行业的 20 个角色。由于 LLM 法官和角色级别的标准不同,人类交付成果平均排名第一(100 分中的 73.7 比 70.3、70.2 和 69.6),而所有四个系统都显示出重叠的 95% 置信区间和互补优势。相对于从头开始编写每个评分标准,在角色级别重用评分标准可将估计的每个任务构建工作量减少 6.7 倍。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱