智能AI
morning
华师大智金院孵化金融原生基模Mint-Agent:超越GPT-5.6与Claude Opus 4.8,商业订单已超亿元
2026-08-25
1 阅读
约10分钟阅读
机器之心
字号:
机器之心发布 由华东师大智金院团队孵化的金融原生 Agentic Foundation Model 家族 Mint-Agent 正式发布。在 FinanceAgentBench v2 上,27B 的 Mint-Ag 达到 60.49%,超过 GPT-5.6-Sol 与 Claude Opus 4.8;单题推理成本分别仅为两者的约 22% 和 10%。与此同时,Mint-Agent 商业订单已超亿元,开始从模型能力验证进入规模化金融场景验证阶段。 图 1|Mint -Agent 在六 项核心金融评测中的表现。上排考察有界金融推理与可靠性,下排考察开放环境中的搜索、工具调用与长程执行;FinanceAgentBench v2 为三次运行均值。 Mint-Agent 项目网站 : https://mint-fin.github.io/mint-agent/ Mint-Agent 技术报告 : https://arxiv.org/abs/2608.16386 Mint-Agent发布 Mint-Agent 的卓越性能表明,在金融专业任务上,性能提升并不必然来自更大的推理预算,而可以来自金融推理、长程执行与证据管理能力的协同。而在金融,性能只是第一道门槛。投研、风控和审计还要继续追问:答案能否回到正确来源、报告期与计算过程? Mint-Agent 团队据此推出金融原生 Agentic Foundation Model 家族:9B 的 Mint-Cu 与 27B 的 Mint-Ag。模型把来源、时间、数值与运算纳入同一条可恢复链;可靠性不再是抽象评分,而是能否把错误定位到证据、抽取或计算中的具体一步。 对于金融基座模型,性能、效率与可审计性必须同时成立。 性能提升,不以更高执行成本为代价 在业内最具影响力的金融智能体评测基准之一 FinanceAgentBench v2 上,Mint-Ag 得分 60.49%,高于 GPT-5.6-Sol 和 Claude Opus 4.8;在取得更高准确率的同时,其单题推理成本分别仅为两者的约 22% 和 10%。 Mint-Ag 在高难度金融任务上进入性能 — 成本前沿:模型既保持金融推理与长程执行能力,也显著降低推理开销。9B 的 Mint-Cu 则进一步展示了紧凑模型在金融搜索与执行中的效率潜力。 真正的门槛,不是 “知道”,而是 “做完” 真实金融研究很少由单条知识直接回答。Agentic Model 必须自己找到权威材料,识别正确报告期,抽取指标,统一单位,完成计算,再跨来源核验并形成结论。任何一环偏离,最后的文字都可能 “看起来合理,实际上错误”。 Mint-Agent 因此把任务重新定义为一条可恢复的链:从来源到事实,从事实到计算,再从计算到结论。答案不是孤立文本,而是由证据和操作共同支撑的 Claim。这也改变了评估方式:不只比较最终答案,还要检查证据是否有效、计算是否闭合、过程是否可以重放。 从 Financial LLM 到 Auditable Agentic Model 金融智能的能力边界,正在从 “生成答案” 走向 “完成任务并接受检查”。 01 Financial LLM | 金融知识与问答 02 Financial Reasoning Model | 金融计算与分析 03 Financial Agentic Model | 搜索、工具调用与长程任务执行 04 Agentic Foundation Model | 证据可追溯、计算可复现、过程可验证 Mint-Agent 瞄准 Agentic Foundation Model 的最后一层:不是再增加一个金融问答能力,而是把研究过程本身做成可检查的系统。前三层解决 “能不能回答、能不能分析、能不能行动”,最后一层回答 “结果能不能被研究员、风控人员与审计者真正接手”。 图 2|Mint-Agent 的三位一体技术栈:Data 定义什么算对,Harness 保存模型如何执行,Algorithm 把推理与执行训练进同一策略。 三部分并不是并列功能,而是共享同一套金融正确性标准:来源、报告期、指标、数值、单位和计算必须能够被重新检查。 Data:先把 “什么算对” 定义清楚 数据引擎首先构造知识、提取、计算、分析、验证五类原子任务。材料来自 EDGAR、公司投资者关系页面、XBRL、交易所记录、FRED 与会计分类体系;每个事实绑定实体、报告期、指标、数值、单位和原始位置。只有证据支持、计算可重放、答案唯一的样本,才进入训练。 图 3|原子金融任务构造:系统从 EDGAR、XBRL、交易所记录、FRED 与会计分类体系中采样材料,抽取带来源定位、实体、期间、指标、数值和单位的事实,并按知识、提取、计算、分析、验证五类能力生成任务;只有证据支持、计算可重放且答案唯一的样本才进入训练。 长程任务则故意隐藏材料,只暴露研究目标。系统预先构建隐藏证据图,固定所需事实、来源和运算路径,并为动态页面保存时间快照。模型必须在开放环境中自己恢复这条路径,而不能从题面获得答案。因此,同一个问题的正确性不再依赖措辞,而落到一组可机器核验的事实节点和运算关系上。 图 4|长程 Agentic 任务构造与验证:Agentic Model 只看到研究目标,必须通过搜索、检查、计算与综合自行恢复答案;底层来源包与隐藏证据图不向模型暴露,但用于验证轨迹是否可重放、答案是否唯一、证据是否可定位,以及题面是否泄露既定路径。 Harness:证据不能随着上下文一起消失 MintHarness 将研究过程变成有状态执行循环。模型决定下一步行动;Harness 负责校验工具、预算和输出格式,并把有效结果写入 证据账本(Evidence Ledger)。这个账本保留实体、期间、指标、数值、单位、来源位置及获取时间,和失败的检索路径严格分开。 当上下文变长,旧对话可以被压缩,但证据账本、工作记忆和完整动作 — 观察轨迹仍保存在模型上下文之外。模型看到的是当前任务所需的紧凑视图,审计者保留的是完整研究记录。即使任务经历网页失效、搜索转向或多轮压缩,已经确认的证据也不会被后续对话覆盖。 图 5|MintHarness 的状态化执行循环。任务、工具和预算进入循环后,证据账本、工作记忆与完整轨迹持续更新;隐藏答案只留在隔离的评估侧。 因此,即便一个答案碰巧正确,只要证据无法支持、时间边界不成立或计算不能复现,它也不会被视为真正完成任务。 Algorithm:双核训练,能力合一 图 6|从人类认知到可扩展智能。 人类认知受到注意力、记忆稳定性与行动跨度的生物限制;Mint 通过 SFT 获取专家经验,借助 RLVR 从可验证反馈中持续改进,并利用 MOPD 蒸馏和融合多个专门化教师。由此形成的统一智能体结合持久记忆、可验证推理、工具增强能力与长程执行机制,将有限的内部认知扩展为持久、可验证且可扩展的智能系统。 擅长金融推理的模型,未必擅长长程执行;会调用工具的 Agentic Model,也未必能把金融问题算对。Mint-Agent 从同一基础模型出发,分别训练金融推理与 Agentic 执行两条路径:前者强化计算、分析和验证,后者强化搜索、工具调用
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱