智能AI
morning
蚂蚁百灵发布首个金融增强模型,AI开始进入真实投研工作流
摘要
蚂蚁百灵发布首个金融增强模型,AI开始进入真实投研工作流 量子位的朋友们 2026-09-09 13:02:30 来源: 量子位 蚂蚁集团百灵首个金融增强开放模型 Ling-3.0-flash-Fin发布。 外滩大会前夕,记者获悉,蚂蚁集团百灵首个金融增强开放模型 Ling-3.0-flash-Fin发布。与传统金融大模型主要解决问答、摘要等单点任务不同,Ling-3.0-flash-Fin进一步...
Ling
flash
FinFIRST
蚂蚁集团百灵首个金融增强开放模型
Fin发布
研究推理
估值建模
蚂蚁百灵发布首个金融增强模型
AI开始进入真实投研工作流
量子位的朋友们
2026-09-09
1 阅读
约8分钟阅读
量子位的朋友们
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 蚂蚁百灵发布首个金融增强模型,AI开始进入真实投研工作流 量子位的朋友们 2026-09-09 13:02:30 来源: 量子位 蚂蚁集团百灵首个金融增强开放模型 Ling-3.0-flash-Fin发布。 外滩大会前夕,记者获悉,蚂蚁集团百灵首个金融增强开放模型 Ling-3.0-flash-Fin发布。与传统金融大模型主要解决问答、摘要等单点任务不同,Ling-3.0-flash-Fin进一步瞄准真实金融工作流,尝试让AI从“回答一个问题”走向“完成一项工作”。目前,该模型已经正式开源。 与此同时,蚂蚁百灵还同步开放金融搜索Agent评测基准FinFIRST,逐步开放模型、工具和评测体系。模型目前重点切入投资研究场景,覆盖信息检索、研究推理、估值建模、研报撰写等环节,尝试打通从找资料、做分析到形成研究成果的完整任务链。 金融是验证模型专业能力的重要场景。业内看来,Ling-3.0-flash-Fin 的推出,是蚂蚁百灵从通用模型能力向专业场景的一次重要探索。蚂蚁集团在金融场景有深厚的积累,这使得百灵能够依托复杂真实场景验证模型能力,并持续迭代。 金融AI的竞争,从“会回答”走向“能干活” 金融一直被视为AI走向专业生产力的高难度场景。 一份研究报告背后,需要从年报、财报、公告、监管文件和研究材料中寻找信息,核对不同报告期和统计口径,再进行计算、估值建模,最终形成能够被专业人士审核和复用的研究成果。 金融AI面对的并不是一个简单的“知识问答”问题。它不仅要知道答案从哪里来,还要知道数据能不能用、计算是否正确,以及最终结论能否被复核。 Ling-3.0-flash-Fin此次瞄准的,正是这一完整工作链路。 该模型基于Ling-3.0-flash打造,延续124B总参数、5.1B激活参数配置,并具备256K长上下文能力,兼顾复杂金融内容处理和实际部署效率。模型通过金融语料持续预训练、领域后训练和工具使用优化,进一步强化对年报、财务工作簿、多份研究材料等复杂内容的处理能力。 从模型定位上看,Ling-3.0-flash-Fin更强调面向长链路Agent工作的能力:让模型不再把信息检索、证据审查、计算、建模和报告准备看成彼此孤立的任务,而是尝试将它们连接起来,完成一项完整的金融研究工作。 四项能力,打通一条投研工作链 目前,Ling-3.0-flash-Fin率先从投资研究场景切入,重点强化四项能力:信息检索、研究推理、估值建模和研报撰写。 其中,信息检索强调优先定位官方、一手及高可信数据源,并关注信息时点和统计口径;研究推理则通过多步计算和交叉验证,厘清事实与假设,构建可复核的证据链;估值建模进一步进入真实工作簿,支持公式切换、跨表依赖和异常排查,让AI生成的结果能够继续进入专业人员原有工作流程;在此基础上,模型进一步组织事实、数据和判断,生成可编辑、可审核的研究材料。 四项能力并非简单的功能罗列,而是对应一条从找信息、验信息,到做计算、建模型、形成研究成果的完整投研链路。这也意味着,金融AI正在从单点能力的比拼,走向完整工作流的比拼。 不只发布模型,也尝试建立金融AI的“评分尺” 此次与模型同步推进的FinFIRST,则瞄准了金融AI发展中的另一个关键问题:如何判断一个金融Agent到底做得好不好。 FinFIRST(Financial Information Retrieval, Sourcing and Traceability)由蚂蚁集团构建并开源,中金公司投行团队提供专业支持,并有50余位金融专业人士参与设计,重点评测金融搜索Agent在信息检索、信源选择、口径判断和推导过程等方面的能力。 在这一评测体系下,一个好的金融AI不仅需要给出正确答案,还需要回答三个问题:信息从哪里来、口径是什么、结论如何得出。 在数据组成上,FinFIRST 覆盖中国内地、美国、中国香港及其他市场,其中中文题占 60.2%,英文题占 39.8%。超过五分之四的题目包含多个相关子问题,61.8% 要求显式计算,32.5% 需要多个信源,75.6% 不直接指定信源,需要 Agent 自主搜索和判断。所有题目均使用公开可访问的信源。 FinFIRST 提供了一套更贴近真实金融需求的搜索任务、标准与评测方法,它并不只是一个模型排行榜,而是试图把金融研究中的专业判断转化为可验证、可复用的评测标准。 目前,Ling-3.0-flash-Fin已在FinFIRST、FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking等多个金融智能体基准上进行测试,覆盖金融信息检索、投资研究、长程任务执行、估值建模和银行业务等场景。评测显示,模型综合表现超过部分大尺寸旗舰模型,在同尺寸模型中具备较强竞争力。 从一个金融模型,到一套开放能力 此次Ling-3.0-flash-Fin的另一个特点,是“模型+工具+评测”的同步开放。 相比单纯发布一个行业模型,百灵希望进一步把模型能力放到真实任务中验证,并通过开放评测让金融机构、研究团队和开发者共同参与迭代。 目前,Ling-3.0-flash-Fin已开放模型权重,并面向开发者提供API体验;FinFIRST也同步开放,进一步降低金融AI研究和应用开发的门槛。对于金融行业而言,这种开放也意味着更多真实业务反馈能够反哺模型能力。 金融只是百灵此次探索真实世界AI的一个切入口。 随着AI从聊天、搜索逐渐走向Agent,模型真正的价值正在从“生成多少内容”,转向“能够承担多少工作”。在金融、医疗、企业服务等专业领域,AI最终能否形成生产力,不仅取决于模型本身的智能程度,也取决于它能否理解行业规则、调用专业工具,并真正嵌入一项工作的完整流程。 从“回答一个问题”到“完成一项工作”,这可能正是大模型从能力走向生产力的下一步。 未来,蚂蚁百灵将继续探索更大规模模型底座上的金融增强,提升长链路复杂任务处理能力,并从投资研究进一步拓展至更多金融业务场景。 本文由蚂蚁提供,量子位获授权转载,观点归原作者所有。 版权所有,未经授权不得以任何形式转载及使用,违者必究。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱