蚂蚁百灵发布首个金融增强模型Ling-3.0-flash-Fin,已开源
该模型瞄准真实投研工作流,覆盖信息检索、研究推理、估值建模、研报撰写等环节,并同步开放金融搜索Agent评测基准FinFIRST。
AI解读:模型基于Ling-3.0-flash打造,总参数 124B、激活参数 5.1B,支持 256K长上下文,能处理长年报和多份研究材料。目前它重点切入投资研究场景,强化信息检索、研究推理、估值建模和研报撰写四项能力,目标是让AI生成的结果能直接进入专业人员的原有工作流程。
这次它还同步开源了金融搜索Agent评测基准FinFIRST,由中金公司投行团队提供专业支持、50 余位金融专业人士参与设计。评测题覆盖多个市场,中文题占 60.2%,61.8% 的题要求显式计算,75.6% 不直接给信源,让Agent自己搜。这套基准的价值在于,它能检验一个金融AI是否说出了信息的来源、统计口径和推导过程——这正是金融从业者最看重的东西。
对基金公司、券商研究所或独立研究者来说,这类模型可能降低前期信息搜集和整理的耗时,但估值建模和研报结论仍需要专业人士复核。模型目前只从投研场景切入,蚂蚁百灵称未来会拓展到更多金融业务场景,但尚未公开具体的扩展时间表。
蚂蚁集团百灵于 2026 年 9 月 9 日发布首个金融增强开放模型Ling-3.0-flash-Fin,模型已开源,并同步开放金融搜索Agent评测基准FinFIRST。据蚂蚁介绍,这是百灵首次推出金融增强模型,传统金融大模型多解决问答、摘要等单点任务,而Ling-3.0-flash-Fin瞄准真实金融工作流,尝试让AI从“回答一个问题”走向“完成一项工作”。
模型配置与能力
Ling-3.0-flash-Fin基于Ling-3.0-flash打造,延续 124B总参数、5.1B激活参数的配置,并具备 256K长上下文能力。模型通过金融语料持续预训练、领域后训练和工具使用优化,强化对年报、财务工作簿、多份研究材料等复杂内容的处理能力。
模型目前重点切入投资研究场景,覆盖信息检索、研究推理、估值建模、研报撰写等环节。信息检索优先定位官方、一手及高可信数据源,关注信息时点和统计口径;研究推理通过多步计算和交叉验证厘清事实与假设;估值建模支持公式切换、跨表依赖和异常排查;研报撰写则组织事实、数据和判断,生成可编辑、可审核的研究材料。
评测基准FinFIRST与测试表现
与模型同步开源的FinFIRST(Financial Information Retrieval, Sourcing and Traceability)由蚂蚁集团构建,中金公司投行团队提供专业支持,50 余位金融专业人士参与设计。它重点评测金融搜索Agent在信息检索、信源选择、口径判断和推导过程等方面的能力,试图回答三个问题:信息从哪里来、口径是什么、结论如何得出。
FinFIRST覆盖中国内地、美国、中国香港及其他市场,中文题占 60.2%,英文题占 39.8%;超过五分之四的题目包含多个相关子问题,61.8% 要求显式计算,32.5% 需要多个信源,75.6% 不直接指定信源。所有题目均使用公开可访问的信源。
据蚂蚁介绍,Ling-3.0-flash-Fin已在FinFIRST、FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking等多个金融智能体基准上测试,覆盖金融信息检索、投资研究、长程任务执行、估值建模和银行业务等场景,综合表现超过部分大尺寸旗舰模型,在同尺寸模型中具备较强竞争力。
开放情况与后续计划
Ling-3.0-flash-Fin目前开放模型权重,并面向开发者提供API体验;FinFIRST也同步开放。蚂蚁百灵表示,未来将继续探索更大规模模型底座上的金融增强,提升长链路复杂任务处理能力,并从投资研究拓展至更多金融业务场景。