蚂蚁百灵发布首个金融增强模型Ling-3.0-flash-Fin,AI投研从问答迈向工作流

2026/09/09 13:02阅读量 2

蚂蚁集团百灵发布首个金融增强开放模型Ling-3.0-flash-Fin并正式开源,该模型基于Ling-3.0-flash架构,旨在打通信息检索、研究推理、估值建模及研报撰写的完整投研工作链。同步开放的FinFIRST评测基准由中金公司投行团队支持,聚焦评估金融Agent在信源选择、口径判断及推导过程的专业能力。目前模型已在多个金融智能体基准测试中表现优异,标志着AI在金融领域从单点问答向复杂任务执行的生产力转化。

事件概述

在外滩大会前夕,蚂蚁集团百灵正式发布首个金融增强开放模型 Ling-3.0-flash-Fin,并同步开源。该模型突破了传统金融大模型仅解决问答、摘要等单点任务的局限,转而瞄准真实的金融工作流,试图让AI从“回答一个问题”进化为“完成一项工作”。与此同时,蚂蚁还开源了金融搜索Agent评测基准 FinFIRST,逐步开放模型、工具及评测体系,降低金融AI应用开发门槛。

核心信息与模型能力

1. 技术架构与定位

  • 基础底座:基于 Ling-3.0-flash 打造,保持 124B 总参数、5.1B 激活参数的配置,具备 256K 长上下文处理能力,兼顾复杂金融内容处理与实际部署效率。
  • 训练优化:通过金融语料持续预训练、领域后训练及工具使用优化,强化了对年报、财务工作簿、多份研究材料等复杂内容的理解与处理能力。
  • 核心目标:强调面向长链路 Agent 工作的能力,将信息检索、证据审查、计算、建模和报告准备连接为完整的金融研究工作流。

2. 四大核心能力打通投研链路
模型重点切入投资研究场景,强化了以下四项连贯能力:

  • 信息检索:优先定位官方、一手及高可信数据源,严格关注信息时点和统计口径。
  • 研究推理:通过多步计算和交叉验证,厘清事实与假设,构建可复核的证据链。
  • 估值建模:深入真实工作簿,支持公式切换、跨表依赖和异常排查,确保 AI 生成结果能无缝接入专业人员原有工作流程。
  • 研报撰写:组织事实、数据和判断,生成可编辑、可审核的研究材料。

3. FinFIRST 评测基准

  • 背景与支持:由蚂蚁集团构建并开源,中金公司投行团队提供专业支持,50余位金融专业人士参与设计。
  • 评测维度:不仅考核答案正确性,更重点评估信息溯源(从哪里来)、口径一致性(是什么)及推导逻辑(如何得出)。
  • 数据集构成:覆盖中国内地、美国、中国香港及其他市场。中文题占 60.2%,英文题占 39.8%。超过 80% 的题目包含多个子问题,61.8% 要求显式计算,75.6% 需自主搜索信源。
  • 测试表现:Ling-3.0-flash-Fin 在 FinFIRST、FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking 等多个基准上进行了测试,综合表现超过部分大尺寸旗舰模型,在同尺寸模型中具备较强竞争力。

值得关注

此次发布不仅是单一模型的推出,更是“模型+工具+评测”体系的同步开放。蚂蚁集团希望通过开放模型权重和 API,以及提供贴近真实需求的评测标准,吸引金融机构、研究团队和开发者共同参与迭代。这反映了 AI 行业的一个趋势:随着 Agent 技术的发展,模型价值正从“生成内容量”转向“承担工作任务的能力”,而在金融、医疗等专业领域,能否嵌入完整工作流并理解行业规则,将成为衡量 AI 生产力的关键指标。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。