Ant Group 发布金融专注模型(6分钟阅读)

TLDR AI 模型

摘要

Ant Group 发布了 Ling-3.0-flash-Fin,一款金融专注的开源AI模型,在智能和财务基准测试中表现具有竞争力,但在代理任务方面面临挑战。

Ant Group 发布了 Ling-3.0-flash-Fin,一款与金融机构合作开发的开源权重模型,用于来源核查、估值电子表格和报告撰写等任务。Artificial Analysis 报告称,其在智能指数上得分为23,在财务与会计指数上得分为24。
查看原文
查看缓存全文

缓存时间: 2026/09/17 14:31

# 蚂蚁集团发布金融专用模型 Ling-3.0-flash-Fin 来源:https://artificialanalysis.ai/articles/ant-group-releases-finance-focused-ling-3-0-flash-fin ## **Ling\-3\.0\-flash\-Fin,蚂蚁集团新推出的金融专用开源权重模型,在人工智能分析智能指数中得分为23分,在金融与会计指数中得分为24分,同时位于智能指数与活动参数帕累托前沿** 参见模型页面 (https://artificialanalysis.ai/models/ling-3-0-flash-fin) 蚂蚁集团发布了基于Ling\-3\.0\-flash构建的金融专用模型Ling\-3\.0\-flash\-Fin。蚂蚁集团宣布该模型是与金融机构及行业专家共同开发,旨在支持金融研究,包括核查资料来源、构建估值电子表格及撰写报告。该纯文本模型在其支持图像与视频输入的模型Ling\-3\.0\-flash\-VL(在智能指数中得分为25分)之后发布。 ## **核心结果:** ➤ **Ling\-3\.0\-flash\-Fin以约一半的活动参数量达到了MiniMax\-M2\.7的智能指数得分。** 两者均得分为23分,但Flash\-Fin每个词元激活5\.1B参数,而MiniMax\-M2\.7为10B。 ➤ **Ling\-3\.0\-flash\-Fin在人工智能分析金融与会计指数中以24分追平了Ling\-3\.0\-flash\-VL。** Fin的商业知识准确度高于VL(17% vs\. 11%),但其商业知识幻觉率也更高(33% vs\. 19%)。 ➤ **Ling\-3\.0\-flash\-Fin在专业知识工作测试中得分略低于Ling\-3\.0\-flash\-VL。** 在GDPval\-AA v2中得分为1171 Elo,在AA\-Briefcase中得分为967,而Ling\-3\.0\-flash\-VL的对应得分分别为1225和986。这两项基准测试均评估代理在生成文档和电子表格等专业任务上的表现。 ➤ **复杂的代理任务对Ling\-3\.0\-flash\-Fin仍是挑战。** 在测试跨商业应用工作流并遵守防护栏的AutomationBench\-AA中,它得分7%,而flash\-VL模型为16%。两款模型在测试复杂终端使用任务的Terminal\-Bench v4\.0中均得分为0%。 ➤ **Ling\-3\.0\-flash\-Fin比flash\-VL模型和MiniMax\-M2\.7使用了更多的输出词元。** 在智能指数任务中,它平均输出约67k词元,比VL(约50k)多约34%,是MiniMax\-M2\.7(约21k)的3\.2倍。 ## **其他模型详情:** ➤ **类型:** 开源权重推理模型。 ➤ **规模:** 总参数124B,每个词元激活5\.1B(MoE)。 ➤ **上下文窗口:** 256K词元。 ➤ **模态:** 文本输入与输出。 ➤ **API可用性:** 通过 @OpenRouter 提供,包括一个有速率限制的免费端点。 ➤ **许可证:** MIT。 **Ling\-3\.0\-flash\-Fin位于智能指数与活动参数的帕累托前沿,以每个词元5\.1B活动参数得分23分,而使用5\.5B活动参数的Ling\-3\.0\-flash\-VL得分为25分。** 两者总参数均为124B,而Qwen3\.8 27B(xhigh)以27B总参数得分为34分,这使得两个Ling模型均位于总参数前沿之下。 **Ling\-3\.0\-flash\-Fin在人工智能分析金融与会计指数中得分为24分,该指数结合了商业知识、推理、代理工作、长上下文分析和非幻觉能力。** 这与Ling\-3\.0\-flash\-VL的得分相同。Fin的商业知识准确度更高(17% vs\. 11%),但商业知识幻觉情况也更严重(非幻觉率为67% vs\. 81%)。 **Ling\-3\.0\-flash\-Fin在测试专业知识工作的GDPval\-AA v2中得分为1171 Elo。** 这比得分1225的Ling\-3\.0\-flash\-VL低约50分,但高于得分1087的MiniMax\-M2\.7。 **Ling\-3\.0\-flash\-Fin在AA\-Briefcase中得分为967 Elo,略低于Ling\-3\.0\-flash\-VL(986)。** AA\-Briefcase测试代理在复杂商业工作流中的表现,使用大量源文件生成电子表格、演示文稿和备忘录。与VL相比,Fin通过的评分标准检查较少(23\.5% vs\. 24\.9%),分析质量Elo得分较低(866 vs\. 907),而其演示文稿Elo得分略高(1095 vs\. 1076),这令人惊讶,因为它并不具备VL模型的图像输入能力。 **Ling\-3\.0\-flash\-Fin在智能指数任务中平均输出约67k词元**,比产生约50k词元每任务的Ling\-3\.0\-flash\-VL多约34%。 Ling\-3\.0\-flash\-Fin在人工智能分析智能指数v4\.3的10项评估中的完整结果。

相似文章

@ZixuanLi_: GLM-5.3-Flash becomes the 3rd strongest open-weight model on AA. It shines even more when the benchmark focuses on comp…

X AI KOLs Timeline

GLM-5.3-Flash becomes the 3rd strongest open-weight model on AA. It shines even more when the benchmark focuses on complex agentic work. > **Artificial Analysis (@ArtificialAnlys):** > Announcing Artificial Analysis Intelligence Index v4.3, upgrading Terminal-Bench to 4.0 and adding AutomationBench-AA, an agentic workflow automation benchmark with a private test set. This is a continuation of our rollout of Intelligence Index v5 > > Changelog (Index v4.2 → Index