@levie: 在Box,我们一直在早期测试版中使用Fable 5.1,以评估其在复杂企业工作中的表现。Fable 5.1带来了巨大的提升……
摘要
Box测试了Fable 5.1,该模型在复杂企业任务中比Fable 5提升了7个百分点,在金融服务、技术和公共部门等方面有显著进步,并将与新模型Claude Fable 5.1和Claude Mythos 5.1一起在Box AI Studio中提供。
查看缓存全文
缓存时间: 2026/09/01 23:48
在Box公司,我们一直在针对复杂的企业工作评估测试抢先体验版的Fable 5.1。在非结构化数据处理任务中,Fable 5.1相较Fable 5实现了高达7个百分点的巨大提升。
在本次更新的测试中,我们使用搭载Fable 5.1的Box Agent处理涵盖金融、生命科学、公共部门等多个行业的广泛真实企业场景文档。所有这些任务都需要高度的分析能力、数学运算、逻辑推理和领域知识才能成功完成。
以下是取得优势的几个案例:
-
金融服务(提升17%):在税后利润预测任务中,Fable 5.1能正确应用资本免税额后再计算税负——这种细微的计算顺序正是Fable 5所遗漏的,导致从税负计算到留存收益的全程数据错误。
-
科技行业(提升37%):在成本优化分析中,当关键指标的标准化方式存在歧义时,Fable 5.1能识别这种模糊性,计算两种标准化形式并呈现正确结果;而Fable 5直接采用了错误的标准化方案。
-
公共部门(提升16%):在教育数据分析任务中,Fable 5.1完整执行加权平均方法并生成正确排名,而Fable 5错误分类单项数据,导致整张表格产生连锁误差。
这些仅是观测到的部分优势案例。总体而言,在企业长时间运行的智能体工作流中,Fable 5.1的能力实现了重大飞跃。
Fable 5.1即将登陆Box AI Studio,用于构建基于企业内容的定制化AI智能体。
Claude (@claudeai): 我们推出Claude Fable 5.1与Claude Mythos 5.1。
这是当今全球最前沿的编码与知识工作模型。
相似文章
@levie: 我们一直在用Anthropic的Claude Sonnet 5运行Box AI Complex Work Eval,这是我们用于评估模型在复杂企业文档工作中表现的智能体基准测试…
Box在其智能体基准测试中运行了Claude Sonnet 5,发现它在尽职调查、成本分析等复杂企业任务上超越了Sonnet 4.6。Sonnet 5即将在Box AI Studio中可用。
Claude Fable 5.1
Claude Fable 5.1 是 Anthropic 推出的用于编程和知识工作的最先进 AI 模型,其研究能力让我们得以初步窥见 AI 对科学进步的贡献。
推出 Claude Fable 5.1
Anthropic 推出了 Claude Fable 5.1,这是一款升级的 AI 模型,旨在擅长处理复杂的多步骤任务,例如金融建模和代码优化,并在整个长时间运行过程中具有更高的稳定性和准确性。
@heyshrutimishra: 1. Fable 5 在几乎所有重要基准测试中都是最先进的。软件工程。科学。知识工作。视觉……
Anthropic 发布了 Fable 5,声称它在软件工程、科学、知识工作和视觉等关键基准测试中达到了最先进水平,超过了所有先前可用的模型。
@danshipper: FABLE 5.1 超强
Dan Shipper 宣布 FABLE 5.1 是 AI 或科技领域中一个令人印象深刻的版本,可能指的是模型更新。