@levie:Claude Opus 5 现已发布,在众多能力上相比 Opus 4.8 有巨大飞跃。在 Box,我们一直在测试…

X AI KOLs Following 模型

摘要

Claude Opus 5 已发布,在尽职调查、生命科学、法律、技术和医疗保健任务的企业基准测试中,相比 Opus 4.8 显示出显著提升,增益幅度为 12-30%。

Claude Opus 5 现已发布,在众多能力上相比 Opus 4.8 有巨大飞跃。 在 Box,我们一直在使用 Box AI Agent 在 Box 的 Complex Work Eval 上测试 Claude Opus 5。Complex Work Eval 是我们的智能体基准测试,它让模型端到端地处理跨多个行业的真实企业文档工作。我们看到在非结构化数据上一些最复杂的企业任务中,性能有了显著提升。 以下是在测试中我们看到的一些成功案例: * 尽职调查 (+17%):在一次交易尽职调查审查中,Opus 5 完成了全部所需检查项,并标记出了 Opus 4.8 遗漏的内容。随着检查清单增加,它始终保持全面,而不是只捕捉明显项目就停止。 * 生命科学 (+30%):在一个目标识别任务中,它在严格匹配规则下对多个排序数据集进行交叉分析,以找到所有数据集共有的目标。Opus 4.8 过度包含了部分匹配项,并遗漏了真正的匹配项。 * 法律 (+12%):在一项对照政策的逐条款合同审查中,Opus 5 对每项条款进行了评分,并正确通过了在豁免条件下可接受的条款,而 Opus 4.8 既遗漏了项目,又错误地评分了豁免条款。 * 技术 (+19%) 和医疗保健 (+13%) 也呈现了相同模式:对杂乱原始材料进行完整、精确、多步骤分析。 总体而言,Opus 5 在推理、分析和数据处理技能上显著超越了 Opus 4.8。对于企业智能体应用场景来说将非常强大。很快,您将能够在 Box AI Studio 中使用 Opus 5 构建智能体。
查看原文
查看缓存全文

缓存时间: 2026/07/24 19:14

Claude Opus 5 现已发布,在多项能力上相比 Opus 4.8 实现了巨大飞跃。

在 Box,我们一直在使用 Box AI Agent 在 Box 的 Complex Work Eval(我们的智能体基准测试)上测试 Claude Opus 5,该测试让模型在多个行业中端到端地执行真实的企业文档工作。我们在处理非结构化数据方面最复杂的企业任务中观察到了显著的性能提升。

以下是我们测试中发现的一些成果示例:

  • 尽职调查(+17%):在一项交易尽职调查审查中,Opus 5 完成了所有必需的发现项,并标记了 Opus 4.8 遗漏的内容。随着检查清单的增长,它会保持全面,而不是只抓取明显的项目就停止。
  • 生命科学(+30%):在一项靶点识别任务中,它根据严格的匹配规则对多个排序数据集进行交叉分析,找到了所有数据集共有的靶点。Opus 4.8 过度包含了部分匹配项,并遗漏了真正的匹配项。
  • 法律(+12%):在根据政策进行逐条合同审查时,Opus 5 对每一条进行了评分,并正确通过了在例外情况下可接受的条款,而 Opus 4.8 既遗漏了项目,又错误地评定了例外情况。
  • 技术(+19%)和医疗保健(+13%):显示了相同的模式:对杂乱源材料进行完整、精确、多步骤的分析。

总体而言,Opus 5 的推理、分析和数据处理能力显著优于 Opus 4.8。这将对企业智能体用例非常强大。您很快就能在 Box AI Studio 中使用 Opus 5 构建智能体。

Claude (@claudeai): 介绍 Claude Opus 5。

这是一款深思熟虑且积极主动的模型,其前沿智能接近 Fable 5,而价格仅为一半。

相似文章

@FinanceYF5: 官方发布:

X AI KOLs Timeline

Anthropic 发布 Claude Opus 4.8,基于 Opus 4.7 构建,判断更敏锐,独立工作能力更强,价格不变。

推出 Claude Opus 4.6

YouTube AI Channels

Anthropic 宣布推出 Claude Opus 4.6,这是其最强大模型的升级版本,旨在提供更好的规划能力、更长的任务记忆以及更高的自主性。