@levie:Claude Opus 5 现已发布,在众多能力上相比 Opus 4.8 有巨大飞跃。在 Box,我们一直在测试…
摘要
Claude Opus 5 已发布,在尽职调查、生命科学、法律、技术和医疗保健任务的企业基准测试中,相比 Opus 4.8 显示出显著提升,增益幅度为 12-30%。
查看缓存全文
缓存时间: 2026/07/24 19:14
Claude Opus 5 现已发布,在多项能力上相比 Opus 4.8 实现了巨大飞跃。
在 Box,我们一直在使用 Box AI Agent 在 Box 的 Complex Work Eval(我们的智能体基准测试)上测试 Claude Opus 5,该测试让模型在多个行业中端到端地执行真实的企业文档工作。我们在处理非结构化数据方面最复杂的企业任务中观察到了显著的性能提升。
以下是我们测试中发现的一些成果示例:
- 尽职调查(+17%):在一项交易尽职调查审查中,Opus 5 完成了所有必需的发现项,并标记了 Opus 4.8 遗漏的内容。随着检查清单的增长,它会保持全面,而不是只抓取明显的项目就停止。
- 生命科学(+30%):在一项靶点识别任务中,它根据严格的匹配规则对多个排序数据集进行交叉分析,找到了所有数据集共有的靶点。Opus 4.8 过度包含了部分匹配项,并遗漏了真正的匹配项。
- 法律(+12%):在根据政策进行逐条合同审查时,Opus 5 对每一条进行了评分,并正确通过了在例外情况下可接受的条款,而 Opus 4.8 既遗漏了项目,又错误地评定了例外情况。
- 技术(+19%)和医疗保健(+13%):显示了相同的模式:对杂乱源材料进行完整、精确、多步骤的分析。
总体而言,Opus 5 的推理、分析和数据处理能力显著优于 Opus 4.8。这将对企业智能体用例非常强大。您很快就能在 Box AI Studio 中使用 Opus 5 构建智能体。
Claude (@claudeai): 介绍 Claude Opus 5。
这是一款深思熟虑且积极主动的模型,其前沿智能接近 Fable 5,而价格仅为一半。
相似文章
Claude Sonnet 5 已发布,与 Opus 4.8 的差距比我预想的要小
Anthropic 发布了 Claude Sonnet 5,其基准测试得分非常接近 Opus 4.8,但价格大幅降低,使其成为代理任务的诱人选择,尽管可能存在实际差距。
@FinanceYF5: 官方发布:
Anthropic 发布 Claude Opus 4.8,基于 Opus 4.7 构建,判断更敏锐,独立工作能力更强,价格不变。
“@mfpiccolo: Opus 4.8 已发布。以下是 @iiidevs 首席工程师的结论:进行了压力测试,它只是另一个无法真正理解……的语言模型”
Anthropic 发布了 Claude Opus 4.8,这是对 Opus 4.7 的增量更新,具有更精准的判断力和更长的自主工作能力,不过一些工程师对其在缺乏广泛指导下的代码生成能力仍持怀疑态度。
推出 Claude Opus 4.6
Anthropic 宣布推出 Claude Opus 4.6,这是其最强大模型的升级版本,旨在提供更好的规划能力、更长的任务记忆以及更高的自主性。
@danshipper: 重磅:Claude Opus 5 现已发布!而且……这是一个让人爱不起来的模型。过去一周,我们在@every上对它在c…
对Claude Opus 5的初步体验显示,它打破了与现有工作流程的向后兼容性,但从零开始时却展现出非凡才华,处于天才模型与通用模型之间的尴尬中间地带。