@orca_build: Anthropic的新款Opus 4.8在Terminal-Bench 2.1上的得分比GPT 5.5低3.6%……但在UI任务上明显更出色。
摘要
Anthropic的Opus 4.8在Terminal-Bench 2.1上比GPT 5.5低3.6%,但擅长UI任务;Orca的编排功能让Codex能将UI任务委托给Claude Code。
Anthropic的新款Opus 4.8在Terminal-Bench 2.1上比GPT 5.5低3.6%……
……但在UI任务上明显更出色。真正的关键在于让它们协同工作。
借助Orca内置的编排功能,你可以让Codex将UI密集型任务直接委托给Claude Code:
1. https://t.co/KAvu9OM0ly
查看缓存全文
缓存时间: 2026/05/30 02:23
Anthropic的新Opus 4.8在Terminal-Bench 2.1上的得分比GPT 5.5低3.6%…
…但在UI任务上明显更出色。真正的关键在于让它们协同工作。
借助Orca的内置编排,你可以让Codex将UI密集型任务直接委托给Claude Code:
- https://t.co/KAvu9OM0ly
相似文章
Opus 5 基准测试 (ARC-AGI3 上达到 30.2%!!!)
Opus 5 在 ARC-AGI3 基准测试中达到 30.2%,标志着显著的性能提升。
Claude Sonnet 5 已发布,与 Opus 4.8 的差距比我预想的要小
Anthropic 发布了 Claude Sonnet 5,其基准测试得分非常接近 Opus 4.8,但价格大幅降低,使其成为代理任务的诱人选择,尽管可能存在实际差距。
@sashimikun_void: GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8。Opus 4.8 耗时两倍,生成三倍的…
GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8,以更低的成本和更少的 token 膨胀获得了更高的分数。
Opus 4.7 在 SimpleBench 上得分低于 4.6 与 4.5
Claude Opus 4.7 在 SimpleBench 评估中的表现较 4.6 与 4.5 版本有所下降。
Opus 5 的努力档位并非单调递增。在“高”档以上,编程得分反而下降,Anthropic 自家的迁移指南也这么说。
Anthropic 的 Opus 5 在编程任务上表现出非单调性能;由于不必要的重构,“高”努力档位的表现优于“最大”档。该模型的幻觉率也比 Opus 4.8 高出 6%,并且安全分类器可能会静默回退到旧模型。