@rohanpaul_ai:CAIS和Scale(人工智能安全研究小组)表示,Fable 5 现在能够自动化16.1%的真实远程工作项目,大约是Opus 4的两倍…
摘要
CAIS和Scale报告称,Fable 5 在远程劳动指数上实现了16.1%的自动化率,是Opus 4.8的两倍,尽管质量控制仍是一个挑战。
查看缓存全文
缓存时间: 2026/07/05 22:36
CAIS和Scale(AI安全研究团队)表示,Fable 5目前已能自动化完成16.1%的真实远程工作项目,约为Opus 4.8(8.3%)的两倍。
远程劳动指数(Remote Labor Index)测试AI能否完成付费的自由职业工作,且质量足以让客户接受。
每项任务均附带需求说明、文件以及一份作为人类基准的专业交付成果。
Fable 5在新一轮测试结果中领先,Opus 4.8达到8.3%,GPT-5.5达到6.3%。
16.1%这一数字仍意味着在大部分任务上失败,但改进方向非常显著。为了理解这一跃升的幅度:RLI刚推出时,最佳模型得分仅为2.5%。
该项测试并非简单的提示词游戏,因为任务涵盖CAD、建筑、动画、音频、数据分析以及Web应用。这说明该基准测试的是跨杂乱工具的真实计算机工作,而非狭窄的文本答案。
Fable 5在环形建模、动画及浴室设计等示例中表现最为突出。
自动评判模型对模型评分较为准确,但对GPT-5.5的评分偏高约2.9倍,对Opus 4.8的评分偏高约2.3倍。结果表明AI智能体正在快速进步,但质量控制依然是难以逾越的障碍。
另一个关键点是:模型本身已不再是产品的全部。性能提升主要来自更强大的智能体配置:更好的工具使用、完整的桌面环境、专业软件、更长的运行时间,以及“工人-评论家”循环——即一个智能体执行任务,另一个像苛刻客户一样对其进行审查。
Rohan Paul (@rohanpaul_ai): AI收入的增长速度是移动互联网或互联网的三倍。
价值单位正从注意力的获取转向任务的完成。
相似文章
Claude Fable 在远程劳动自动化指数上获得 16.10%,是第二名(Opus)的两倍
Claude Fable 在远程劳动自动化指数上取得 16.10% 的成绩,是次佳模型 Opus 的两倍
@rohanpaul_ai: 这可能是一个极端案例,但它仍然显示了Fable 5分类器如何迅速将常规编码重定向到Opus。……
一位用户报告称,Fable 5的新分类器将75%的编码会话错误地路由到Opus,将常规编码标记为网络安全风险,导致意外的高成本。
我用了半天的Fable 5,发现护栏才是真正的故事
Anthropic的Fable 5模型展现了令人印象深刻的推理和上下文处理能力,但存在高延迟、高成本以及在特定领域静默回退到Opus 4.8的问题,这可能会中断工作流程。
据Anthropic称,Fable 5将把编程任务转向Opus 4.8
据Anthropic称,Fable 5的开发将转向使用Opus 4.8 AI模型进行编码任务。
@robinebers: Fable 5 Low 优于 Opus 4.8 Max
用户发帖比较,认为 Fable 5 Low 优于 Opus 4.8 Max,另一用户评论称 Fable 5 回归了但使用方式不当。