@rohanpaul_ai:CAIS和Scale(人工智能安全研究小组)表示,Fable 5 现在能够自动化16.1%的真实远程工作项目,大约是Opus 4的两倍…

X AI KOLs Following 新闻

摘要

CAIS和Scale报告称,Fable 5 在远程劳动指数上实现了16.1%的自动化率,是Opus 4.8的两倍,尽管质量控制仍是一个挑战。

CAIS和Scale(人工智能安全研究小组)表示,Fable 5 现在能够自动化16.1%的真实远程工作项目,大约是Opus 4.8的两倍。 远程劳动指数测试一款人工智能是否能出色地完成付费的自由职业工作,从而让客户能够接受它。 每项任务都附带简介、文件以及一个作为人类基准的专业交付成果。 Fable 5 在新结果中领先,而Opus 4.8达到了8.3%,GPT-5.5达到了6.3%。 16.1%这一数字仍然意味着在大多数任务上失败,但改进的方向是巨大的。为了说明这一飞跃的幅度,RLI推出时最好的模型得分仅为2.5%。 这项测试不是简单的提示工程,因为任务包括CAD、建筑、动画、音频、数据分析和网络应用程序。这意味着该基准测试的是计算机在各种复杂工具上的工作,而非狭窄的文本答案。 Fable 5 在环建模、动画和浴室设计等示例中表现最强。 自动评判对模型排名效果不错,但将GPT-5.5高估了约2.9倍,将Opus 4.8高估了约2.3倍。结果说明人工智能智能体正在快速进步,但质量控制仍然是一道难以逾越的壁垒。 另一个关键点是,模型本身已不再是产品的全部。进步来自于更强的智能体设置:更好的工具使用、完整的桌面环境、专业软件、更长的运行时间以及工人-评论者循环——其中一个智能体执行任务,另一个像苛刻的客户一样对其进行审查。
查看原文
查看缓存全文

缓存时间: 2026/07/05 22:36

CAIS和Scale(AI安全研究团队)表示,Fable 5目前已能自动化完成16.1%的真实远程工作项目,约为Opus 4.8(8.3%)的两倍。

远程劳动指数(Remote Labor Index)测试AI能否完成付费的自由职业工作,且质量足以让客户接受。

每项任务均附带需求说明、文件以及一份作为人类基准的专业交付成果。

Fable 5在新一轮测试结果中领先,Opus 4.8达到8.3%,GPT-5.5达到6.3%。

16.1%这一数字仍意味着在大部分任务上失败,但改进方向非常显著。为了理解这一跃升的幅度:RLI刚推出时,最佳模型得分仅为2.5%。

该项测试并非简单的提示词游戏,因为任务涵盖CAD、建筑、动画、音频、数据分析以及Web应用。这说明该基准测试的是跨杂乱工具的真实计算机工作,而非狭窄的文本答案。

Fable 5在环形建模、动画及浴室设计等示例中表现最为突出。

自动评判模型对模型评分较为准确,但对GPT-5.5的评分偏高约2.9倍,对Opus 4.8的评分偏高约2.3倍。结果表明AI智能体正在快速进步,但质量控制依然是难以逾越的障碍。

另一个关键点是:模型本身已不再是产品的全部。性能提升主要来自更强大的智能体配置:更好的工具使用、完整的桌面环境、专业软件、更长的运行时间,以及“工人-评论家”循环——即一个智能体执行任务,另一个像苛刻客户一样对其进行审查。

Rohan Paul (@rohanpaul_ai): AI收入的增长速度是移动互联网或互联网的三倍。

价值单位正从注意力的获取转向任务的完成。

相似文章