Astra、Opus 5.5 等前沿模型在从网页浏览到机器人的 SoTA 智能体任务中表现出参差不齐的性能(32 分钟阅读)

TLDR AI 论文

摘要

Fig 与 Georgia Tech 的技术报告评估了 Astra、Opus 5.5 等前沿模型在网页自动化与物理任务(操作、装配、工业流程、驾驶)上的表现,发现模型性能呈“锯齿状”分布,没有明确的性能领先者,并发布 item 级结果数据集 RIDGE。

在网页任务中没有明确的性能领先者,且模型与任务的匹配度存在很大差异。
查看原文
查看缓存全文

缓存时间: 2026/09/30 14:55

# Astra、Opus 5.5 及其他前沿模型在从网页浏览到机器人的 SOTA 智能体任务中表现参差不齐 来源:https://www.fig.inc/blog/astra-opus-5-5-and-other-frontier-models-demonstrate-jagged-performance-across-sota-agentic-tasks-from-web-browsing-to-robotics/ 技术报告 (https://www.fig.inc/tag/technical-report/) **Yangyue Wang (https://locke0.github.io/?ref=fig.inc)1**、**Harshvardhan Sikka (https://www.harshsikka.com/?ref=fig.inc)1, 2**、**Pranav Guruprasad (https://pranavguru.github.io/?ref=fig.inc)1**、**Sudipta Chowdhury (https://www.linkedin.com/in/sudipta-chowdhury-3610a3303/?ref=fig.inc)1** 1Fig (https://fig.inc/?ref=fig.inc);2Georgia Institute of Technology (https://www.gatech.edu/?ref=fig.inc)\. ## 摘要 - 我们逐个任务评估了 Astra 和 Opus 5.5 等前沿模型,涵盖网页自动化和物理任务:操作、装配、工业流程与驾驶\. - **没有明确的性能领跑者\.**在每一对模型中,得分较低的模型都能解决得分较高的模型失败的任务\. - **网页任务中模型-任务匹配度方差很大\.**最佳模型会随网站和基准自身难度标签的变化而变化\. - **模型更新会重塑表现轮廓\.**一次更新可能让平均分几乎不变,却改变了模型所能解决的大量任务\. - **物理领域的表现同样不均衡\.**在每个领域平均分更高的模型,仍然在某些任务类别上表现更差\. - 我们发布了 **RIDGE** (https://huggingface.co/datasets/figai/RIDGE?utm_source=fig-tr-tldr-bottom&utm_medium=community&utm_campaign=jagged-frontier-model-base):涵盖全部五个领域的逐条目结果与模型输出\. 正在研究相关问题? 与作者交流 (https://www.fig.inc/blog/astra-opus-5-5-and-other-frontier-models-demonstrate-jagged-performance-across-sota-agentic-tasks-from-web-browsing-to-robotics/#tally-open=7RGXaZ&tally-layout=modal&tally-width=750&utm_source=fig-tr-tldr&utm_medium=community&utm_campaign=jagged-frontier-model-base) 前沿模型如今被用于网页浏览、自动驾驶、装配作业和桌面操作任务\.它们在这些领域上的表现以及部署决策,都依赖于各家实验室报告的基准分数\.然而,基准均值掩盖了模型成功表现跨任务的巨大差异\.当一个模型在基准以单一数字概括的多个任务之间成功率波动剧烈时,我们称这种表现轮廓为**参差不齐(jagged)**的\. 近期工作测量了智能体的可靠性 \[14, 15\],整体性排行榜也报告了头条数字所丢弃的离散程度 \[16\]\.这些结果通常覆盖以文本为主的智能体在数字任务上的表现,或者在基准或任务类别平均值层面报告离散程度\.由于智能体行为是学习得到而非预先设定的,其能力必须通过实测来衡量 \[20\],测试用户实际运行的任务,而非单一的基准平均值 \[1\]\.模型被部署在哪个任务类别上,对可靠性的影响几乎与模型选择本身相当 \[15\]\. **我们变化两个维度\.**模型维度在单一闭环领域上变化模型,即在 VisualWebArena(VWA)\[2\] 上运行七个模型\.领域维度在四个离线领域上运行三个模型:Bench2Drive \[5\]、VLABench \[6\]、IndEgo \[3\] 和 Assembly101 \[4\]\.每个基准保留其自身的运行框架与指标,每个单元格均为单次运行\. 我们的发现包括: - **没有明确的性能领跑者\.**我们数据集中每一对模型中,较弱的模型至少能解决一个较强模型失败的任务\. - **网页任务中模型-任务匹配度方差很大\.**某个模型在三个网站上的离散程度,与七个模型在单个网站上的离散程度相当\.基准自带的难度标签与模型成功率只有很弱的相关性\. - **模型更新可能在不改变平均分的情况下改变表现轮廓\.**同一模型系列内的更新可能让平均分几乎不变,而大量任务的结果却发生了翻转;而提升平均分的更新,仍会丢失旧模型曾解决的任务\. - **同样的参差不齐也出现在物理领域\.**在每个领域平均分都超过 Gemini 3.5-Flash 的模型,在某些任务类别上仍然表现更差\. **我们发布了 *RIDGE*** (https://huggingface.co/datasets/figai/RIDGE?utm_source=fig-tr-intro&utm_medium=community&utm_campaign=jagged-frontier-model-base),一个包含全部五个领域逐条目结果以及本技术报告背后模型轨迹的数据集\. ## 跨模型与跨领域的测量 | 领域 | 任务 | 模型 | 指标 | n | 聚类 | | --- | --- | --- | --- | --- | --- | | VisualWebArena | 闭环网页任务 | Fable 5、GPT-5.6、Opus 4.7、Opus 5、Kimi K3、Astra、Opus 5.5 | 任务成功率 | 177 | 网站(177) | | VLABench | VLM 轨道,全部分层 | Gemini 3.5-Flash、Astra、Opus 5.5 | 精确匹配 | 644 | 任务(6) | | Assembly101 | 粗粒度动作预测 | Gemini 3.5-Flash、Astra、Opus 5.5 | 动作 top-1 | 520 | 录制(27) | | IndEgo | 下一关键步骤预测 | Gemini 3.5-Flash、Astra、Opus 5.5 | 关键步骤 top-1 | 300 | 录制(268) | | Bench2Drive-VL | 问题 50,两轮链式 | Gemini 3.5-Flash、Astra、Opus 5.5 | 逐步加权 F1 | 3,746 | 路线(86) | 表 1:七个模型运行在唯一的闭环领域(VisualWebArena)上;四个离线领域在相同任务上运行三个模型;两轮扫描中每个单元格均为单次运行,需参照重复运行 Opus 4.7(最大步数预算为 50)所得的 ±3pp 噪声区间来解读\. 我们在一个领域上变化模型,然后在三个模型上变化领域(表 1)\. - **闭环 VWA 计算机使用任务\.**177 个任务 × 7 个模型(Fable 5、GPT-5.6、Opus 4.7、Opus 5、Opus 5.5、Kimi K3、GPT-6 Astra),每个单元格单次运行,横跨三个网站:分类信息(48 个任务)、reddit(44 个任务)和购物(85 个任务)\.我们在 BrowserGym 的 VisualWebArena 环境中运行它们\. - **离线物理任务\.**4 个领域 × 3 个模型(Gemini 3.5-Flash、GPT-6 Astra、Opus 5.5),逐条目配对\.IndEgo 300 个片段,来自 268 个录制;Assembly101 520 个条目,来自 27 个录制;Bench2Drive 3,746 个片段,来自 86 条路线;VLABench 644 个回合,覆盖 6 个操作任务\. - **评分\.**使用每个基准自身的指标,涵盖任务成功率、动作精确匹配、top-1 动作匹配以及逐步加权 F1\.VWA 全程使用基准自带的程序化检查器评分;我们也单独报告了使用宽松字符串匹配的替代评分方式(表 7)\. - **噪声\.**VWA 的 ±3pp 区间,即在 50 步预算下,两个配对的 Opus 4.7 运行之间在各网站上的最大分歧\. ## 没有明确的性能领跑者 | 模型 | 得分 | | --- | --- | | Astra | 139/177 | | Fable 5 | 138/177 | | GPT-5.6 | 125/177 | | Opus 5.5 | 124/177 | | Opus 4.7 | 117/177 | | Opus 5 | 115/177 | | Kimi K3 | 102/177 | | 模型 | Astra | Fable 5 | GPT-5.6 | Opus 5.5 | Opus 4.7 | Opus 5 | Kimi K3 | | --- | --- | --- | --- | --- | --- | --- | --- | | **Astra** 139/177 | — | 10 | 6 | 10 | 9 | 5 | 6 | | **Fable 5** 138/177 | 11 | — | 9 | 10 | 7 | 3 | 5 | | **GPT-5.6** 125/177 | 20 | 22 | — | 21 | 13 | 14 | 9 | | **Opus 5.5** 124/177 | 25 | 24 | 22 | — | 16 | 11 | 12 | | **Opus 4.7** 117/177 | 31 | 28 | 21 | 23 | — | 17 | 13 | | **Opus 5** 115/177 | 29 | 26 | 24 | 20 | 19 | — | 18 | | **Kimi K3** 102/177 | 43 | 41 | 32 | 34 | 28 | 31 | — | 表 2:跨模型任务解决与失败数量对比\.行表示在对比中失败的任务数量列表示在对比中各自解决的任务数量\. | 模型 | 任务成功率 | | --- | --- | | Astra | 78.5%(139/177) | | Fable 5 | 78.0%(138/177) | | GPT-5.6 | 70.6%(125/177) | | Opus 5.5 | 70.1%(124/177) | | Opus 4.7 | 66.1%(117/177) | | Opus 5 | 65.0%(115/177) | | Kimi K3 | 57.6%(102/177) | 图 1:VisualWebArena 上各模型的任务成功率 在全部 21 对模型比较中,得分较低的模型都至少解决了 3 个得分较高的模型失败的任务,差距最大的一对达到 21 个(表 2)\.Opus 4.7 和 Opus 5 就是一例\.Opus 5 比 Opus 4.7 低 1.1pp(图 1),两者在任务上双向互换:Opus 5 独家解决 17 个任务,而 Opus 4.7 独家解决 19 个\.图 2 展示了 Fable 5 和 Opus 4.7 之间类似的互换\. 这种互换发生在任务集合中竞争最激烈的那一半\.按有多少个模型解决对 177 个任务进行划分,可以看出哪些任务决定了排名\.七个模型都解决 66 个任务(37%),无一解决的有 21 个(12%),其余 90 个(51%)处于竞争状态(表 3)\.前两组为每个模型的得分贡献相同的增量,因此最高分与最低分模型之间 20.9pp 的差距完全来自竞争任务集\.得分最高的模型解决了 177 个中的 139 个(78.5%),而七个模型合计解决 156 个(88.1%),多出 17 个任务\. 竞争任务集也区分出了前两名模型\.Astra 平均分最高,为 78.5%,但仅比 Fable 5(78.0%)高出一个任务,落在 ±3pp 区间内\.以 Astra 为参照,Fable 5 和 Opus 5.5 各自保有 10 个 Astra 失败的任务,Opus 4.7 有 9 个,GPT-5.6 和 Kimi K3 各有 6 个,Opus 5 有 5 个\.Kimi K3 比 Astra 低 20.9pp,却仍保有 6 个(表 2)\. **图 2:一个非支配的例子\.Fable 5 和 Opus 4.7 各自能解决对方失败的任务\.** ## 网页任务中模型-任务匹配度方差很大 七个模型在 VisualWebArena 上按每种任务分组的排名都不同(表 3)\. | 模型 | 分类信息 n=48 | reddit n=44 | 购物 n=85 | 视觉难度:易 n=71 | 中 n=65 | 难 n=41 | 流程难度:易 n=50 | 中 n=66 | 难 n=61 | 失败数:0 | 6 | 3 | 5 | 2 | 1 | 7 | 7 | | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | | Kimi K3 | 60 | 66 | 52 | 62 | 58 | 49 | 68 | 50 | 57 | 100 | 60 | 41 | 45 | 17 | 12 | 0 | 0 | | Opus 5 | 73 | 61 | 62 | 68 | 63 | 63 | 60 | 65 | 69 | 100 | 86 | 65 | 36 | 25 | 12 | 0 | 0 | | Opus 4.7 | 79 | 73 | 55 | 69 | 68 | 59 | 70 | 65 | 64 | 100 | 80 | 71 | 45 | 42 | 12 | 0 | 0 | | Opus 5.5 | 81 | 68 | 65 | 72 | 69 | 68 | 66 | 68 | 75 | 100 | 89 | 53 | 73 | 58 | 12 | 29 | 0 | | GPT-5.6 | 77 | 80 | 62 | 75 | 66 | 71 | 72 | 65 | 75 | 100 | 91 | 76 | 36 | 50 | 5 | 0 | 0 | | Fable 5 | 85 | 75 | 75 | 82 | 75 | 76 | 74 | 74 | 85 | 100 | 100 | 94 | 82 | 50 | 38 | 43 | 0 | | Astra | 77 | 91 | 73 | 82 | 75 | 78 | 76 | 76 | 84 | 100 | 94 | 100 | 82 | 58 | 62 | 29 | 0 | 表 3:七个模型按任务类别的成功率\.最后一个类别按有多少个模型失败该任务分组,第 0 列和第 7 列按定义分别为 100 和 0\. **按网站划分\.**某个模型在三个网站之间的离散程度,大约与七个模型在单个网站之间的离散程度相当\.Opus 4.7 的跨度为 23.9pp(分类信息 79、reddit 73、购物 55),Astra 为 18.0pp(77/91/73),Fable 5 最紧凑,为 10.4pp(85/75/75)\.沿同一跨网站表格向下读列,分类信息得分为 60 到 85,reddit 为 61 到 91,购物为 52 到 75\.Astra、GPT-5.6 和 Kimi K3 在 reddit 上得分最高,Fable 5、Opus 4.7、Opus 5 和 Opus 5.5 在分类信息上得分最高\.最强模型随维度而变:Fable 5 在分类信息(85)和流程难度-难(85)上居首,Astra 在 reddit(91)上居首,两者在视觉难度-易(82)上打平\. **按基准自带的难度标签划分\.**基准的难度标签对模型的区分效果并不比按网站划分更好\.在视觉难度标签下,每个模型在"难"上的得分都低于"易",但幅度仅为 3.5pp(Opus 5.5)到 13.2pp(Kimi K3),且没有任何模型的下降幅度能与其自身区间分离\.流程难度标签区分度更高,但对某些模型抬高得分,对另一些则降低\.七个模型中有五个在流程难度-难上的得分*高于*流程难度-易:Fable 5 高 11.2pp(74/74/85),Opus 5.5 高 9.4pp(66/68/75),Opus 5 高 8.9pp(60/65/69),Astra 高 7.6pp(76/76/84),GPT-5.6 高 3.4pp(72/65/75);而 Kimi K3 下降 10.6pp(68/50/57),Opus 4.7 下降 6.1pp(70/65/64)\. **按从模型结果推导出的维度划分\.**一个基于模型结果本身构建的维度对模型区分度最高\.按每个任务有多少个模型失败对任务分桶,得到 66、35、17、11、12、8、7 和 21 个任务的分桶\.从第 1 桶到第 5 桶,每个模型的得分下降 32 到 76pp\.只有 Opus 4.7 和 Opus 5 从未从一个桶到下一个桶出现提升;其余五个至少上升过一次,但所在的桶只有 7 到 17 个任务,样本量太小,无法构成统计上有意义的趋势\.这个维度也是循环的,因为它是由它所排序的同一批七个模型构建的(参见讨论部分)\. ## 模型更新可以在不改变平均分的情况下改变表现轮廓 无论平均分朝哪个方向变化,每次更新对不同任务类别造成的影响幅度都不同\. | 更新 | 全套任务 | McNemar p | | --- | --- | --- | | Opus 4.7 → Opus 5 | 0.661 → 0.650(−0.011) | p=0.868 | | ├─ 分类信息 n=48 | −0.062(2/5) | | | ├─ reddit n=44 | −0.114(3/8) | | | └─ 购物 n=85 | +0.071(12/6) | | | 更新 | 全套任务 | McNemar p | | --- | --- | --- | | Opus 5 → Opus 5.5 | 0.650 → 0.701(+0.051) | p=0.150 | | ├─ 分类信息 n=48 | +0.083(5/1) | | | ├─ reddit n=44 | +0.068(5/2) | | | └─ 购物 n=85 | +0.024(10/8) | | | 更新 | 全套任务 | McNemar p | | --- | --- | --- | | GPT-5.6 → Astra | 0.706 → 0.785(+0.079) | p=0.009 | | ├─ 分类信息 n=48 | +0.000(4/4) | | | ├─ reddit n=44 | +0.114(6/1) | | | └─ 购物 n=85 | +0.106*(10/1) | | - Opus 4.7 → Opus 5:21 个类别中 **11 个变差**,标准差 0.063,reddit −0.114,视觉难度-易 −0.100 - Opus 5 → Opus 5.5:21 个类别中 **0 个变差**,标准差 0.051 - GPT-5.6 → Astra:21 个类别中 **2 个变差**,标准差 0.058,视觉排名 −0.095,视觉难度-易 −0.026 *每个柱形 = 一个任务类别(n≥8);每网站变化,95% 置信区间内(获得/丢失)* 图 3:三次同系列模型更新\.左:每个网站的配对变化,含网站内 bootstrap 区间;右:所有任务类别按变化排序,标出变差的类别\.Opus 4.7 → Opus 5 和 GPT-5.6 → Astra 的离散程度几乎相同但方向相反;Opus 5 → Opus 5.5 没有类别变差\. | 模型 | 解决 | 比率 | | --- | --- | --- | | Opus 5.5 | 19/21 | 0.905 | | GPT-5.6 | 18/21 | 0.857 | | Fable 5 | 17/21 | 0.810 | | Astra | 16/21 | 0.762 | | Kimi K3 | 16/21 | 0.762 | | Opus 4.7 | 16/21 | 0.762 | | Opus 5 | 14/21 | 0.667 | | **同系列更新** | | | | Opus 4.7 → Opus 5 | 16/21 → 14/21 | −0.095 | | Opus 5 → Opus 5.5 | 14/21 → 19/21 | +0.238 | | GPT-5.6 → Astra | 18/21 → 16/21 | −0.095 | 表 4:模型系列内部的视觉排名任务退化情况,共 21 个任务,要求在一个集合上求极值,其指令同时携带目标图像\.Opus 4.7 → Opus 5 和 GPT-5.6 → Astra 在此处各净损失两个任务,且两者下降都无法与噪声区分;Opus 5 → Opus 5.5 则提升五个\. 均值近乎为零的变化可能掩盖大量任务结果翻转(图 3)\.Opus 4.7 到 Opus 5 使均值变动 −1.1pp,从 0.661 降至 0.650,落在 ±3pp 区间内,McNemar 精确 **p** 为 0.868;但 36 个回合的结果发生了变化,17 个获得、19 个丢失,变化的符号在网站间反转(分类信息 −0.062、reddit −0.114、购物 +0.071),21 个任务类别中有 11 个变差\.GPT-5.6 到 Astra 使均值从 0.706 升至 0.785(+0.079),20 个回合获得、6 个丢失,**p** = 0.009,21 个类别中有 2 个变差\.Opus 5 到 Opus 5.5 使均值从 0.650 升至 0.701(+0.051,**p** = 0.150),没有类别变差,但仍在获得 20 个任务的同时丢失了 Opus 5 的 11 个任务\. 有一个任务类别在 Opus 4.7 → Opus 5 和 GPT-5.6 → Astra 两次更新中都出现了退化:视觉排名,这是我们构建的一个类别(表 4)\.Opus 5.5 随后将其恢复,从 21 个中的 14 个提升到 19 个\.一个任务算作排名任务,是指它要求从一个集合中选出最佳项(最便宜的、最新的或最大的),而不是直接指定某个物品;我们通过手写词表匹配这些任务,而视觉排名任务是指其指令同时携带目标图像的任务\.分类信息中 72.9% 是排名任务,reddit 仅为 4.5%\.排名任务无法通过定位单个物品来解决,因为所有候选者都必须被比较\.例如,当被要求在"Video gaming"(电子游戏)类目中找出最昂贵的物品(衬衫上的人物与其贴纸上的角色对应)时,Astra 在其构建错误的候选集合上做出了正确的排序,返回了一个价值 3,200 美元的街机柜,其贴纸被它误读为 Pac-Man\.视觉排名退化与任务构成和样本量混杂在一起,因为按照基准作者的标签,分类信息也是最困难的网站,而且在这些定义下只有 21 个视觉排名任务可用\. **图 4:Astra 在 visualwebarena.179 上的表现——该扫描中唯一一个其他所有模型都能解决的任务\.它在其构建错误的候选集合上做出了正确的排序,将街机柜的贴纸误读为 Pac-Man\.** ## 同样的不均衡也出现在四个物理领域 | 领域 | 参照 | Astra | Δ [95% CI] | Opus 5.5 | Δ [95% CI] | | --- | --- | --- | --- | --- | --- | | VisualWebArena | 0.706 | 0.785 | +0.079 [+0.023, +0.136] | — | — | | VLABench | 0.740 | 0.925 | +0.185 [+0.151, +0.251] | 0.886 | +0.146 [+0.106, +0.201] | | Assembly101 | 0.110 | 0.246 | +0.137 [+0.101, +0.172] | 0.148 | +0.038 [+0.002, +0.072] | | IndEgo | 0.377 | 0.587 | +0.210 [+0.153, +0.268] | 0.450 | +0.073 [+0.014, +0.130] | | Bench2Drive-VL | 0.637 | 0.740 | +0.103 [+0.071, +0.139] | 0.718 | +0.080 [+0.049, +0.114] | 表 5:Astra 和 Opus 5.5 在各领域与其参照模型的对比,逐条目配对,含聚类层面的 95% 区间\.每个领域使用不同的指标\

相似文章

Astra相关误导性基准报告的普遍问题

Reddit r/singularity

OpenAI对Astra在ARC-AGI-3上的基准报告具有误导性,因为它使用了不同的测试环境,并且在标准条件下,性能差距没有那么显著。