@xiaogaifun: https://x.com/xiaogaifun/status/2073771786202939572

X AI KOLs Timeline 论文

摘要

字节Seed团队发布了EdgeBench基准测试,允许AI模型连续工作12-72小时来评估长程任务中的学习能力,发现模型从环境学习的时间和性能之间遵循log-sigmoid曲线,存在新的Scaling Law。

https://t.co/O3G9kvX7iy
查看原文
查看缓存全文

缓存时间: 2026/07/06 10:09

没人注意到字节 Seed 的这个研究?很有价值。

刷 X 看到字节 Seed 团队刚刚发了一个 Benchmark,非常有意思,叫 EdgeBench。强烈推荐大家去看看。

目前绝大多数的 Benchmark 都是给模型一个一次性任务,模型输出答案,然后结束。但这种方式,越来越不能真实反映模型的水平和能力了。

毕竟,现在模型都是原生 Agent。Agent 的特点就是可以根据反馈及时调整任务的执行方案。

就像我们做事一样,第一次做错了,看到反馈之后,可以继续优化去做第二次。传统的 Benchmark 根本没办法衡量这种能力。

记得前两天看 OpenAI 研究员 Noam 的采访,他说目前行业里常见的那些 Benchmark 基本上已经过时了。

因为模型有自我纠错能力,让一个模型做一个任务做一分钟,和让它做一个小时,做一天,最后得到的结果完全不一样。

而目前绝大部分的 Benchmark 完全没有考虑到时间的因素。

EdgeBench 这次就把时间纳入了进来。它允许每个模型连续工作 12 到 72 个小时,最后看在这么长时间里的表现变化。

这个新 Benchmark 涵盖了 134 个真实世界中需要长时间工作的任务,包括 Coding、复杂的知识工作、游戏、数学证明等等类别。

作为对比,人类专家在这些任务上面平均要花 57 个小时,根本不是以秒或分钟为单位就能搞定的。

所以传统 Benchmark 无法准确测出类似长程任务的真实效果,EdgeBench 给了 Agent 至少 12 小时的时间去持续工作,然后观察它们随时间推移的表现变化。

同时又建立了一套反馈机制,允许 Agent 不断尝试、不断提交、不断拿到新的评分反馈。这其实有点像最近我们聊到的 Loop Engineering。

他们用 Claude Opus 4.8、GPT-5.5、GPT-5.4、GLM-5.1、DeepSeek-V4-Pro 这五个模型跑了大约 38000 小时的测试,得出了几个挺有意思的发现。我写下我的理解。

发现一:新的 Scaling Law

不管是不同模型还是不同任务类型,把 134 个任务上的学习曲线做平均之后,性能随时间的变化几乎都符合同一条曲线,数学上叫 log-sigmoid 曲线。

为什么要强调平均?因为单看某一个模型在某一个任务上的表现,曲线其实是很杂乱的,可能长时间没有进展,突然跳一下,有时候甚至会倒退。

但 134 个任务的结果叠在一起之后,个别任务的噪声被抹平了,剩下的是一条非常规整的曲线。

这条曲线在 1 到 12 小时的观测窗口里,呈现的主要是一个持续减速的过程,开头几个小时提升最快,模型密集地从环境反馈中获取经验,进步很明显。

随着时间推移,容易拿到的分逐渐拿完,继续投入时间带来的收益越来越小,曲线逐渐变平。

他们对这条曲线做了数学拟合,平均 R² 达到 0.998。R² 的满分是 1,0.998 说明这条理论曲线和实际数据几乎完全重合。

模型从环境中学习这件事,投入的时间和获得的收益之间,在大量任务上呈现出高度一致的关系。

以前我们知道预训练有 Scaling Law,模型规模、数据量、算力投入和性能之间存在可预测的关系,这条规律指导了过去几年大模型的发展路径。

现在 EdgeBench 的结果显示,模型从环境中学习这件事,也有自己的 Scaling Law。

投入的交互时间和获得的性能收益之间,同样遵循一条高度稳定的数学关系。

这是这篇论文最核心的发现。

发现二:可以用图探索理论来解释学习过程

每个任务的最终得分可以拆成很多小的得分单元,分布在一张图上,模型每解锁一个单元,就拿到对应的分值。

模型刚进入任务时,对这张图几乎没有信息,只能随机探索,偶尔解锁一个单元。

但一旦有单元被解锁,它会对周围还没有解锁的邻居施加影响力,推动它们更容易被解锁。

解锁的单元越多,对外施加的总影响力就越大,前沿推进的速度就越快。这就是中段学习加速的来源。

随着探索继续,图上剩余的未解锁单元越来越少,可推进的前沿在缩小,即使影响力还在,能够作用的对象已经不多了,速度自然降下来。

从整体来看,学习过程就是在一张任务图上不断向外扩展已解锁的区域。前期主要是找到入口,中期靠影响力的累积快速扩张,后期接近边界,增长放缓。

这种结构自然导向一条先慢后快再变慢的学习曲线,也就是发现一里提到的 log-sigmoid 形态。

发现三:AI 从环境学习的速度在加快

他们做了一个跨模型的对比:选取 2025 年 9 月到 2026 年 5 月陆续发布的多个前沿模型,放到同一套长任务环境里,控制住时间变量,统一只观察前两个小时的表现变化,看谁在相同时间窗口里从环境中学到的东西更多。

结果显示,这个学习速度在持续增长,大致每三个月翻一番。也就是说,在同样的时间窗口里,模型从环境反馈中提取有效经验的效率。

如果这个趋势持续下去,意味着未来的 Agent 在短时间内就可以完成今天需要好几个小时才能积累的学习过程。

发现四:长时间任务中的重构时刻

论文中挑了一个引力波信号重建的任务做详细追踪。

这个任务要求 Agent 从原始的 LIGO 观测数据出发,重现经典引力波论文中的分析结果,需要输出波形、频谱图、天体运动曲线三类内容,是一个多模块的科学分析任务。

他们让 GPT-5.5 的 Agent 在这个任务上连续跑了 12 小时,总共记录了 247 次带评分的尝试,最终得分从 42.8 提升到 67.0。

这个过程并不是均匀推进的。论文标出了 7 个关键节点,每个节点代表 Agent 对任务的理解发生了一次明显的跃迁。

前期 Agent 做的第一件事是让整个任务变得可评估。

原始任务是开放的,它需要先搭出一条能跑通的完整分析流程,拿到反馈分数,才有后续优化的基础。

中期 Agent 遇到了瓶颈,波形匹配的效果上不去。

这时候它换了个做法,把这个大问题拆开,分成参考信号定位、时频分析、探测器对齐几个子问题分头处理,拆开之后推进速度明显加快。

再往后,分项反馈显示天体动力学部分是最大的短板。

Agent 锁定了这个方向集中攻克,在几个小时内把这个子项的分数从 64 拉到了 89,是整个 12 小时里最大的一次跳升。

到了后期,整体方案已经稳定,Agent 保持核心逻辑不动,只针对剩余的局部错误做修复。

整个过程非常接近人类做复杂项目的方式,推进到一定阶段,发现原来的理解方式走不通了,就重新拆解问题结构,调整策略方向,然后继续往前推。

EdgeBench 可以把这种持续试错加上阶段性重构的完整轨迹记录了下来。

强烈推荐大家去看看字节 Seed 团队这个 Benchmark 和 OpenAI 研究员 Noam 的那期访谈。

链接我放到文末了。我们确实越来越需要一种新的评估方式,能够在真实的、有反馈的任务场景中,衡量模型随着时间推移的学习表现。

  • https://github.com/ByteDance-Seed/EdgeBench

  • https://www.youtube.com/watch?v=AZrU6y3pUcU&t=1s

相似文章

EdgeBench:揭示从真实世界环境中学习的缩放定律

Hugging Face Daily Papers

EdgeBench分析了跨越134个任务的38000小时真实世界智能体交互,揭示了性能的对数S形缩放定律以及指数级学习速度提升。该论文引入了一个基准测试套件,用于研究智能体如何从真实世界经验中学习。

@0xcherry: https://x.com/0xcherry/status/2067610347633025281

X AI KOLs Timeline

本文分析智谱GLM-5.2性能飞跃的原因,认为其40B激活参数在扣除固定开销后提供更大有效容量,使RL后训练更有效;同时回顾中国AI模型发展史,指出大模型路线最终获胜。

@MaxForAI: 昨天字节Seed开源了一个非常有意思的checkpoint TaskMem 它基于Qwen3-VL-30B-A3B训练,目标不是直接回答问题,而是让多模态Agent在视频/环境流里学会生成更有用的长期记忆。 重点是让Agent学会在连续视…

X AI KOLs Timeline

字节Seed开源了TaskMem checkpoint,基于Qwen3-VL-30B-A3B训练,通过两阶段强化学习让多模态Agent在视频流中学会生成长期记忆,在VideoMME、EgoLife等基准上获得显著提升。