EdgeBench:揭示从真实世界环境中学习的缩放定律
摘要
EdgeBench分析了跨越134个任务的38000小时真实世界智能体交互,揭示了性能的对数S形缩放定律以及指数级学习速度提升。该论文引入了一个基准测试套件,用于研究智能体如何从真实世界经验中学习。
查看缓存全文
缓存时间: 2026/07/07 06:42
论文页面 - EdgeBench:揭示从真实环境学习的缩放定律
来源:https://huggingface.co/papers/2607.05155 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
对 38,000 小时的真实智能体交互进行分析,揭示了在 134 个多样化任务中,性能呈对数-西格玛缩放定律,学习速度呈指数级提升。
预训练缩放定律 (https://huggingface.co/papers?q=scaling%20laws) 揭示了模型能力随数据和计算量可预测地提升。但部署后从真实世界环境中学习的过程仍然远未被理解。通过对约 38,000 小时的智能体与环境交互 (https://huggingface.co/papers?q=agent%20interaction) 数据进行分析,涵盖 134 个真实世界任务 (https://huggingface.co/papers?q=real%20world%20tasks),我们首次发现(据我们所知),在环境学习 (https://huggingface.co/papers?q=environment%20learning) 过程中,整体性能遵循对数-西格玛缩放定律 (https://huggingface.co/papers?q=log-sigmoid%20scaling%20law),且精度极高,R² 达到 0.998。跨模型代际,我们还发现智能体的学习速度大约每三个月翻一番。这一发现源于 EdgeBench (https://huggingface.co/papers?q=EdgeBench),一个包含 134 个真实世界任务 (https://huggingface.co/papers?q=real%20world%20tasks) 的基准套件,这些任务具有超长时域,涵盖科学发现、软件工程、组合优化、专业知识工作、形式数学和交互式游戏。每个任务在丰富、多层次的反馈 (https://huggingface.co/papers?q=multilevel%20feedback) 下至少支持 12 小时的持续智能体运行,并由大量专家付出构建。我们公开发布了 51 个任务和完整的评估框架,以加速对智能体如何从真实世界经验中学习的研究。
查看 arXiv 页面 (https://arxiv.org/abs/2607.05155) 查看 PDF (https://arxiv.org/pdf/2607.05155) 项目页面 (https://edge-bench.org/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05155)
在你的智能体中获取此论文:
hf papers read 2607.05155
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.05155 以从此页面链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.05155 以从此页面链接。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.05155 以从此页面链接。
包含此论文的收藏 0
没有包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
EdgeBench揭示新缩放定律:即时AI学习速度每三个月翻一番
EdgeBench揭示了一条新缩放定律,表明即时AI学习速度每三个月翻一番。
@xiaogaifun: https://x.com/xiaogaifun/status/2073771786202939572
字节Seed团队发布了EdgeBench基准测试,允许AI模型连续工作12-72小时来评估长程任务中的学习能力,发现模型从环境学习的时间和性能之间遵循log-sigmoid曲线,存在新的Scaling Law。
SkillLearnBench:面向真实任务代理技能生成的持续学习方法基准
SkillLearnBench 推出首个评估 LLM 代理持续技能学习的基准,覆盖 20 项真实任务,结果显示尚无方法全面领先,单纯扩大模型规模也无法保证技能提升。
@rohanpaul_ai: ByteDance Seed 再次发力。他们发布了 EdgeBench,用于测试AI代理能否通过经验提升,使用…
字节跳动 Seed 发布了 EdgeBench,这是一个基准测试,用于测试AI代理能否通过执行超过12小时的现实世界任务来从经验中提升,将评估从静态知识转向动态学习。
EnterpriseClawBench:基于真实工作会话的智能体基准测试
EnterpriseClawBench 提出了一个基于真实工作场景的企业智能体基准,包含 852 个可复现任务以及超越单一性能分数的综合评估指标。