标签
EdgeBench分析了跨越134个任务的38000小时真实世界智能体交互,揭示了性能的对数S形缩放定律以及指数级学习速度提升。该论文引入了一个基准测试套件,用于研究智能体如何从真实世界经验中学习。
字节Seed团队发布了EdgeBench基准测试,允许AI模型连续工作12-72小时来评估长程任务中的学习能力,发现模型从环境学习的时间和性能之间遵循log-sigmoid曲线,存在新的Scaling Law。
字节跳动 Seed 发布了 EdgeBench,这是一个基准测试,用于测试AI代理能否通过执行超过12小时的现实世界任务来从经验中提升,将评估从静态知识转向动态学习。