agent-benchmarking

标签

Cards List
#agent-benchmarking

@sunweiwei12: 自动研究智能体与顶尖人类研究员究竟有何不同?尽管人们对自动研究智能体和递归自我改进(RSI)抱有巨大热情,我们仍缺乏清晰的认识……

X AI KOLs Timeline ↗ · 4天前 缓存

TraceML 是一个用于对机器学习研究智能体进行轨迹级分析的工具,它将 Codex 智能体的运行过程与 Kaggle Grandmaster 的 notebook 进行对比,发现人类专家会探索更广泛的策略空间,而智能体则容易陷入狭窄的循环。将人类研究技能提炼成约 1,000 token 的规划提示后,Codex 在七项竞赛中有五项的成绩得到提升;该成果将在 NeurIPS 2026 上展示。

0 人收藏 0 人点赞
#agent-benchmarking

@MaximeRivest: Pi 编码代理在其价格上通常是最优的。Pi 的系统提示非常简短,只有4个工具。我的 Pi 系统...

X AI KOLs Timeline ↗ · 2026-07-09 缓存

Maxime Rivest 分享了使用自定义系统提示优化 Pi 编码代理使用的技巧,Matei Zaharia 讨论了在 Databricks 对编码代理进行基准测试时发现的令人惊讶的结果。

0 人收藏 0 人点赞
#agent-benchmarking

AgentOdyssey:面向测试时持续学习智能体的开放式长时域文本游戏生成

arXiv cs.CL ↗ · 2026-06-25 缓存

介绍 AgentOdyssey,一个程序化文本游戏生成框架,旨在评估智能体在测试时持续学习的能力,包括探索、情景记忆、世界知识获取、技能学习和长时域规划。该框架突显了当前智能体与人类表现之间的显著差距。

0 人收藏 0 人点赞
#agent-benchmarking

RealUserSim:通过真实用户模拟弥合智能体基准测试中的现实差距

arXiv cs.AI ↗ · 2026-05-22 缓存

本文介绍了RealUserSim,一个将基于LLM的用户模拟扎根于来自14,000+真实对话的人类行为数据中的框架,旨在弥合智能体基准测试中的现实差距。研究表明,基于真实数据的模拟将行为匹配率从24.2%提升至45.3%,并揭示了协作型模拟器无法发现的失效机制。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈