agent-benchmarking

标签

Cards List
#agent-benchmarking

@MaximeRivest: Pi 编码代理在其价格上通常是最优的。Pi 的系统提示非常简短,只有4个工具。我的 Pi 系统...

X AI KOLs Timeline · 2026-07-09 缓存

Maxime Rivest 分享了使用自定义系统提示优化 Pi 编码代理使用的技巧,Matei Zaharia 讨论了在 Databricks 对编码代理进行基准测试时发现的令人惊讶的结果。

0 人收藏 0 人点赞
#agent-benchmarking

AgentOdyssey:面向测试时持续学习智能体的开放式长时域文本游戏生成

arXiv cs.CL · 2026-06-25 缓存

介绍 AgentOdyssey,一个程序化文本游戏生成框架,旨在评估智能体在测试时持续学习的能力,包括探索、情景记忆、世界知识获取、技能学习和长时域规划。该框架突显了当前智能体与人类表现之间的显著差距。

0 人收藏 0 人点赞
#agent-benchmarking

RealUserSim:通过真实用户模拟弥合智能体基准测试中的现实差距

arXiv cs.AI · 2026-05-22 缓存

本文介绍了RealUserSim,一个将基于LLM的用户模拟扎根于来自14,000+真实对话的人类行为数据中的框架,旨在弥合智能体基准测试中的现实差距。研究表明,基于真实数据的模拟将行为匹配率从24.2%提升至45.3%,并揭示了协作型模拟器无法发现的失效机制。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈