标签
TraceML 是一个用于对机器学习研究智能体进行轨迹级分析的工具,它将 Codex 智能体的运行过程与 Kaggle Grandmaster 的 notebook 进行对比,发现人类专家会探索更广泛的策略空间,而智能体则容易陷入狭窄的循环。将人类研究技能提炼成约 1,000 token 的规划提示后,Codex 在七项竞赛中有五项的成绩得到提升;该成果将在 NeurIPS 2026 上展示。
Maxime Rivest 分享了使用自定义系统提示优化 Pi 编码代理使用的技巧,Matei Zaharia 讨论了在 Databricks 对编码代理进行基准测试时发现的令人惊讶的结果。
介绍 AgentOdyssey,一个程序化文本游戏生成框架,旨在评估智能体在测试时持续学习的能力,包括探索、情景记忆、世界知识获取、技能学习和长时域规划。该框架突显了当前智能体与人类表现之间的显著差距。
本文介绍了RealUserSim,一个将基于LLM的用户模拟扎根于来自14,000+真实对话的人类行为数据中的框架,旨在弥合智能体基准测试中的现实差距。研究表明,基于真实数据的模拟将行为匹配率从24.2%提升至45.3%,并揭示了协作型模拟器无法发现的失效机制。