@himanshustwts: 我试图理解TB-science的任务设计哲学。他们明确拒绝了诸如 - 教科书微分…
摘要
Terminal-Bench-Science 是一个新基准,版本0.1.0,用于评估AI代理在科学研究工作流上的表现,由斯坦福社区主导开发。
查看缓存全文
缓存时间: 2026/08/27 23:41
我试图理解 TB-science 的任务设计哲学。他们明确排除了以下类型的任务:
- 教科书式微分方程
- 通用CSV数据清洗
- 本科水平的机器学习习题
- 文献摘要
- 仅需查阅一个冷门事实即可完成的任务(这点很有趣)
这是非常有意义的工作,而且有趣的是这仅是0.1.0版本发布,因此我对它的未来发展感到非常兴奋。
Steven Dillmann (@StevenDillmann):
我们发布 Terminal-Bench-Science:一个用于评估AI智能体在多学科领域研究工作流程表现的评测基准。这是一项由斯坦福大学主导的持续社区项目,由 Terminal-Bench 团队与研究机构的科学领域专家共同构建。
相似文章
Terminal-Bench-Science: 在科学研究工作流中评估AI智能体
Terminal-Bench-Science是一个由斯坦福大学研究人员开发的基准,用于评估AI智能体在真实科学研究工作流中的表现,旨在推动科学领域AI能力的提升。
介绍 LifeSciBench
OpenAI 推出 LifeSciBench,这是一个包含 750 个专家编写任务的基准测试,用于评估 AI 系统在现实生命科学研究工作流中的表现,包括证据处理、分析和科学推理。
TOBench:面向真实世界工具使用智能体的任务导向全模态基准
TOBench是一个新的基准测试,用于评估AI智能体在真实世界、任务导向的工具使用中的表现,涉及多模态输入和闭环验证。实验表明,像Qwen 3.5 Plus这样的顶级模型仅达到41%的成功率,远低于94%的人类基准,凸显了显著的差距。
在长时间终端任务上测试智能体 (GitHub Repo)
长时域终端基准 (LHTB) 是一个包含46项任务的基准,用于评估LLM智能体在数百步的持续终端工作中的表现。结果显示,即使是最好的模型也只能解决约28%的任务。
TerminalBench 2.1 源自 GPT-5.6 Sol、Terra 和 Luna
TerminalBench 2.1 是一套源自 GPT-5.6 Sol、Terra 和 Luna 模型的基准测试套件,可能用于评估 AI 在终端任务上的性能。