@himanshustwts: 我试图理解TB-science的任务设计哲学。他们明确拒绝了诸如 - 教科书微分…

X AI KOLs Timeline 新闻

摘要

Terminal-Bench-Science 是一个新基准,版本0.1.0,用于评估AI代理在科学研究工作流上的表现,由斯坦福社区主导开发。

我试图理解TB-science的任务设计哲学。他们明确拒绝了诸如以下任务: - 教科书微分方程 - 通用CSV清洗 - 标准本科级别机器学习练习 - 文献综述 - 通过查找一个晦涩事实即可解决的任务(有趣) 非常有意义的工作,有趣的是这是0.1.0版本发布,所以我对未来的发展非常期待。
查看原文
查看缓存全文

缓存时间: 2026/08/27 23:41

我试图理解 TB-science 的任务设计哲学。他们明确排除了以下类型的任务:

  • 教科书式微分方程
  • 通用CSV数据清洗
  • 本科水平的机器学习习题
  • 文献摘要
  • 仅需查阅一个冷门事实即可完成的任务(这点很有趣)

这是非常有意义的工作,而且有趣的是这仅是0.1.0版本发布,因此我对它的未来发展感到非常兴奋。

Steven Dillmann (@StevenDillmann):
我们发布 Terminal-Bench-Science:一个用于评估AI智能体在多学科领域研究工作流程表现的评测基准。

这是一项由斯坦福大学主导的持续社区项目,由 Terminal-Bench 团队与研究机构的科学领域专家共同构建。

相似文章

介绍 LifeSciBench

OpenAI Blog

OpenAI 推出 LifeSciBench,这是一个包含 750 个专家编写任务的基准测试,用于评估 AI 系统在现实生命科学研究工作流中的表现,包括证据处理、分析和科学推理。