OpenDiscoveryTrace: 用于评估AI科学家工作流的过程追踪
摘要
OpenDiscoveryTrace 是一个公开数据集,包含558条AI科学代理轨迹,不仅捕捉输出,还捕捉推理过程,以便在多个模型和领域间对科学方法进行审计和评估。
arXiv:2609.09203v1 Announce Type: new
Abstract: 现有的自主AI科学家基准测试仅评估最终输出——生成的代码、假设或论文——却丢弃了获得这些输出的推理过程。这使得审计科学方法、诊断失败模式或区分系统性推理与幸运猜测变得不可能。我们推出 \textbf{OpenDiscoveryTrace},一个包含558条完整AI科学代理轨迹的公开数据集,捕捉模型如何推理,而不仅仅是它们产生了什么。每个轨迹记录了结构化的每步9字段追踪——包括思考、工具调用、观察、错误、修订触发和自我报告的置信度——当模型执行124项涵盖药物发现、材料科学、基因组学和科学文献分析的科学任务时。数据集覆盖七个模型:三个前沿模型(GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro;每个模型124条轨迹,完全平衡在领域和难度级别上)和四个开源模型(Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini 和 Qwen2.5-1.5B;每个30条),加上60条实时检索变体轨迹。对363条LLM判断的轨迹进行初步分析显示,过程追踪暴露了仅输出评估不可见的行为差异:所有三个前沿模型都达到了可比的成功率(84-89%),但Claude Opus 4.6产生的错误是GPT-5.4的30倍(每轨迹2.5 vs. 0.08,$p < 0.0001$,Cliff's $\delta = 0.613$),且错误特征有质的不同——Claude的66.7%是工具误用,而GPT-5.4的83.6%是推理错误。我们定义了五项基准任务,基线来自逻辑回归、随机森林、LSTM和Transformer模型。数据集、追踪模式、代理框架和基准定义在CC BY 4.0下公开可用,以支持过程级评估、科学代理审计和AI治理的研究。
查看缓存全文
缓存时间: 2026/09/11 08:35
# OpenDiscoveryTrace:用于评估AI科学家工作流的过程追踪数据集
来源:https://arxiv.org/html/2609.09203
###### 摘要
现有的自主AI科学家基准测试仅评估最终输出——生成的代码、假设或论文——却丢弃了获得这些输出的推理过程。这导致无法审查科学方法、诊断失败模式,或区分系统性推理与幸运猜测。我们推出OpenDiscoveryTrace,这是一个包含558条完整AI科学智能体轨迹的公共数据集,它捕获了模型*如何*推理,而不仅仅是产出什么。每条轨迹记录了模型执行124项跨越药物发现、材料科学、基因组学和科学文献分析的科学任务时,每一步结构化的9个字段——包括思考、工具调用、观察、错误、修正触发因素和自我报告的信心度。该数据集覆盖七种模型:三种前沿模型(GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro;每种124条轨迹,在领域和难度上完全平衡)和四种开放权重模型(Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini、Qwen2.5-1.5B;每种30条),以及60条实时检索变体轨迹。对363条由LLM评判的轨迹进行的初步分析表明,过程追踪揭示了仅评估输出时无法发现的行为差异:所有三种前沿模型的成功率相当(84–89%),但Claude Opus 4.6产生的错误是GPT-5.4的30倍(每条轨迹2.5 vs. 0.08,p < 0.0001,Cliff's δ = 0.613),且错误类型不同——Claude的错误66.7%是工具误用,而GPT-5.4的错误83.6%是推理错误。我们定义了五项基准任务,并提供了基于逻辑回归、随机森林、LSTM和Transformer模型的基线。数据集、追踪模式、智能体框架和基准定义均在CC-BY-4.0许可下公开,以支持过程级评估、科学智能体审计和AI治理的研究。
###### 关键词:
AI用于科学,数据集,科学智能体,过程评估
\\icml@noticeprintedtrue††footnotetext:通讯地址:\\icmlcorrespondingauthor@text。ICML 2026 AI用于科学研讨会。最佳数据集奖。
## 1科学瓶颈
AI系统现已能大规模进行科学研究(Jumper et al., 2021 (https://arxiv.org/html/2609.09203#bib.bib15); Merchant et al., 2023 (https://arxiv.org/html/2609.09203#bib.bib14); Szymanski et al., 2023 (https://arxiv.org/html/2609.09203#bib.bib13)),基于LLM的智能体正在编排完整的研究流程(Lu et al., 2024 (https://arxiv.org/html/2609.09203#bib.bib3); Boiko et al., 2023 (https://arxiv.org/html/2609.09203#bib.bib12))。用于评估这些系统的基准测试已经出现(Chen et al., 2025 (https://arxiv.org/html/2609.09203#bib.bib1); Majumder et al., 2024 (https://arxiv.org/html/2609.09203#bib.bib2); Starace et al., 2025 (https://arxiv.org/html/2609.09203#bib.bib4); Huang et al., 2024 (https://arxiv.org/html/2609.09203#bib.bib7)),但每一个都仅评估*最终输出*——生成的代码、假设或评分标准。推理过程被丢弃了。
这带来了三个问题。首先,仅评估输出将推理质量与结果运气混为一谈。其次,治理需要完整的决策追踪来进行审计(Kapoor and Narayanan, 2023 (https://arxiv.org/html/2609.09203#bib.bib25); Hung and Yen, 2024 (https://arxiv.org/html/2609.09203#bib.bib19); Tom et al., 2024 (https://arxiv.org/html/2609.09203#bib.bib18))。第三,改进智能体需要理解失败模式,而失败模式是轨迹属性,而非输出属性。OpenDiscoveryTrace通过提供首个结构化的AI科学过程追踪公共数据集来填补这一空白。
## 2提议的数据集
OpenDiscoveryTrace包含来自7个模型的558条轨迹:372条来自三种前沿模型(GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro;每种124条,在4个领域×3个难度级别上平衡),120条来自开放权重模型的单次响应轨迹(Qwen2.5-7B、Mistral-7B、Phi-3.5-mini、Qwen2.5-1.5B;每种30条),6条*工具辅助*的开放权重轨迹(Qwen2.5-7B在A100上运行完整多步骤框架;平均10.3步,1.7次工具调用),以及60条实时检索变体。工具辅助的Qwen轨迹使得在相同条件下直接比较开放权重与前沿模型成为可能(附录K (https://arxiv.org/html/2609.09203#A11))。
每一步记录了扩展自ReAct(Yao et al., 2023 (https://arxiv.org/html/2609.09203#bib.bib9))的9个字段:阶段、思考、行动(工具/输入/输出)、观察、错误、修正触发因素、信心度、步骤ID、时间戳。定义了五项基准任务:结果预测、错误定位、主张验证、自主性分类和过程质量评分。完整模式见附录A (https://arxiv.org/html/2609.09203#A1)。
参见标题图1:OpenDiscoveryTrace:7个模型通过六阶段工作流执行任务。每一步都是一个9字段追踪。这558条轨迹构成了AI科学过程追踪的语料库。为何过程追踪重要。对363条前沿轨迹的LLM评判评估显示,所有三种模型都达到了相当的成功率(GPT-5.4:88.6%,Gemini:89.3%,Claude:83.9%),但Claude Opus 4.6产生的错误是GPT-5.4的30倍(2.5 vs. 0.08;H=122,p < 10^{-4};Cliff's δ = 0.613)。这些错误在性质上有所不同:Claude的错误66.7%是工具误用;GPT-5.4的错误83.6%是推理错误。这一发现在匹配任务比较的所有四个领域中都很稳健(附录F (https://arxiv.org/html/2609.09203#A6))。在结果预测上,LSTM和Transformer基线未能超越多数基线(AUROC ≤ 0.42),证实该任务非平凡(附录H (https://arxiv.org/html/2609.09203#A8))。仅评估输出的基准完全遗漏了过程级差异。
## 3获取路线图
阶段1(当前)。覆盖7个模型(3个前沿+4个开放权重)的558条轨迹,124项任务,4个领域,外加60条实时检索变体和6条工具辅助的开放权重轨迹。总成本:约$340(API + GPU)。所有基础设施——模式、框架、分析流程和五项基准任务——均已投入运行并经过测试。
阶段2(第1-2个月)。完成所有设计好的200项任务,涵盖所有7个现有模型,外加2个额外的开放权重模型(Llama 3.1-8B、Gemma-2-9B)。目标:跨9个模型的1800+条轨迹,实现大规模的稳健跨架构比较,并为分领域和分难度分析提供足够的统计功效。
阶段3(第2-3个月)。对120条分层抽样轨迹进行人类专家标注。三名领域专家独立对五个轴进行评分:正确性、推理质量、工具使用效率、自主性级别(L1–L4)和错误步骤定位。目标:Krippendorff’s α ≥ 0.67。一个基于LLM的标注试点已经在各轴上达到α=0.63–0.82(附录I (https://arxiv.org/html/2609.09203#A9)),表明人类一致性是可以达到的。
阶段4(第3-6个月)。通过PubMed和PubChem API将实时检索集成到所有文献领域任务(已包含一个30项任务的试点)。集成电子实验笔记本(ELN)试点,用于物理实验室追踪捕获(Dirnagl and Bhatt, 2016 (https://arxiv.org/html/2609.09203#bib.bib20); Abolhasani and Kumacheva, 2023 (https://arxiv.org/html/2609.09203#bib.bib24)),将数据集从纯计算扩展到混合计算-物理环境。
可持续性。采用语义化版本控制模式(v1.0 = 当前发布版)。数据集托管在Hugging Face Hub,框架和分析代码托管在GitHub(附录N (https://arxiv.org/html/2609.09203#A14))。开源框架允许社区贡献轨迹。年度刷新周期,在新前沿和开放权重模型可用时将其纳入。
## 4元数据、治理与安全
许可证:CC-BY-4.0。格式:每条轨迹为独立JSON,包含每步和聚合元数据。数据表遵循Gebru et al. (2021) (https://arxiv.org/html/2609.09203#bib.bib21)规范。发布层级:(1) 在提供商服务条款允许时发布完整追踪;(2) 抽象摘要(阶段转换、工具调用、错误——不含逐字推理),保留>90%的分析效用。隐私:无个人身份信息(PII);仅包含公共科学知识。划分:80/20训练/测试集,分层,无泄露(Kapoor and Narayanan, 2023 (https://arxiv.org/html/2609.09203#bib.bib25))。评估遵循HELM框架(Liang et al., 2023 (https://arxiv.org/html/2609.09203#bib.bib22))。
## 5加速潜力
OpenDiscoveryTrace实现了六项新能力:(1) *过程感知评估*,区分推理与运气(Wang et al., 2023 (https://arxiv.org/html/2609.09203#bib.bib23); Gil et al., 2014 (https://arxiv.org/html/2609.09203#bib.bib26));(2) *早期失败干预*——68.1%的首次错误出现在第0步,表明监控初始工具调用可能预防大多数失败;(3) *针对错误类型的改进*——Claude需要更好的工具使用训练,GPT-5.4需要修复推理层面问题;(4) *过程感知奖励建模*用于强化学习,奖励方法论而非仅仅结果;(5) *可信审计*通过完整的决策追踪实现治理(King et al., 2009 (https://arxiv.org/html/2609.09203#bib.bib16); Kitano, 2021 (https://arxiv.org/html/2609.09203#bib.bib17));(6) *可复现的开放权重基准测试*——来自4个模型的120条轨迹,无需API密钥。
## 参考文献
- Abolhasani and Kumacheva (2023) M. Abolhasani and E. Kumacheva. The rise of self-driving labs in chemical and materials sciences. *Nature Synthesis* 2(6), pp. 483–492. 外部链接:文档 (https://dx.doi.org/10.1038/s44160-022-00231-0) 引用于:§3 (https://arxiv.org/html/2609.09203#S3.p4.1)。
- Boiko et al. (2023) D. A. Boiko, R. MacKnight, B. Kline, and G. Gomes. Autonomous chemical research with large language models. *Nature* 624(7992), pp. 570–578. 外部链接:文档 (https://dx.doi.org/10.1038/s41586-023-06792-0) 引用于:§1 (https://arxiv.org/html/2609.09203#S1.p1.1)。
- Chan et al. (2025) J. S. Chan, N. Chowdhury, O. Jaffe, J. Aung, D. Sherburn, E. Mays, G. Starace, K. Liu, L. Maksin, T. Patwardhan, L. Weng, and A. Madry. MLE-bench: evaluating machine learning agents on machine learning engineering. In *International Conference on Learning Representations (ICLR)*, 注:arXiv:2410.07095 引用于:表1 (https://arxiv.org/html/2609.09203#A2.T1.6.10.1.1)。
- Chen et al. (2025) Z. Chen, S. Chen, Y. Ning, Q. Zhang, B. Wang, B. Yu, Y. Li, Z. Liao, C. Wei, Z. Lu, V. Dey, M. Xue, F. N. Baker, B. Burns, D. Adu-Ampratwum, X. Huang, X. Ning, S. Gao, Y. Su, and H. Sun. ScienceAgentBench: toward rigorous assessment of language agents for data-driven scientific discovery. In *International Conference on Learning Representations (ICLR)*, 注:arXiv:2410.05080 引用于:表1 (https://arxiv.org/html/2609.09203#A2.T1.6.3.1.1), §1 (https://arxiv.org/html/2609.09203#S1.p1.1)。
- Dirnagl and Bhatt (2016) U. Dirnagl and D. Bhatt. Electronic lab notebooks: forget about putting pen to paper – it’s time to go digital. *Nature* 537(7618), pp. 168–169. 外部链接:文档 (https://dx.doi.org/10.1038/nj7618-168a) 引用于:§3 (https://arxiv.org/html/2609.09203#S3.p4.1)。
- Gebru et al. (2021) T. Gebru, J. Morgenstern, B. Vecchione, J. W. Vaughan, H. Wallach, H. Daumé III, and K. Crawford. Datasheets for datasets. *Communications of the ACM* 64(12), pp. 86–92. 外部链接:文档 (https://dx.doi.org/10.1145/3458723) 引用于:§4 (https://arxiv.org/html/2609.09203#S4.p1.1)。
- Gil et al. (2014) Y. Gil, M. Greaves, J. Hendler, and H. Hirsh. Amplify scientific discovery with artificial intelligence. *Science* 346(6206), pp. 171–172. 外部链接:文档 (https://dx.doi.org/10.1126/science.1259439) 引用于:§5 (https://arxiv.org/html/2609.09203#S5.p1.1)。
- Huang et al. (2024) Q. Huang, J. Vora, P. Liang, and J. Leskovec. MLAgentBench: evaluating language agents on machine learning experimentation. *arXiv preprint* arXiv:2310.03302. 引用于:表1 (https://arxiv.org/html/2609.09203#A2.T1.6.9.1.1), §1 (https://arxiv.org/html/2609.09203#S1.p1.1)。
- Hung and Yen (2024) Y. Hung and C. Yen. Levels of AI agents: from rules to large language models. *arXiv preprint* arXiv:2405.06643. 引用于:§1 (https://arxiv.org/html/2609.09203#S1.p2.1)。
- Jumper et al. (2021) J. Jumper, R. Evans, A. Pritzel, T. Green, M. Figurnov, O. Ronneberger, K. Tunyasuvunakool, R. Bates, A. Žídek, A. Potapenko, et al. Highly accurate protein structure prediction with AlphaFold. *Nature* 596(7873), pp. 583–589. 外部链接:文档 (https://dx.doi.org/10.1038/s41586-021-03819-2) 引用于:§1 (https://arxiv.org/html/2609.09203#S1.p1.1)。
- Kapoor and Narayanan (2023) S. Kapoor and A. Narayanan. Leakage and the reproducibility crisis in machine-learning-based science. *Patterns* 4(9), pp. 100804. 外部链接:文档 (https://dx.doi.org/10.1016/j.patter.2023.100804) 引用于:§1 (https://arxiv.org/html/2609.09203#S1.p2.1), §4 (https://arxiv.org/html/2609.09203#S4.p1.1)。
- King et al. (2009) R. D. King, J. Rowland, S. G. Oliver, M. Young, W. Aubrey, E. Byrne, M. Liakata, M. Markham, P. Pir, L. N. Soldatova, A. Sparkes, K. E. Whelan, and A. Clare. The automation of science. *Science* 324(5923), pp. 85–89. 外部链接:文档 (https://dx.doi.org/10.1126/science.1165620) 引用于:§5 (https://arxiv.org/html/2609.09203#S5.p1.1)。
- Kitano (2021) H. Kitano. Nobel turing challenge: creating the engine for scientific discovery. *npj Systems Biology and Applications* 7(1), pp. 29. 外部链接:文档 (https://dx.doi.org/10.1038/s41540-021-00189-3) 引用于:§5 (https://arxiv.org/html/2609.09203#S5.p1.1)。
- Liang et al. (2023) P. Liang, R. Bommasani, T. Lee, D. Tsipras, D. Soylu, M. Yasunaga, Y. Zhang, D. Narayanan, Y. Wu, A. Kumar, B. Newman, B. Yuan, B. Yan, C. Zhang, C. Cosgrove, C. D. Manning, C. Ré, D. Acosta-Navas, D. A. Hudson, E. Zelikman, E. Durmus, F. Ladhak, F. Rong, H. Ren, H. Yao, J. Wang, K. Santhanam, L. J. Orber, M. Hallman, et al. Holistic evaluation of language models. *Transactions on Machine Learning Research*. 引用于:§4 (https://arxiv.org/html/2609.09203#S4.p1.1)。
- Liu et al. (2024) X. Liu, H. Yu, H. Zhang, Y. Xu, X. Lei, H. Lai, Y. Gu, H. Ding, K. Men, K. Yang, S. Zhang, X. Deng, A. Zeng, Z. Du, C. Zhang, S. Shen, T. Zhang, Y. Su, H. Sun, M. Huang, Y. Dong, and J. Tang. AgentBench: evaluating LLMs as agents. *arXiv preprint* arXiv:2308.03688. 引用于:表1 (https://arxiv.org/html/2609.09203#A2.T1.6.12.1.1)。
- Liu et al. (2025) Y. Liu, Z. Yang, T. Xie, J. Ni, B. Gao, Y. Li, S. Tang, W. Ouyang, E. Cambria, and D. Zhou. ResearchBench: benchmarking LLMs in scientific discovery via inspiration-based task decomposition. *arXiv preprint* arXiv:2503.21248. 引用于:表1 (https://arxiv.org/html/2609.09203#A2.T1.6.7.1.1)。
- Lu et al. (2024) C. Lu, C. Lu, R. T. Lange, J. Foerster, J. Clune, and D. Ha. The AI scientist: towards fully automated open-ended scientific discovery. *arXiv preprint* arXiv:2408.06292. 引用于:表1 (https://arxiv.org/html/2609.09203#A2.T1.6.5.1.1), §1 (https://arxiv.org/html/2609.09203#S1.p1.1)。
- Majumder et al. (2024) B. P. Majumder, H. Surana, D. Agarwal, B. D. Mishra, A. Meena, A. Prakhar, T. Vora, T. Khot, A. Sabharwal, and P. Clark. DiscoveryBench: towards data-driven discovery with large language models. *arXiv preprint* arXiv:2407.01725. 引用于:表1 (https://arxiv.org/html/2609.09203#A2.T1.6.4.1.1), §1 (https://arxiv.org/html/2609.09203#S1.p1.1)。
- Merchant et al. (2023) A. Merchant, S. Batzner, S. S. Schoenholz, M. Aykol, G. Cheon, and E. Cubuk. Scaling deep learning for materials discovery. *Nature* 624(7990), pp. 80–85. 外部链接:文档 (https://dx.doi.org/10.1038/s41586-023-06735-9) 引用于:§1 (https://arxiv.org/html/2609.09203#S1.p1.1)。
- Szymanski et al. (2023) N. J. Szymanski, B. Bernardus, T. Cook, A. Bajaj, and C. J. C. C. Gomes. Toward self-driving automated laboratories for synthesis of new materials. *ACS Central Science* 9(9), pp. 1804–1807. 外部链接:文档 (https://dx.doi.org/10.1021/acscentsci.3c00725) 引用于:§1 (https://arxiv.org/html/2609.09203#S1.p1.1)。
- Tom et al. (2024) J. Tom, A. W. Harley, G. Bertasius, and D. Tran. On the difficulty of benchmarking large language models in scientific discovery. *arXiv preprint* arXiv:2405.07596. 引用于:§1 (https://arxiv.org/html/2609.09203#S1.p2.1)。
- Wang et al. (2023) S. Wang, M. Wang, J. Zhang, H. Wang, and L. Zhang. ProcessBench: A benchmark for process evaluation of LLMs. *arXiv preprint* arXiv:2310.07553. 引用于:§5 (https://arxiv.org/html/2609.09203#S5.p1.1)。
- Yao et al. (2023) S. Yao, J. Zhao, D. Yu, N. Du, I. Shafran, K. Narasimhan, and Y. Cao. ReAct: Synergizing reasoning and acting in language models. In *International Conference on Learning Representations (ICLR)*, 注:arXiv:2210.03629 引用于:§2 (https://arxiv.org/html/2609.09203#S2.p1.1)。相似文章
IdeaTrail:科学构思的全过程智能体轨迹
IdeaTrail是一个多轮过程轨迹数据集,用于科学构思,通过Generator--Advisor循环从证据收集到提案构建合成研究过程,以确保依据充分。
Traccia.ai - 可观测性扩展
Traccia AI 发布了一个与框架无关的平台,用于AI代理的可观测性和治理,解决多代理生态系统中的遥测数据碎片化问题,以支持企业AI的采用。
@JiaZhihao: 推出 Motus Tracing:AI 代理的开源可观测性。没有追踪,代理就是消耗 token 的黑盒……
Motus Tracing 是一个完全开源的可观测层,专为 AI 代理设计,能够捕获每一次模型调用、工具调用、沙箱交互和错误,提供统一的跨度模型,支持本地开发和云部署,零设置成本。
通过执行轨迹解释AI代理
本文介绍了一个事后可解释AI框架,该框架将AI代理执行轨迹转换为结构化报告和自然语言解释,以实现透明度和可审计性。
Tracea
Tracea 是一款新产品,为AI代理提供类似Datadog的可观测性,具备追踪、根本原因分析和团队记忆等功能。