标签
FrontierChallenge是一个用于评估端到端科学工作流的跨域基准,揭示了尽管部分得分很高,前沿AI模型仅完成20%,强调了需要更好地评估完整任务交付。
Rex 是一个静态类型、纯函数式的工作流语言,专为科学计算和数据处理设计,支持并行执行、内容寻址存储和 Docker 隔离。
This paper introduces AutoSupervision, a benchmark and method for verifying whether manuscript revisions actually address reviewer concerns using grounded evidence from peer-review records. Experiments on 56,000 Nature Communications articles show LLMs can summarize reviewer concerns but still struggle with evidence-based verification.
本文介绍了SocSci-Repro-Bench,这是一个包含221个任务的基准测试,用于评估AI编程代理从原始数据和代码中复现社会科学发现的能力。研究发现,像Claude Code和Codex这样的前沿代理可以复现大部分结果,其中Claude明显优于Codex,并且结果并非主要由记忆驱动。
本文介绍了两个代理型AI框架:DeepTS/DeepCollector和DeepScribe,它们利用混合本地-云端架构和大语言模型,自动化科学工作流程,包括时间序列数据整理以及将物理讲座转化为结构化报告。
AgentCo-op 是一个基于检索的合成框架,用于从可复用的技能、工具和外部智能体组合可互操作的多智能体工作流。它使用类型化工件传递和有界自引导局部修复,在多个基准测试上取得了优异结果,并能在开放世界的基因组学任务中实现协作发现。
本文提出了类型化中介(typed mediation),即语言模型编排确定性工具而非生成分析代码,从而确保多次再生输出一致。在光致发光分析上的评估表明,该模式在多次运行中实现了完美的可重复性,而商业基础模型则无法做到。该模式已成功部署于实际仪器中。