scientific-workflows

标签

Cards List
#scientific-workflows

FrontierChallenge:评估科学工作流完成度

Hugging Face Daily Papers ↗ · 2026-08-25 缓存

FrontierChallenge是一个用于评估端到端科学工作流的跨域基准,揭示了尽管部分得分很高,前沿AI模型仅完成20%,强调了需要更好地评估完整任务交付。

0 人收藏 0 人点赞
#scientific-workflows

展示 HN:Rex,一个用于科学工作流的并行函数式语言

Hacker News Top ↗ · 2026-08-17 缓存

Rex 是一个静态类型、纯函数式的工作流语言,专为科学计算和数据处理设计,支持并行执行、内容寻址存储和 Docker 隔离。

0 人收藏 0 人点赞
#scientific-workflows

AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification

arXiv cs.CL ↗ · 2026-07-31 缓存

This paper introduces AutoSupervision, a benchmark and method for verifying whether manuscript revisions actually address reviewer concerns using grounded evidence from peer-review records. Experiments on 56,000 Nature Communications articles show LLMs can summarize reviewer concerns but still struggle with evidence-based verification.

0 人收藏 0 人点赞
#scientific-workflows

AI编程代理可复现社会科学发现

arXiv cs.CL ↗ · 2026-06-11 缓存

本文介绍了SocSci-Repro-Bench,这是一个包含221个任务的基准测试,用于评估AI编程代理从原始数据和代码中复现社会科学发现的能力。研究发现,像Claude Code和Codex这样的前沿代理可以复现大部分结果,其中Claude明显优于Codex,并且结果并非主要由记忆驱动。

0 人收藏 0 人点赞
#scientific-workflows

科学领域的代理型AI实验

arXiv cs.AI ↗ · 2026-05-27 缓存

本文介绍了两个代理型AI框架:DeepTS/DeepCollector和DeepScribe,它们利用混合本地-云端架构和大语言模型,自动化科学工作流程,包括时间序列数据整理以及将物理讲座转化为结构化报告。

0 人收藏 0 人点赞
#scientific-workflows

AgentCo-op: 基于检索的可互操作多智能体工作流合成框架

arXiv cs.AI ↗ · 2026-05-22 缓存

AgentCo-op 是一个基于检索的合成框架,用于从可复用的技能、工具和外部智能体组合可互操作的多智能体工作流。它使用类型化工件传递和有界自引导局部修复,在多个基准测试上取得了优异结果,并能在开放世界的基因组学任务中实现协作发现。

0 人收藏 0 人点赞
#scientific-workflows

不是语言模型,而是工具:面向科学工作流的确定性中介

arXiv cs.AI ↗ · 2026-05-14 缓存

本文提出了类型化中介(typed mediation),即语言模型编排确定性工具而非生成分析代码,从而确保多次再生输出一致。在光致发光分析上的评估表明,该模式在多次运行中实现了完美的可重复性,而商业基础模型则无法做到。该模式已成功部署于实际仪器中。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈