OmniScientist: 一个全模态、全学科的人工智能科学家
摘要
OmniScientist 是一个端到端的全模态人工智能科学家,它利用自主代理和全生命周期感知,直接基于异构原始证据开展多学科研究。在36个真实数据案例上的评估显示,它提升了跨多种科学模态的基于证据的发现能力。
查看缓存全文
缓存时间: 2026/08/14 03:26
论文页面 - OmniScientist:一种全模态、全学科 AI 科学家
来源:https://huggingface.co/papers/2608.13558
摘要
OmniScientist 是一种端到端的全模态 AI 科学家,通过自主智能体与全生命周期感知,直接基于异构原始证据开展多学科研究,从而提升跨多种科学模态的、以证据为基础的发现能力。
近期基础模型的进展使 AI 科学家能够自动化越来越完整的研究流程,从假设生成、代码执行到稿件撰写。然而,仅覆盖工作流程并不能提供科学发现所依赖的全部证据。现有系统通常基于文本、代码、标签或预计算摘要进行推理,使得具有科学决定意义的空间、时间、跨通道和过程性关系无法被智能体获取。我们引入了 OmniScientist,一种端到端的全模态 AI 科学家(https://huggingface.co/papers?q=omni-modal%20AI%20scientist),它直接基于异构原始证据(https://huggingface.co/papers?q=raw%20evidence)开展多学科研究(https://huggingface.co/papers?q=multidisciplinary%20research)。一个感知层(https://huggingface.co/papers?q=perception%20layer)和三个分别负责构思、实验和撰写的自主智能体(https://huggingface.co/papers?q=autonomous%20agents)在一个确定性流水线(https://huggingface.co/papers?q=deterministic%20pipeline)内运行,使观察结果能够在整个研究生命周期中塑造研究问题、实验决策和最终结论。通过在代码中执行想法、严谨性和主张检查(https://huggingface.co/papers?q=claim%20checks),该系统强制实现新颖性筛选、统计有效性、执行溯源和数值可追溯性。我们在涵盖 5 个学科家族、4 类科学证据以及包括图像、信号、音频、视频、3D 结构、轨迹、表格、公式和图在内的多种模态的 36 个真实数据案例上评估了 OmniScientist。该系统在所有 36 个案例中均完成了从原始数据到编译稿件的完整路径,并在参考推理主干下取得了平均论文总分 6.3。在与仅接收预计算标量特征的盲变体的配对比较中,直接感知在全部 7 个评估维度上均取得优势,并在 85% 的头对头评判中获胜。这些结果表明,全生命周期感知(https://huggingface.co/papers?q=lifecycle-wide%20perception)对于以证据为基础的科学发现至关重要,并为实现广泛能力的 AI 科学家提供了一条切实可行的路径。
查看 arXiv 页面(https://arxiv.org/abs/2608.13558)查看 PDF(https://arxiv.org/pdf/2608.13558)项目页面(https://omni-scientist.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.13558)
在你的智能体中获取这篇论文:
hf papers read 2608\.13558
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.13558,即可将其链接到此页面。
引用此论文的数据集0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.13558,即可将其链接到此页面。
引用此论文的 Space0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2608.13558,即可将其链接到此页面。
包含此论文的收藏集0
暂无收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以将其链接到此页面。
相似文章
S1-Omni:用于科学理解、预测和生成的统一多模态推理模型
S1-Omni是一个用于科学任务(包括理解、预测和生成)的统一多模态推理模型。它基于包含200个科学任务的语料库进行训练,在大多数基准测试上优于GPT-5.5和Gemini-3.1-Pro。
原生主动感知作为全模态理解的推理方式
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。
Omni by xpander
Omni by xpander 是一款旨在自动化和管理AI代理的产品,减少了AI操作中人工监督的需求。
EvoScientist:面向端到端科学发现的多智能体进化AI科学家
EvoScientist 是一个用于端到端科学发现的自适应多智能体框架,通过持久化记忆模块持续改进,由三个专业智能体组成,分别负责创意生成、实验执行和知识提炼。它在科学创意生成方面超越了7个当前最先进的系统,并通过多智能体进化提升了代码执行成功率。
Light-Omni:带长期记忆的智能体视频理解中反射优先于推理
Light-Omni是一个多模态智能体框架,用于高效视频理解,通过双上下文状态(全局状态和参数化潜在状态)避免迭代推理,实现更快更准确的处理,并显著提升速度和节省内存。