代理者的分叉路径花园
摘要
本文介绍了一种人工智能代理,能够在不同数据集中重现人类分析的差异,并发现不同角色会导致截然不同的结论。它提出了m-value和Agentic Bootstrap来评估所报告分析的可信度。
arXiv:2607.01507v1 Announce Type: new
摘要:实证研究很少承认唯一分析。不同的分析选择可能导致从相同数据得出不同的结论,然而这些隐藏的分叉路径很难被观察到。我们展示了人工智能代理能够捕捉人类研究人员之间的大部分分析差异,同时使这些路径变得明确。在四个高风险领域,分配不同的角色就足以让人工智能代理从相同的数据和问题中报告出不同的、往往是相反的结论,并且结果系统地与这些信念一致。在一项由42个人类研究团队分析相同移民数据集的研究中,人工智能代理复现了人类在报告效应估计中72%的意识形态差距。尽管得出了相反的结论,但根据最终的人工智能报告很难识别出每个分析中的明确问题:86%通过了独立人工智能审查,78%通过了多数人类专家审查。这些发现表明,核心挑战通常不是有缺陷的分析,而是从大量方法上合理的分析空间中进行选择性探索和报告。人工智能代理可能通过使这种探索变得廉价且可扩展而放大这一长期存在的问题。为了解决这个问题,我们引入了m-value(multiverse value),即某个分析路径产生至少与所报告结果同样极端的结论的概率。我们进一步引入了Agentic Bootstrap,它通过使用人工智能代理对可能合理的分析路径进行采样来估计m-value。应用于人类移民研究时,13.5%的报告的人类分析落在分析空间中最极端的5%之内(m<0.05)。因此,科学证据不应仅根据单一报告分析来评估,还应根据其在可能合理报告的分析分布中的位置来评估。Agentic Bootstrap使这一分布变得可观察,并将其转化为科学可信度的标准。
查看缓存全文
缓存时间: 2026/07/03 05:44
# 分叉路径的智能体花园 来源:https://arxiv.org/abs/2607.01507 查看 PDF(https://arxiv.org/pdf/2607.01507) > **摘要:** 实证研究很少存在唯一的分析路径。不同的分析选择可能导致同一数据得出不同结论,但这些隐藏的分叉路径难以被观测。我们证明,AI智能体能够捕捉人类研究者之间的大部分分析差异,同时使这些路径明确化。在四个高风险领域,为AI智能体分配不同角色足以使它们从相同数据和问题中报告出分歧甚至对立的结论,且发现与这些信念系统性对齐。在一项42个人类研究团队分析同一移民数据集的研究中,AI智能体重现了报告效应估计中72%的人类意识形态差距。尽管得出对立结论,但根据最终AI报告很难识别每项分析中的明显问题:86%通过了独立AI审查,78%通过了多数人类专家审查。这些发现表明,核心挑战往往不在于有缺陷的分析,而在于从大量方法上可辩护的分析空间中进行选择性探索和报告。AI智能体可能通过使此类探索变得廉价且可扩展来放大这一长期问题。为解决此问题,我们引入了m值(多宇宙值),即分析路径产生至少与报告结果一样极端的主张的概率。我们进一步引入智能体自助法,通过使用AI智能体对可能分析路径进行采样来估计m值。应用于人类移民研究,13.5%的报告人类分析落在分析空间中最极端的5%内(m<0.05)。因此,科学证据不仅应通过单一报告分析来评估,还应通过其在合理可能报告的分析分布中的位置来评估。智能体自助法使该分布可观测,并将其转化为科学可信度的标准。 ## 提交历史 来自:Jiacheng Miao [查看邮箱(https://arxiv.org/show-email/cdcf1cdc/2607.01507)] **[v1]** 2026年7月1日星期三 22:15:37 UTC(5,269 KB)
相似文章
神经数据不再无聊:代理型AI在数据复用中的基准测试
本文对代理型AI系统在加载、理解和重新格式化碎片化的神经科学数据任务上进行基准测试,发现尽管代理在子任务上表现良好,但很少能实现完全无错误的端到端解决方案,人工监督仍然必要。
Agent-ValueBench:一个评估智能体价值观的综合基准
本文提出了 Agent-ValueBench,这是一个旨在评估自主智能体价值观的综合基准,揭示了智能体的价值观与其底层语言模型存在分歧。
大多数关于“智能体 AI”的讨论都感觉太抽象了。这里是我的智能体研究系统的实际样子
作者分享了他为识别和评估公司内 AI 用例而构建的智能体研究系统的实际分解。该系统使用六个智能体进行发现、评估和上下文提取,强调人在决策环中,而非完全自主。
观点:Agentic AI系统是实现AGI的可预见路径
本文认为,单一模型的单体型扩展不足以实现AGI,并提出具有多智能体协作的Agentic AI是必要的范式,理论上证明了代理系统在泛化和样本效率上具有指数级优势。
IDEAgent:面向研究想法生成的智能质量多样性搜索
IDEAgent 引入了一个多智能体框架,将研究构思视为质量多样性搜索,通过谱系演化联合优化想法的质量和多样性,在新的联合指标上以3.89倍的优势超越基线。