Dr-DCI:通过动态工作区扩展实现直接语料库交互的规模化
摘要
本文介绍了DR-DCI,一种由检索器引导的框架,通过动态扩展本地工作区来扩展直接语料库交互,从而在大型语料库的智能搜索中提高了准确性和效率。
arXiv:2606.14885v1 公告类型:新
摘要:大型语料库上的智能搜索依赖于检索器中介的接口(例如BM25或ColBERT)来实现可扩展的候选发现。虽然这些接口在排序相关文档方面很有效,但它们仅以排序结果或有界的文档视图形式展示证据,限制了智能体重新组织材料和跨文档验证约束的能力。直接语料库交互(DCI)通过暴露可执行的shell语料库操作来克服这一限制,从而实现灵活的搜索、过滤、比较和验证。然而,随着语料库的增长,全量语料库终端命令变得缓慢且不稳定,降低了性能和效率。我们提出了DR-DCI,一种由检索器引导的DCI框架,将检索视为智能体可调用的操作,用于扩展本地工作区。智能体不是直接操作整个语料库,而是动态地将相关文档拉入一个不断演变的工作区,并在其中执行DCI操作。这种设计结合了检索器级别的召回率和DCI风格的精确性:检索保持探索的可扩展性,而DCI则保留了有效证据解析所需的本地操作。实验表明,DR-DCI在不同规模下都有效且高效。在Browsecomp-Plus上,DR-DCI达到了71.2%的准确率,比原始DCI和消融变体提高了最多8.3个百分点,同时减少了工具使用、壁挂时间和估计成本。通过保留工作区的上下文重置,准确率进一步提高到73.3%。在语料库扩展实验中,DR-DCI在10万到1000万文档范围内仍然有效,而原始DCI变得不稳定,BM25的表现也显著更差。DR-DCI还扩展到2000万规模的逐文档文件Wiki-18问答设置,在六个基准上平均得分63.0,优于基于检索和经过训练的搜索智能体基线。消融分析进一步表明,排序预览和文档间DCI是性能的关键。
查看缓存全文
缓存时间: 2026/06/16 11:43
# DR-DCI: 通过动态工作空间扩展实现大规模直接语料交互 来源: https://arxiv.org/html/2606.14885 易路¹,*†, 李卓峰²,*, 聂萍³,†, 张浩翔⁴, 张雨雨⁵, 邹凯⁶, 陈文虎³, 林吉米³, 江东富³,🖂, 张宇²,🖂 ¹多伦多大学, ²德州农工大学, ³滑铁卢大学, ⁴加州大学圣地亚哥分校, ⁵Verdent AI, ⁶Netmind AI ###### 摘要 针对大规模语料的智能搜索传统上依赖于检索器介导的接口(如 BM25 或 ColBERT)来实现可扩展的候选文档发现。尽管这些接口在排序潜在相关文档方面很有效,但它们通常只将证据呈现为排序结果或受限的文档视图,限制了智能体重组材料以及跨文档验证约束的能力。最近的直接语料交互(DCI)技术通过暴露 shell 可执行的语料操作来应对这一局限,支持灵活的搜索、过滤、比较和验证。然而,随着语料增长,针对整个语料的终端命令变得缓慢且不稳定,降低了性能和效率。我们提出 DR-DCI,一种由检索器引导的 DCI 框架,将检索视为智能体可调用的动作,用于扩展局部工作空间。智能体不是直接对整个语料进行操作,而是动态地将相关文档拉入不断演进的工作空间,并在其内部执行 DCI 操作。这种设计结合了检索器级别的召回率和 DCI 风格的精确性:检索使探索保持可扩展性,而 DCI 则保留了有效证据解析所需的局部操作。实验表明,DR-DCI 在不同规模下都既有效又高效。在 BrowseComp-Plus 上,DR-DCI 达到了 71.2% 的准确率,相比原始 DCI 和消融变体提升了最多 8.3 个百分点,同时减少了工具使用、运行时间和估计成本。采用保留工作空间的上下文重置后,准确率进一步提升至 73.3%。在语料规模扩展实验中,DR-DCI 在 10万 到 1000万 文档范围内保持有效,而原始 DCI 变得不稳定,BM25 表现显著更差。DR-DCI 还能扩展到 2000万 级别的每文档单文件 Wiki-18 QA 设定,在六个基准测试中平均得分为 63.0,优于基于检索的基线和经过训练的搜索智能体基线。消融分析进一步表明,排序预览和跨文档 DCI 是性能的关键。††脚注: *: 同等贡献。†: 项目负责人。🖂: 通讯作者。 ## 1 引言 智能搜索 (Zhai, 2025 (https://arxiv.org/html/2606.14885#bib.bib47); Singh 等, 2025 (https://arxiv.org/html/2606.14885#bib.bib39)) 的定义在于规模与控制之间的张力。智能体必须首先在庞大的语料中发现有希望的候选文档,但一旦找到这些候选文档,它又必须与证据进行精确交互。传统的检索增强生成(RAG)系统 (Lewis 等, 2020 (https://arxiv.org/html/2606.14885#bib.bib2)) 通过索引语料并返回排序后的 top-\(k\) 文档或段落列表(例如,通过 BM25 (Robertson 等, 1994 (https://arxiv.org/html/2606.14885#bib.bib12)) 或 ColBERT (Khattab 和 Zaharia, 2020 (https://arxiv.org/html/2606.14885#bib.bib14)))满足了第一个需求。这种检索范式自然地可扩展,最近的模型通过重复搜索、分页和文档打开接口 (Jin 等, 2025 (https://arxiv.org/html/2606.14885#bib.bib7); Sun 等, 2025 (https://arxiv.org/html/2606.14885#bib.bib8); Li 等, 2026a (https://arxiv.org/html/2606.14885#bib.bib24)) 对其进行了扩展。然而,交互仍然围绕着检索器所暴露的内容进行组织。证据通常以排序列表、片段或受限的文档视图呈现,限制了智能体重组材料、使用任意约束跨文档搜索以及通过灵活的跨文档操作验证假设的能力。 最近的直接语料交互(DCI)方法 (Li 等, 2026b (https://arxiv.org/html/2606.14885#bib.bib1); Sen 等, 2026 (https://arxiv.org/html/2606.14885#bib.bib41); Salemi 等, 2026 (https://arxiv.org/html/2606.14885#bib.bib48)) 提供了互补的优势。DCI 智能体通过终端可执行工具(如 `rg`、`grep`、`find`、`read` 和 `cat`)直接搜索和检查语料。这赋予了智能体对证据操作的细粒度控制:它可以在任意粒度上搜索,组合词汇约束,跟踪桥接实体,比较文档,并验证确切的证据范围。然而,当 DCI 直接应用于整个语料时,同样的灵活性变得脆弱:随着文档集合的增长,终端命令变得越来越慢,容易超时。广泛搜索会返回过多无关匹配,而谨慎搜索则可能在没有全局指导的情况下遗漏证据。因此,DCI 的瓶颈不在于局部精度,而在于缺乏一种可扩展的聚焦式语料级探索机制。这引出了本文的核心问题: > 我们能否将 DCI 扩展到更大的语料,同时保持其精度和灵活性? 我们通过 DR-DCI 来研究这个问题,这是一个用于大规模语料智能搜索的检索器引导的 DCI 框架。关键洞察是将检索暴露为一种智能体可调用的工作空间扩展动作 `pull`,而不是作为最终的证据接口。在推理过程中,智能体通过调用 `pull`(附带查询和检索预算)将来自完整语料的排序候选文档具体化到一个不断演进的局部工作空间中。然后智能体使用终端风格的 DCI 命令在该有界工作空间内搜索、检查、过滤、比较和验证证据。这将扩展问题与精度问题分离开来:检索提供语料级别的候选发现,而 DCI 则在候选文档被具体化后提供工作空间级别的文档交互。 这种工作空间扩展视图与标准的 RAG 和原始 DCI 都不同。在标准 RAG 中,检索决定了模型读取的上下文。在原始 DCI 中,智能体直接对整个语料进行操作,没有全局排序先验。在 DR-DCI 中,检索帮助智能体动态构建和优先处理一个不断演进的工作空间,而 DCI 命令则支持在该工作空间内进行局部调查。通过交替进行拉取新文档和搜索当前工作空间(随着证据约束的演变),智能体遵循一个可扩展的语料交互循环,结合了检索器级别的召回率和 DCI 风格的精度。 我们在三种大规模设定下评估 DR-DCI。首先,在 BrowseComp-Plus (Chen 等, 2025 (https://arxiv.org/html/2606.14885#bib.bib32)) 上,我们测试动态工作空间扩展是否比原始 DCI 和静态工作空间消融能提升智能搜索。其次,我们通过添加随机采样的 FineWeb (Penedo 等, 2024 (https://arxiv.org/html/2606.14885#bib.bib42)) 网站作为干扰项进行受控的语料扩展实验,将语料从 10万 文档扩展到 1000万 文档,同时保留从 BrowseComp-Plus 中抽样的相同 100 个问题及其支持文档。这直接测试了当无关语料规模增加时,DR-DCI 是否仍然有效和高效。第三,在 2000万 级别的每文档单文件 Wiki-18 QA 设定中,我们评估相同的接口是否能迁移到极大的文档集合。在这些设定中,结果支持了工作空间扩展的视图。 在 BrowseComp-Plus 上,DR-DCI 将准确率提升至 71.2%,相比原始 DCI 和静态工作空间变体提高了最多 8.3 个百分点,同时降低了工具使用、运行时间和估计成本。通过采用保留工作空间的上下文重置机制,性能进一步提升至 73.3%,表明即使原始推理轨迹未能使用已具体化的工作空间,其中仍然可能包含有用的证据。扩展研究更直接地展示了检索的运行角色:随着语料从 10万 增长到 1000万 文档,DR-DCI 保持可见工作空间有界,性能优雅下降,而原始 DCI 在重复的全语料终端搜索下变得不可行。2000万 级别的 Wiki-18 QA 结果显示,相同的接口可以迁移到 BrowseComp-Plus 之外,在六个基准测试中平均得分 63.0,优于基于检索的基线和经过训练的搜索智能体基线。最后,接口消融阐明了设计为何有效:排序预览帮助智能体优先处理新候选文档,但跨文档 DCI 对于比较候选文档、组合约束和验证超脱于检索器顺序的证据是必需的。 我们将贡献总结如下: 1. **检索作为工作空间管理。** 我们将检索从一次性的上下文选择模块重新定义为一种智能体可调用的操作,该操作修改智能体的环境。检索到的文档作为工作空间状态持久存在,使后续工具调用能够在已具体化的候选文档中搜索、比较和验证证据。 2. **DCI 的可扩展接口。** 我们将“检索即工作空间管理”的洞察实例化为 DR-DCI,其中 `pull` 支持语料级探索,而终端风格的 DCI 支持局部证据交互。这种分离允许 DCI 保留其面向精度的操作,而不需要每个搜索命令扫描整个语料。 3. **实证验证与搜索智能体的接口经验。** 在 BrowseComp-Plus、受控的语料扩展设定以及 2000万 级别的 Wiki-18 QA 上,我们的实验表明工作空间扩展改善了固定语料的搜索,并且随语料规模增加仍然有效。消融进一步识别出实际的接口选择:检索排序应指导而非取代智能体调查,并且跨文档工作空间搜索对于解决证据约束是必需的。 ## 2 相关工作 ##### 用于可扩展候选发现的新号与稠密检索。 RAG 系统通常使用检索作为可扩展的上下文选择机制。检索器对大型语料进行评分,并返回排序后的 top-\(k\) 文档或段落列表供下游模型或智能体处理 (Lewis 等, 2020 (https://arxiv.org/html/2606.14885#bib.bib2))。稀疏词汇检索器如 BM25 (Robertson 等, 1994 (https://arxiv.org/html/2606.14885#bib.bib12)) 对于精确实体、稀有术语和区分性短语仍然有效,而稠密检索器 (Karpukhin 等, 2020 (https://arxiv.org/html/2606.14885#bib.bib13); Khattab 和 Zaharia, 2020 (https://arxiv.org/html/2606.14885#bib.bib14); Chen 等, 2024 (https://arxiv.org/html/2606.14885#bib.bib44); Zhang 等, 2025 (https://arxiv.org/html/2606.14885#bib.bib43)) 则通过超越精确词汇重叠来提高语义相关证据的召回率。现代的检索和重排序系统通过指令微调 (Asai 等, 2023 (https://arxiv.org/html/2606.14885#bib.bib49))、基于基准的训练 (Muennighoff 等, 2023 (https://arxiv.org/html/2606.14885#bib.bib16)) 和混合检索 (Lee 等, 2025 (https://arxiv.org/html/2606.14885#bib.bib45)) 进一步改进了候选发现。我们的关注点不在于改进这种排序机制,而在于其候选文档应填充何种智能体工作空间。 ##### 智能搜索。 另一条工作线将 RAG 从一次性检索扩展到多步交互。ReAct 风格智能体 (Yao 等, 2023 (https://arxiv.org/html/2606.14885#bib.bib17))、WebGPT (Nakano 等, 2021 (https://arxiv.org/html/2606.14885#bib.bib18))、IRCoT (Trivedi 等, 2023 (https://arxiv.org/html/2606.14885#bib.bib19))、FLARE (Jiang 等, 2023 (https://arxiv.org/html/2606.14885#bib.bib20))、Self-RAG (Asai 等, 2024 (https://arxiv.org/html/2606.14885#bib.bib21)) 以及相关的搜索增强推理方法允许模型将推理与搜索、浏览或文档阅读交错进行。最近的智能搜索系统将检索引擎包装为工具,允许智能体在推理过程中发出多个查询、检查片段、打开文档、对结果进行分页以及完善假设 (Song 等, 2025 (https://arxiv.org/html/2606.14885#bib.bib9); Jin 等, 2025 (https://arxiv.org/html/2606.14885#bib.bib7); Sun 等, 2025 (https://arxiv.org/html/2606.14885#bib.bib8))。这些系统使检索更具交互性,但交互模式仍然主要围绕搜索结果页面和受限的单文档视图组织。最近的工作进一步表明,检索后端设计和工具能力强烈塑造智能体行为。不同的检索器和搜索接口在效果、速度、可维护性、检索深度和查询风格上展现出不同的权衡 (Hsu 等, 2026 (https://arxiv.org/html/2606.14885#bib.bib6); Jiang 等, 2026 (https://arxiv.org/html/2606.14885#bib.bib40)),激发了一种检索器自适应的智能搜索视图。我们的工作是互补的:DR-DCI 不将检索器视为规范的证据接口,而是利用它进行可扩展的语料级候选发现,并应用 DCI 风格的工作空间操作进行局部证据调查。 ##### 长时域搜索智能体。 近期的工作转向关注那些能在挑战性任务中维持大量工具调用、中间假设和证据更新的搜索智能体。REDSearcher (Chu 等, 2026 (https://arxiv.org/html/2606.14885#bib.bib10)) 研究通过任务合成、轨迹构建、训练和局部环境模拟来实现可扩展的长时域搜索智能体优化。OpenResearcher (Li 等, 2026a (https://arxiv.org/html/2606.14885#bib.bib24)) 构建了深度研究轨迹合成的开放流程,而 OpenSeeker (Du 等, 2026b (https://arxiv.org/html/2606.14885#bib.bib11)) 和 OpenSeeker-v2 (Du 等, 2026a (https://arxiv.org/html/2606.14885#bib.bib50)) 则强调开放训练数据和高难度信息轨迹用于基于 SFT 的在线搜索智能体。随着轨迹变长,上下文管理成为一个核心设计问题:LongSeeker 引入了弹性上下文编排以动态重塑工作记忆,而陈旧观察掩码则分析何时修剪旧观察在不同模型和检索器体系下对性能有帮助或是有害 (Lu 等, 2026 (https://arxiv.org/html/2606.14885#bib.bib51); Zhang 等, 2026 (https://arxiv.org/html/2606.14885#bib.bib52))。这些工作研究如何训练或管理长时间运行的搜索智能体。DR-DCI 是互补的:我们关注的是语料访问接口本身,询问哪些证据应成为持久的工作空间状态,以及智能体在检索后该如何对该状态进行操作。 ##### 终端使用智能体和 DCI。 终端使用智能体通过可执行命令暴露计算环境,使模型能够搜索文件、检查输出、操作路径以及在灵活的(超越固定检索 API)环境中组合工具调用 (Jimenez 等, 2024 (https://arxiv.org/html/2606.14885#bib.bib22); Yang 等, 2024 (https://arxiv.org/html/2606.14885#bib.bib23); Cai 等, 2026 (https://arxiv.org/html/2606.14885#bib.bib46))。DCI 将此思想应用于智能搜索:DCI 智能体通过终端命令(如 `rg`、`grep`、`find`、`read` 和 `cat`)直接搜索和检查语料 (Li 等, 2026b (https://arxiv.org/html/2606.14885#bib.bib1); Sen 等, 2026 (https://arxiv.org/html/2606.14885#bib.bib41); Salemi 等, 2026 (https://arxiv.org/html/2606.14885#bib.bib48)),而不是局限于检索器产生的结果或有界的文档阅读器接口。DCI 赋予智能体对证据操作的细粒度控制,允许它表达确切的词汇约束、跟踪桥接实体、比较文档并通过局部语料操作验证证据范围。原始 DCI 暴露了该接口开始承受压力的地方。一旦正确的搜索区域就位,其文件系统命令具有很强的表达能力,但智
相似文章
超越语义相似性:通过直接语料库交互重新思考智能体搜索的检索
论文提出了直接语料库交互(DCI),这是一种新颖的方法,允许AI代理使用标准终端工具直接查询原始文本,而不是传统的基于嵌入的检索。通过绕过固定的相似性接口和离线索引,DCI在多个信息检索和智能体搜索基准上显著优于传统的稀疏、密集和重排序基线。
@johnsonshi86: https://x.com/johnsonshi86/status/2072112215097024961
描述了一种名为DR-DCI的优化方法,它将RAG与虚拟文件系统上的bash命令相结合,使代理能够进行精确的语料库检索,并讨论了为推理提供者扩展到分布式系统。
@zhuofengli96475: DCI刚刚在Hugging Face每日论文中登顶第一!立即试用!@HuggingPapers https://huggingface.co/papers/2605.05242…
DCI(直接语料交互)提出使用简单的终端工具如grep和bash进行智能搜索,无需嵌入或向量索引,表现优于传统检索方法。
面向智能体搜索的交互空间检索
RISE 框架通过结合 BM25 检索与预处理文档索引,为智能体搜索构建有界交互空间,在保持高准确率的同时实现大规模语料库的高效探索。
用于共情回应的动态常识协调
提出了DCC,一个用于共情回应生成的动态常识协调框架,集成了基于残差的交互、关联引导的过滤和迭代解码,相比于基线模型提高了情感分类准确率和回应多样性。