@LightOnIO:Reason-ModernColBERT 仅凭 149M 参数便在 BrowseComp-Plus 中拔得头筹。如今,Agent-ModernColBERT 在此基础上又提升了约 10%。达到…

X AI KOLs Following 模型

摘要

LightOn 发布了 Agent-ModernColBERT,这是一个拥有 1.49 亿参数的开源检索模型。通过将在查询中整合智能体推理轨迹,其性能可与 GPT-5 搭配 Qwen3-Embed-8B 相媲美。

Reason-ModernColBERT 仅凭 1.49 亿参数便在 BrowseComp-Plus 中拔得头筹。如今,Agent-ModernColBERT 在此基础上又提升了约 10%。在与 GPT-OSS-120B 结合时,达到了 GPT-5 + Qwen3-8B 的性能水平。参数量仍为 1.49 亿。完全开源。更小。更便宜。感谢 @antoine_chaffin 的出色工作。完整的基准测试、方法论、模型、数据及训练代码请参阅博客 ↓ https://lighton.ai/lighton-blogs/deep-research-is-open-now?utm_source=x&utm_medium=organic_social&utm_campaign=blog_deep_research_is_open_now&utm_content=post_20260512…
查看原文
查看缓存全文

缓存时间: 2026/05/13 10:20

Reason-ModernColBERT 仅凭 1.49 亿参数就在 BrowseComp-Plus 榜单上拔得头筹。如今,Agent-ModernColBERT 在此基础上又提升了约 10%。配合 GPT-OSS-120B,其表现已能与 GPT-5 + Qwen3-8B 媲美。参数量依然只有 1.49 亿。完全开源。更小。更便宜。感谢 @antoine_chaffin 的辛勤工作。完整基准测试、方法论、模型、数据及训练代码详见博客 ↓ https://lighton.ai/lighton-blogs/deep-research-is-open-now?utm_source=x&utm_medium=organic_social&utm_campaign=blog_deep_research_is_open_now&utm_content=post_20260512…


Deep Research is now Open - LightOn

来源:https://lighton.ai/lighton-blogs/deep-research-is-open-now?utm_source=x&utm_medium=organic_social&utm_campaign=blog_deep_research_is_open_now&utm_content=post_20260512

智能体检索(Agentic retrieval)正在改变查询的形态。除了查询本身,智能体还会生成关于其搜索内容及原因的推理轨迹(reasoning traces)。传统的检索系统通常会丢弃这些线索,而 AgentIR 则将其附加到查询中。通过将 AgentIR 应用于晚期交互(late interaction)模型,我们在已经处于前沿水平的 Reason-ModernColBERT 基础上实现了 10% 的性能提升。结合 GPT-OSS-120B,我们现在能够以 54 倍更小的模型和完全开源的智能体,达到 GPT-5 配合 Qwen3-Embed-8B 的原始性能水平。

.png)

值得注意的是,Agent-ModernColBERT 与 AgentIR-4B 具有竞争力,后者是一个在相同数据上训练、规模大 26 倍的稠密模型,这再次凸显了晚期交互在智能体搜索中的优势。

这一规律依然成立

两个月前,Reason-ModernColBERT 在 BrowseComp-Plus 上配合 GPT-5 达到了 87.59% 的准确率,比之前的最佳成绩高出 7.59 个百分点,同时在召回率和校准误差方面领先。一个 1.49 亿参数的晚期交互检索器胜过规模大达 54 倍 的稠密模型。完整报道:The Bloated Retriever Era Is Over(https://lighton.ai/lighton-blogs/the-bloated-retriever-era-is-over)。

BrowseComp-Plus 旨在测试深度研究(Deep Research)风格工作流中的检索能力:问题难度大、语料库固定,且检索器必须提供足够有用的证据供智能体解答。它不仅询问检索器能否很好地对文档进行排序,更询问更好的检索是否实际上能帮助智能体完成任务。

Reason-ModernColBERT 并非专为智能体搜索训练,而是为一般的推理密集型检索训练。随之而来的显而易见的问题是:

如果直接将晚期交互模型用于推理循环内的检索训练,会发生什么?

AgentIR 与 DR-Synth

创建 BrowseComp-Plus 的 Zijian Chen 也发布了 AgentIR。

其核心理念很直接:在智能体搜索中,查询往往不仅仅是一个查询。在搜索之前,智能体通常已经分解了任务、形成了假设、排除了死胡同,并决定了下一步需要何种证据。

大多数检索管道会丢弃这些上下文,仅基于重写后的查询进行搜索。

AgentIR 的做法不同:它将智能体的推理轨迹直接拼接进检索查询中。

为了支持这种设置,该团队发布了 DR-Synth,这是一个合成智能体轨迹数据集,并训练了 AgentIR-4B,一个 40 亿参数的稠密检索器。AgentIR-4B 的性能优于更大的 ReasonIR-8B 以及使用重排序器(rerankers)的管道。

这很重要,因为 Reason-ModernColBERT 本身就是基于 ReasonIR 系列工作构建的。配方已经很熟悉了:当强大的稠密检索器及其训练数据发布后,使用 PyLate 在相同信号上训练晚期交互模型,然后测试多向量检索是否能以少胜多。

Agent-ModernColBERT

Agent-ModernColBERT 沿用这一熟悉的配方,通过在 DR-Synth 数据上微调晚期交互模型构建而成。

它是一个 1.49 亿参数的晚期交互检索器,专为处理包含智能体推理轨迹的检索查询而训练。训练耗时约 五分钟。

结果是一个小型检索器,直接适配 AgentIR 设置,同时保留了晚期交互的核心优势:词元级(token-level)匹配,而非将整个查询和文档压缩为单个向量。开源成果至关重要:配合 GPT-OSS-120B 和简单的 get_document 函数,Agent-ModernColBERT 达到了 72.53 的准确率。这高于 BrowseComp-Plus 中原始的 GPT-5 + Qwen3-Embed-8B 配置,尽管由于原始基线未暴露 get_document,两种脚手架并不完全相同。

这一限制条件很重要。结果也同样重要。

一个 1.49 亿参数的检索器,搭配开源大语言模型和轻量级文档阅读工具,超越了原始的闭源模型基准配置。完全开源。更小。更便宜。在此设置下更准确。

与 AgentIR-4B 的比较是另一个关键结果。Agent-ModernColBERT 在相同数据上训练,使用与 AgentIR 相同的提示词(甚至包括相同的错误转义换行符,以确保可比性),但规模仅为后者的 1/26,却依然具有竞争力。

到了这一步,依靠稠密模型规模扩展的论点开始捉襟见肘。

为什么推理轨迹有利于晚期交互

智能体检索改变了查询的形态。

标准搜索查询通常很短:几个关键词、一个实体或一个问题。智能体查询则丰富得多。它可能包含当前假设、中间推理、约束条件以及对缺失证据的描述。

将这些信息压缩到单个向量中是一项巨大的挑战。

晚期交互模型无需如此激进地进行压缩。它们保留词元级表示,并在检索时将查询词元与文档词元进行比较。当查询包含推理轨迹时,这一点尤其有用:检索器可以将轨迹的不同部分与文档中的不同证据片段进行匹配。

这就是为什么 Reason-ModernColBERT 即使在未针对智能体搜索训练的情况下,在 BrowseComp-Plus 上表现依然强劲。Agent-ModernColBERT 展示了当训练数据直接与智能体设置对齐时会发生什么。

为什么这改变了成本方程

深度研究循环内的每一次检索调用都消耗词元、延迟和金钱。

更好的检索器减少了找到答案所需的搜索迭代次数。更小的检索器降低了每次迭代的成本。晚期交互在这两方面都有助益。

对于基于企业知识库构建深度研究风格智能体的团队来说,这不仅仅是基准测试的细节。检索运行在循环内部。它必须足够快、足够便宜且足够准确,以便智能体决定接下来阅读什么。

在规模上服务 80 亿参数的稠密嵌入器成本高昂,且在长推理循环中难以保持响应速度。Agent-ModernColBERT 在这两方面都改变了方程:检索步骤更小,且步骤更少。

在 GPT-OSS-120B 设置中,Agent-ModernColBERT 以比 AgentIR-4B 更高的准确率完成了任务,同时使用的搜索调用次数更少。这很重要,因为深度研究循环内的每次搜索都会增加延迟、词元使用量和成本。1.49 亿参数的晚期交互检索器不仅使检索服务更便宜,还帮助智能体更快地找到正确的证据。

随着检索变得更加智能化,瓶颈看起来不再像是模型规模。

而是稠密压缩本身。

开源且可复现

模型

  • Agent-ModernColBERT(https://huggingface.co/lightonai/Agent-ModernColBERT):智能体检索,1.49 亿参数
  • Reason-ModernColBERT(https://lighton.ai/lighton-blogs/lighton-releases-reason-colbert):推理密集型检索,1.49 亿参数
  • LateOn-Code(https://lighton.ai/lighton-blogs/lateon-code-colgrep-lighton):代码检索,1700 万 / 1.49 亿参数

工具与基础设施

  • PyLate(https://lighton.ai/lighton-blogs/pylate-flexible-training-and-retrieval-for-late-interaction-models):几行代码即可训练晚期交互模型 - 用于 Agent-ModernColBERT 的确切训练脚本可在 此处 找到
  • ColGrep(https://github.com/lightonai/next-plaid/tree/main/colgrep):面向终端和编码智能体的语义代码搜索
  • NextPlaid(https://lighton.ai/lighton-blogs/introducing-lighton-nextplaid):本地优先的多向量数据库

数据集与基准测试

  • DR-Synth(https://huggingface.co/datasets/Tevatron/AgentIR-data)
  • BrowseComp-Plus 排行榜(https://huggingface.co/spaces/Tevatron/BrowseComp-Plus)

从 Hugging Face(https://huggingface.co/lightonai/Agent-ModernColBERT)下载权重。通过 LightOn Console(https://console.lighton.ai/)的 /search 接口针对您自己的语料库运行晚期交互检索。正在基于企业知识库构建深度研究风格的智能体吗?联系我们(https://lighton.ai/contactus)。

Agent-ModernColBERT 由 LightOn 的研究工程师 Antoine Chaffin 开发。

相似文章