@LightOnIO:Reason-ModernColBERT 仅凭 149M 参数便在 BrowseComp-Plus 中拔得头筹。如今,Agent-ModernColBERT 在此基础上又提升了约 10%。达到…
摘要
LightOn 发布了 Agent-ModernColBERT,这是一个拥有 1.49 亿参数的开源检索模型。通过将在查询中整合智能体推理轨迹,其性能可与 GPT-5 搭配 Qwen3-Embed-8B 相媲美。
查看缓存全文
缓存时间: 2026/05/13 10:20
Reason-ModernColBERT 仅凭 1.49 亿参数就在 BrowseComp-Plus 榜单上拔得头筹。如今,Agent-ModernColBERT 在此基础上又提升了约 10%。配合 GPT-OSS-120B,其表现已能与 GPT-5 + Qwen3-8B 媲美。参数量依然只有 1.49 亿。完全开源。更小。更便宜。感谢 @antoine_chaffin 的辛勤工作。完整基准测试、方法论、模型、数据及训练代码详见博客 ↓ https://lighton.ai/lighton-blogs/deep-research-is-open-now?utm_source=x&utm_medium=organic_social&utm_campaign=blog_deep_research_is_open_now&utm_content=post_20260512…
Deep Research is now Open - LightOn
来源:https://lighton.ai/lighton-blogs/deep-research-is-open-now?utm_source=x&utm_medium=organic_social&utm_campaign=blog_deep_research_is_open_now&utm_content=post_20260512
智能体检索(Agentic retrieval)正在改变查询的形态。除了查询本身,智能体还会生成关于其搜索内容及原因的推理轨迹(reasoning traces)。传统的检索系统通常会丢弃这些线索,而 AgentIR 则将其附加到查询中。通过将 AgentIR 应用于晚期交互(late interaction)模型,我们在已经处于前沿水平的 Reason-ModernColBERT 基础上实现了 10% 的性能提升。结合 GPT-OSS-120B,我们现在能够以 54 倍更小的模型和完全开源的智能体,达到 GPT-5 配合 Qwen3-Embed-8B 的原始性能水平。
.png)
值得注意的是,Agent-ModernColBERT 与 AgentIR-4B 具有竞争力,后者是一个在相同数据上训练、规模大 26 倍的稠密模型,这再次凸显了晚期交互在智能体搜索中的优势。
这一规律依然成立
两个月前,Reason-ModernColBERT 在 BrowseComp-Plus 上配合 GPT-5 达到了 87.59% 的准确率,比之前的最佳成绩高出 7.59 个百分点,同时在召回率和校准误差方面领先。一个 1.49 亿参数的晚期交互检索器胜过规模大达 54 倍 的稠密模型。完整报道:The Bloated Retriever Era Is Over(https://lighton.ai/lighton-blogs/the-bloated-retriever-era-is-over)。
BrowseComp-Plus 旨在测试深度研究(Deep Research)风格工作流中的检索能力:问题难度大、语料库固定,且检索器必须提供足够有用的证据供智能体解答。它不仅询问检索器能否很好地对文档进行排序,更询问更好的检索是否实际上能帮助智能体完成任务。
Reason-ModernColBERT 并非专为智能体搜索训练,而是为一般的推理密集型检索训练。随之而来的显而易见的问题是:
如果直接将晚期交互模型用于推理循环内的检索训练,会发生什么?
AgentIR 与 DR-Synth
创建 BrowseComp-Plus 的 Zijian Chen 也发布了 AgentIR。
其核心理念很直接:在智能体搜索中,查询往往不仅仅是一个查询。在搜索之前,智能体通常已经分解了任务、形成了假设、排除了死胡同,并决定了下一步需要何种证据。
大多数检索管道会丢弃这些上下文,仅基于重写后的查询进行搜索。
AgentIR 的做法不同:它将智能体的推理轨迹直接拼接进检索查询中。
为了支持这种设置,该团队发布了 DR-Synth,这是一个合成智能体轨迹数据集,并训练了 AgentIR-4B,一个 40 亿参数的稠密检索器。AgentIR-4B 的性能优于更大的 ReasonIR-8B 以及使用重排序器(rerankers)的管道。
这很重要,因为 Reason-ModernColBERT 本身就是基于 ReasonIR 系列工作构建的。配方已经很熟悉了:当强大的稠密检索器及其训练数据发布后,使用 PyLate 在相同信号上训练晚期交互模型,然后测试多向量检索是否能以少胜多。
Agent-ModernColBERT
Agent-ModernColBERT 沿用这一熟悉的配方,通过在 DR-Synth 数据上微调晚期交互模型构建而成。
它是一个 1.49 亿参数的晚期交互检索器,专为处理包含智能体推理轨迹的检索查询而训练。训练耗时约 五分钟。
结果是一个小型检索器,直接适配 AgentIR 设置,同时保留了晚期交互的核心优势:词元级(token-level)匹配,而非将整个查询和文档压缩为单个向量。开源成果至关重要:配合 GPT-OSS-120B 和简单的 get_document 函数,Agent-ModernColBERT 达到了 72.53 的准确率。这高于 BrowseComp-Plus 中原始的 GPT-5 + Qwen3-Embed-8B 配置,尽管由于原始基线未暴露 get_document,两种脚手架并不完全相同。
这一限制条件很重要。结果也同样重要。
一个 1.49 亿参数的检索器,搭配开源大语言模型和轻量级文档阅读工具,超越了原始的闭源模型基准配置。完全开源。更小。更便宜。在此设置下更准确。
与 AgentIR-4B 的比较是另一个关键结果。Agent-ModernColBERT 在相同数据上训练,使用与 AgentIR 相同的提示词(甚至包括相同的错误转义换行符,以确保可比性),但规模仅为后者的 1/26,却依然具有竞争力。
到了这一步,依靠稠密模型规模扩展的论点开始捉襟见肘。
为什么推理轨迹有利于晚期交互
智能体检索改变了查询的形态。
标准搜索查询通常很短:几个关键词、一个实体或一个问题。智能体查询则丰富得多。它可能包含当前假设、中间推理、约束条件以及对缺失证据的描述。
将这些信息压缩到单个向量中是一项巨大的挑战。
晚期交互模型无需如此激进地进行压缩。它们保留词元级表示,并在检索时将查询词元与文档词元进行比较。当查询包含推理轨迹时,这一点尤其有用:检索器可以将轨迹的不同部分与文档中的不同证据片段进行匹配。
这就是为什么 Reason-ModernColBERT 即使在未针对智能体搜索训练的情况下,在 BrowseComp-Plus 上表现依然强劲。Agent-ModernColBERT 展示了当训练数据直接与智能体设置对齐时会发生什么。
为什么这改变了成本方程
深度研究循环内的每一次检索调用都消耗词元、延迟和金钱。
更好的检索器减少了找到答案所需的搜索迭代次数。更小的检索器降低了每次迭代的成本。晚期交互在这两方面都有助益。
对于基于企业知识库构建深度研究风格智能体的团队来说,这不仅仅是基准测试的细节。检索运行在循环内部。它必须足够快、足够便宜且足够准确,以便智能体决定接下来阅读什么。
在规模上服务 80 亿参数的稠密嵌入器成本高昂,且在长推理循环中难以保持响应速度。Agent-ModernColBERT 在这两方面都改变了方程:检索步骤更小,且步骤更少。
在 GPT-OSS-120B 设置中,Agent-ModernColBERT 以比 AgentIR-4B 更高的准确率完成了任务,同时使用的搜索调用次数更少。这很重要,因为深度研究循环内的每次搜索都会增加延迟、词元使用量和成本。1.49 亿参数的晚期交互检索器不仅使检索服务更便宜,还帮助智能体更快地找到正确的证据。
随着检索变得更加智能化,瓶颈看起来不再像是模型规模。
而是稠密压缩本身。
开源且可复现
模型
- Agent-ModernColBERT(https://huggingface.co/lightonai/Agent-ModernColBERT):智能体检索,1.49 亿参数
- Reason-ModernColBERT(https://lighton.ai/lighton-blogs/lighton-releases-reason-colbert):推理密集型检索,1.49 亿参数
- LateOn-Code(https://lighton.ai/lighton-blogs/lateon-code-colgrep-lighton):代码检索,1700 万 / 1.49 亿参数
工具与基础设施
- PyLate(https://lighton.ai/lighton-blogs/pylate-flexible-training-and-retrieval-for-late-interaction-models):几行代码即可训练晚期交互模型 - 用于 Agent-ModernColBERT 的确切训练脚本可在 此处 找到
- ColGrep(https://github.com/lightonai/next-plaid/tree/main/colgrep):面向终端和编码智能体的语义代码搜索
- NextPlaid(https://lighton.ai/lighton-blogs/introducing-lighton-nextplaid):本地优先的多向量数据库
数据集与基准测试
- DR-Synth(https://huggingface.co/datasets/Tevatron/AgentIR-data)
- BrowseComp-Plus 排行榜(https://huggingface.co/spaces/Tevatron/BrowseComp-Plus)
从 Hugging Face(https://huggingface.co/lightonai/Agent-ModernColBERT)下载权重。通过 LightOn Console(https://console.lighton.ai/)的 /search 接口针对您自己的语料库运行晚期交互检索。正在基于企业知识库构建深度研究风格的智能体吗?联系我们(https://lighton.ai/contactus)。
Agent-ModernColBERT 由 LightOn 的研究工程师 Antoine Chaffin 开发。
相似文章
@antoine_chaffin: Reason-ModernColBERT 几乎完美解决了 BrowseComp-Plus,碾压 SOTA,并超越了 54 倍大的模型。还不错吧…
Reason-ModernColBERT 在 BrowseComp-Plus 上取得了近乎完美的结果,超越了 SOTA 和 54 倍大的模型,随后 Agent-ModernColBERT 通过极少的训练进一步提升了性能。
@raphaelsrty:今天我们开源 LateOn 与 DenseOn,两款 149 M 参数的开放检索模型
Raphael 开源两款检索模型:LateOn(ColBERT 多向量)与 DenseOn(单向量),均 149 M 参数,在 BEIR 上超越体量 4 倍的大模型。
@AmelieTabatta: ColBERT 模型继续让体积为其 54 倍的模型颜面扫地,这就是我们信任 Late Interaction @LightOnIO 的原因。一条 1 年…
本文强调了 ColBERT 模型如何凭借延迟交互(late interaction)技术和极少微调,尽管体积更小且发布时间更早,仍优于 Qwen3-embed-8B 等更大规模的模型。
@OpenAI:基准分数既反映模型本身,也反映用于运行模型的测试框架和设置。对于长时间运行的智能体,保留…
OpenAI透露,启用保留推理和上下文压缩使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提升了三倍,凸显了测试框架设置对模型性能测量的显著影响。
@bo_wangbo: 好吧,也许这是个好时机?我们在pplx训练了一个小型colbert模型,它是对pplx-embed-0.6的继续训练…
Perplexity AI发布了pplx-embed-v1-late-0.6b,一个用于检索的小型ColBERT后期交互嵌入模型,基于他们现有的嵌入模型微调并针对MaxSim评分进行了优化,现已在HuggingFace上开源。