NightFeats @ MMU-RAGent NeurIPS 2025: 面向文本到文本任务的上下文优化多智能体RAG系统
摘要
NightFeats是一个多智能体RAG系统,在NeurIPS 2025的MMU-RAGent竞赛中获得最佳动态评估奖。它采用三阶段流水线(检索、策划、组合),在人工评估中优于专有基线模型。
arXiv:2606.11199v1 公告类型:新
摘要:我们提出NightFeats,这是一个结构化的多智能体检索增强生成(RAG)系统,提交至NeurIPS 2025的MMU-RAGent竞赛,并在文本到文本赛道中获得最佳动态评估奖。与追求基准最大化不同,本工作提出了一个原理性流水线,将知识合成分解为三个协调阶段:检索、策划和组合,每个阶段由明确的中间表示和交接契约控制。受智能体上下文工程(ACE)启发,该系统引入了时间语义重排序、有界矛盾调和以及保留引用的组合作为核心架构原语。竞赛结果表明,NightFeats在LLM-as-a-Judge和Human Likert评估中超过了包括Claude-SonnetV2和Nova-Pro在内的专有基线,证实了架构透明性和可验证证据基础比单纯优化自动相似度指标的系统更符合人类偏好。
查看缓存全文
缓存时间: 2026/06/11 13:34
# NightFeats @ MMU-RAGent NeurIPS 2025:面向文本到文本赛道的上下文优化多智能体 RAG 系统 来源:https://arxiv.org/abs/2606.11199 查看 PDF (https://arxiv.org/pdf/2606.11199) > 摘要:我们提出 NightFeats——一个结构化的多智能体检索增强生成(RAG)系统,已提交至 NeurIPS 2025 的 MMU-RAGent 竞赛,并在文本到文本赛道中荣获最佳动态评估奖。本文并非追求基准最大化,而是提出一个原则性流水线,将知识综合分解为三个协调阶段:检索、筛选与整合。每个阶段由明确的中间表示和交接协议来管控。受智能体上下文工程(ACE)启发,系统引入了时序语义重排序、有界矛盾调和以及保留引用的整合作为核心架构原语。竞赛结果显示,NightFeats 在基于大模型评审和人类李克特评估中超越了包括 Claude-SonnetV2 和 Nova-Pro 在内的专有基线,证实了架构透明性和可验证的证据基础更符合人类偏好,而非那些仅针对自动相似度指标进行优化的系统。 ## 提交历史 来自:Quentin Fever M [view email (https://arxiv.org/show-email/24901e67/2606.11199)] **\[v1]** Tue, 21 Apr 2026 19:18:07 UTC (645 KB)
相似文章
MCite-RL:通过引用增强的智能体强化学习实现可靠的多模态RAG
MCite-RL 是一种引用增强的智能体强化学习框架,专为可靠的多模态RAG设计,引入了用于视觉引用的迭代检索和推理,以及一种奖励机制来联合优化答案准确性和来源可追溯性。
5ting在SemEval-2026任务8中的表现:基于LLM重排序和忠实性控制的强大端到端多轮RAG
本文介绍了5ting系统,这是一个用于多轮检索增强生成(RAG)的系统,融合了BGE-M3密集检索、FAISS索引、基于LLM的重排序以及证据约束生成。该系统在SemEval-2026任务8中取得了出色成绩,检索nDCG@5达到0.4719,端到端调和得分为0.5597。
面向LongEval-RAG的候选约束检索增强生成:系统设计与实证分析
本文介绍了为CLEF 2026 LongEval-RAG任务设计的候选约束检索增强生成(RAG)系统,该系统结合了确定性溯源追踪与段落检索、查询扩展、伪相关反馈、互惠排名融合、证据重排序以及引文感知聚合。对十种流水线变体的消融研究表明,采用基于规则的分块流水线并辅以句子级神经选择的方案取得了最佳性能。
@rohit4verse: 每个夜晚,如果你没有运行自主研究智能体,那你就是在手动运行别人几个月前就已经自动化的实验…
Andrej Karpathy 开源了一个自主研究智能体,它能在单张 GPU 上通宵运行自己的机器学习实验,通过编辑代码自动迭代改进,并保留那些能降低验证损失的变化。
PhoenixNent-Video:基于证据的多模态代理框架,用于自动化视频面试评估
PhoenixNent-Video 提出了一种基于证据的多模态代理框架,用于自动化视频面试评估,通过使用结构化视频图和强化学习,在基准测试中达到了91.50%的等级准确率。