标签
这篇文章讨论了为AI代理提供真正的领域专业知识的挑战,而不仅仅是扩展上下文窗口,并征求社区对如精选数据集和微调等方法的意见。
本文评估了基于检索的上下文内学习方法,用于检测德国社交媒体帖子中与犯罪相关的仇恨言论,发现少样本提示优于零样本,但检索方法仅提供边际增益,模型更适合用于分诊而非自主审核。
ReMoMask-2通过将检索直接嵌入生成器的潜在空间来改进文本到动作生成,消除表示差距,并在KIT-ML和SnapMoGen等基准测试上实现最先进的结果。
本文研究了用户上下文在大型语言模型中如何影响金融分析,发现解释偏差比检索偏差更为显著,并评估了缓解策略。
HIRA 是一种免训练、本地部署的检索增强级联系统,用于受监管行业的文档分类。它利用人工反馈和本地部署的大语言模型(LLM)来提高准确性,同时减少模型重新训练和 LLM 调用次数。
Ansari是一个已部署的基于检索的伊斯兰AI助手,它使用经认证的语料库来回答问题并提供引用,基于14万次对话和评估,证明了其有效性以及对价值观敏感的AI部署的见解。
意图引擎是一种架构,它将自然语言意图翻译成经过验证的服务级别目标(SLO)制品,用于计算连续体中的服务部署,并利用带有检索增强的LLM来减少幻觉和部署失败。
本文介绍了一种故障感知的对抗检索增强框架,利用上下文强盗来提升自然语言理解的鲁棒性,并在SNLI、ANLI和MultiNLI等基准测试中取得了显著改进。
DART-SD提出了一种拓扑感知的检索和调优框架,用于基于LLM的工具调用代理的自蒸馏,通过仅纠正关键拓扑断点并保留有效推理来提升策略多样性。
本文提出一个风险控制框架,用于在事实评估中将LLM作为判断器。该框架校准不确定性阈值以维持用户指定的错误率,并在必要时路由到检索增强模式,从而实现具有可证明可靠性保证的更高覆盖率。
本文介绍了DA-RAC,一种用于LLM评判器的距离感知校准方法,通过使用相似的有标签锚点来减少误校准和误通过风险,以增强AI审计的可信度。
本文介绍了RAEF,这是一种模型无关的检索增强时间序列预测方法,与微调方法相比,提高了准确性并减少了计算开销。
本文提出了一种使用BM25和Gemini 2.5 Flash的检索增强翻译系统,针对资源匮乏的东北印度语言,提交至WMT26共享任务,无需模型微调。
本文提出了HybridRAG-BN,一种用于孟加拉语知识库问答的检索增强框架,该框架结合了混合检索、基于Gemma的生成以及LoRA微调的验证,以F1分数0.71654和0.72912获得第一名。
介绍了检索校正共形预测(RCCP),一种用于时间序列预测区间的检索增强校准方法,它选择相似的过去残差并应用标量共形校正,以低开销实现目标覆盖率。
The paper presents LLM Agents Factory, a retrieval-based framework that constructs domain-specific LLM agents from a base of over 20K predefined agent profiles, offering a cost-efficient and controllable alternative to dynamic agent generation. Experiments show accuracy comparable to AutoGen with a 120B backbone at substantially lower inference cost.
Align-RAG 引入了一种无需训练的闭式对齐方法,用于在冻结的时间序列基础模型上进行检索增强预测,在标准基准测试中超越了学习型融合适配器,且无需任何学习参数。
本文提出了UniME-R1,一种用于统一多模态检索的嵌入器-顾问框架,该框架基于检索反馈生成检索中心思维链(RC-CoT),通过从硬负样本中学习来提升检索性能。
本文引入了干扰物感知截断,以在长上下文LLM基准测试中将上下文长度效应与信号丢失分离开来,表明朴素截断将两者混为一谈,而保留任务相关内容并移除干扰物则能维持或提升性能。
论文介绍了EMBL AI Librarian,这是一个知识层,允许生命科学AI代理使用自然语言查询Europe PMC并直接获得证据。它在多个基准测试中提升了检索和下游任务性能,并公开了代码。