标签
GeoArbiter 提出了一种免训练流程,选择性地将图像无法验证的地理事实注入遥感多模态大语言模型,以减少知识幻觉,同时保留检索准确率的提升。
文章认为,更好的语义搜索或更大的上下文窗口无法修复不可靠的AI智能体;相反,智能体必须在回答或行动之前重新打开原始来源以验证检索到的上下文。
本文回顾了一起AI助手错误确认服务的事件。故障排查发现知识库检索未被记录,导致无法将回答归因于检索到的上下文。文章强调,为验证回答的依据,需要对检索进行按对话轮次可追溯的日志记录。
作者分享了构建客户支持多智能体系统的经验,认为检索和落地失败(而非提示词或模型)是智能体产生幻觉的主要原因。作者列出了五项落地检查,并指出禁止无依据回答使升级率降低了40%。
ExtractBench 是一个用于模式引导的企业文档抽取的新基准,在 4,869 页企业文档上评估值准确率、记录完整性、溯源性和成本。作者发现,商业 VLM 在处理长文档时表现不佳,而编码智能体虽然更准确但成本较高;LlamaExtract AgenticPlus 在所有指标上均领先。
介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。
CLBench-V是一个用于评估多模态上下文学习的基准,涵盖上下文基础、新信息应用和新知识学习。最佳模型仅达到0.2847,表明该任务仍然具有挑战性。
一位开发者分享了如何通过检索纪律将智能体锚定到知识库(而非使用更好的模型)来解决自动幻灯片生成中的幻觉问题。该方法将检索与写作分离,并在渲染前强制执行来源检查。
本文识别了长上下文推理大型语言模型中的重复复制问题,并提出GEAR,一种奖励塑造方法,通过奖励与关键证据的重叠并惩罚无关上下文复制来改进扎根,实现了高达+4.6平均分的持续改进。
本文识别了在用于空间关系的目标条件紧凑世界模型中的一种混淆因素——'指令泄露',即模型通过转录指令而非真正接地关系来达到高精度。作者提出了一种检测协议和修复方法,该方法从动态中移除目标并监督读取路径,从而恢复真正的接地。
用户报告称,本地LLM在适配法律文档时以高自信度虚构引用,并寻求关于如何通过接地、模型或流水线思路来缓解此问题的建议。
介绍了DigitalCoach,一个包含72场人类专家-新手计算机使用辅导课程的多模态数据集,并评估了最先进模型教授软件技能的能力。模型倾向于直接给出指令而不提供解释或视觉基础,而人类教练则提供更具适应性的指导。
LabGuard 引入了一个框架,将自然语言实验室安全规则转化为具身代理的可执行运行时监控器,在不影响任务成功率的情况下,将不安全事件从 39.5% 降至 23.8%。
本文研究了视觉-语言模型在非对称对话中能否区分潜在共同基础与已确立共同基础。在MapTask数据上的实验表明,提供任务相关的地图内容(视觉或文本)会使模型倾向于过度预测对齐,因为它们依赖于静态指示范例而非通过对话历史追踪共同基础的确立过程。
十个 AI 模型被问及回答问题的最佳方式;它们推荐针对高风险决策采用委员会模式,针对事实查询采用基于来源的事实核查器。这促使 RoundTable 构建了 'Check mode',一项将强大模型与基于网页的事实核查器配对的新功能。
GAVEL 提出了一个新任务,用于验证、解释和定位图像-文本对中的错误,并附带一个数据集和基准。一个监督基线显示出相对于强闭源模型的改进。
本文提出了一种免训练的“先识别后回答”(IBA)框架,用于基于知识的视觉问答(KB-VQA),该框架将实体识别与证据排序解耦,在降低复杂度的同时优于微调的多模态检索增强生成基线。
本文介绍了DiagFlowBench,这是一个包含1,676个多轮诊断对话的基准数据集,这些对话源自工业流程图,旨在评估语言模型处理非程序输入及避免给出不恰当建议的能力。
本文介绍了ViGOS,一种多模态在策略自蒸馏方法,通过让学生模型先产生视觉描述再进行推理来解耦感知与推理,减少对捷径的依赖并改善图像接地行为。
本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。