grounding

标签

Cards List
#grounding

GeoArbiter:遥感多模态大语言模型的可验证性引导接地

arXiv cs.LG · 5天前 缓存

GeoArbiter 提出了一种免训练流程,选择性地将图像无法验证的地理事实注入遥感多模态大语言模型,以减少知识幻觉,同时保留检索准确率的提升。

0 人收藏 0 人点赞
#grounding

更好的语义搜索无法修复从不验证上下文的智能体

Reddit r/AI_Agents · 6天前

文章认为,更好的语义搜索或更大的上下文窗口无法修复不可靠的AI智能体;相反,智能体必须在回答或行动之前重新打开原始来源以验证检索到的上下文。

0 人收藏 0 人点赞
#grounding

我们的AI助手对我们并不销售的东西说了“可以”,日志却无法告诉我原因

Reddit r/AI_Agents · 2026-07-31

本文回顾了一起AI助手错误确认服务的事件。故障排查发现知识库检索未被记录,导致无法将回答归因于检索到的上下文。文章强调,为验证回答的依据,需要对检索进行按对话轮次可追溯的日志记录。

0 人收藏 0 人点赞
#grounding

我在构建多智能体系统时犯了这5个错误,你可能也会犯

Reddit r/AI_Agents · 2026-07-31

作者分享了构建客户支持多智能体系统的经验,认为检索和落地失败(而非提示词或模型)是智能体产生幻觉的主要原因。作者列出了五项落地检查,并指出禁止无依据回答使升级率降低了40%。

0 人收藏 0 人点赞
#grounding

ExtractBench:面向模式引导的企业文档抽取基准

Hugging Face Daily Papers · 2026-07-31 缓存

ExtractBench 是一个用于模式引导的企业文档抽取的新基准,在 4,869 页企业文档上评估值准确率、记录完整性、溯源性和成本。作者发现,商业 VLM 在处理长文档时表现不佳,而编码智能体虽然更准确但成本较高;LlamaExtract AgenticPlus 在所有指标上均领先。

0 人收藏 0 人点赞
#grounding

RefCaptioner:多参考图像 grounded 视频字幕生成

Hugging Face Daily Papers · 2026-07-30 缓存

介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。

0 人收藏 0 人点赞
#grounding

CLBench-V: 从上下文基础到知识获取的多模态上下文学习评估

Hugging Face Daily Papers · 2026-07-28 缓存

CLBench-V是一个用于评估多模态上下文学习的基准,涵盖上下文基础、新信息应用和新知识学习。最佳模型仅达到0.2847,表明该任务仍然具有挑战性。

0 人收藏 0 人点赞
#grounding

我如何通过知识库约束演示文稿生成智能体,让它不再编造幻灯片

Reddit r/AI_Agents · 2026-07-24

一位开发者分享了如何通过检索纪律将智能体锚定到知识库(而非使用更好的模型)来解决自动幻灯片生成中的幻觉问题。该方法将检索与写作分离,并在渲染前强制执行来源检查。

0 人收藏 0 人点赞
#grounding

少复制,多扎根:通过基于证据感知的强化学习克服长上下文推理中的重复复制

arXiv cs.CL · 2026-07-22 缓存

本文识别了长上下文推理大型语言模型中的重复复制问题,并提出GEAR,一种奖励塑造方法,通过奖励与关键证据的重叠并惩罚无关上下文复制来改进扎根,实现了高达+4.6平均分的持续改进。

0 人收藏 0 人点赞
#grounding

在紧凑世界模型中空间关系的接地:指令泄露与无目标动态修复

arXiv cs.AI · 2026-07-09 缓存

本文识别了在用于空间关系的目标条件紧凑世界模型中的一种混淆因素——'指令泄露',即模型通过转录指令而非真正接地关系来达到高精度。作者提出了一种检测协议和修复方法,该方法从动态中移除目标并监督读取路径,从而恢复真正的接地。

0 人收藏 0 人点赞
#grounding

本地LLM在适配法律文档时持续自信地产生虚构引用——是否有接地/模型/流水线的思路?

Reddit r/LocalLLaMA · 2026-07-06

用户报告称,本地LLM在适配法律文档时以高自信度虚构引用,并寻求关于如何通过接地、模型或流水线思路来缓解此问题的建议。

0 人收藏 0 人点赞
#grounding

DigitalCoach:人机与自主计算机使用辅导中的沟通与基础差距

arXiv cs.AI · 2026-07-02 缓存

介绍了DigitalCoach,一个包含72场人类专家-新手计算机使用辅导课程的多模态数据集,并评估了最先进模型教授软件技能的能力。模型倾向于直接给出指令而不提供解释或视觉基础,而人类教练则提供更具适应性的指导。

0 人收藏 0 人点赞
#grounding

LabGuard:将自然语言实验室规则转化为具身实验室代理的运行时防护

arXiv cs.AI · 2026-07-01 缓存

LabGuard 引入了一个框架,将自然语言实验室安全规则转化为具身代理的可执行运行时监控器,在不影响任务成功率的情况下,将不安全事件从 39.5% 降至 23.8%。

0 人收藏 0 人点赞
#grounding

看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础

arXiv cs.CL · 2026-07-01 缓存

本文研究了视觉-语言模型在非对称对话中能否区分潜在共同基础与已确立共同基础。在MapTask数据上的实验表明,提供任务相关的地图内容(视觉或文本)会使模型倾向于过度预测对齐,因为它们依赖于静态指示范例而非通过对话历史追踪共同基础的确立过程。

0 人收藏 0 人点赞
#grounding

我们向十个模型提出了一个设计问题:达成正确答案的最佳方式是什么?它们没有选边站队——而是针对每种问题推荐了合适的工具。RoundTable 已有其一,于是我们构建了另一个。

Reddit r/artificial · 2026-06-26 缓存

十个 AI 模型被问及回答问题的最佳方式;它们推荐针对高风险决策采用委员会模式,针对事实查询采用基于来源的事实核查器。这促使 RoundTable 构建了 'Check mode',一项将强大模型与基于网页的事实核查器配对的新功能。

0 人收藏 0 人点赞
#grounding

GAVEL:有依据的描述错误验证与定位

arXiv cs.CL · 2026-06-26 缓存

GAVEL 提出了一个新任务,用于验证、解释和定位图像-文本对中的错误,并附带一个数据集和基准。一个监督基线显示出相对于强闭源模型的改进。

0 人收藏 0 人点赞
#grounding

先定位后排序:重新审视基于知识的VQA中的免训练实体识别

arXiv cs.CL · 2026-06-24 缓存

本文提出了一种免训练的“先识别后回答”(IBA)框架,用于基于知识的视觉问答(KB-VQA),该框架将实体识别与证据排序解耦,在降低复杂度的同时优于微调的多模态检索增强生成基线。

0 人收藏 0 人点赞
#grounding

DiagFlowBench: 评估语言模型在基于流程的诊断对话中如何处理非程序输入

arXiv cs.AI · 2026-06-17 缓存

本文介绍了DiagFlowBench,这是一个包含1,676个多轮诊断对话的基准数据集,这些对话源自工业流程图,旨在评估语言模型处理非程序输入及避免给出不恰当建议的能力。

0 人收藏 0 人点赞
#grounding

先见后思:解耦感知与推理实现抗捷径的多模态在策略自蒸馏

Hugging Face Daily Papers · 2026-06-17 缓存

本文介绍了ViGOS,一种多模态在策略自蒸馏方法,通过让学生模型先产生视觉描述再进行推理来解耦感知与推理,减少对捷径的依赖并改善图像接地行为。

0 人收藏 0 人点赞
#grounding

视觉具象化推理

Hugging Face Daily Papers · 2026-06-15 缓存

本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈