grounding

标签

Cards List
#grounding

ReGround:基于多模态证据的审稿意见定位

arXiv cs.CL ↗ · 2026-09-11 缓存

ReGround 是一个大规模数据集,用于将审稿意见定位到科学论文的多模态证据上,揭示了在检索任务中整合文本、表格和图表的重要性和挑战性。

0 人收藏 0 人点赞
#grounding

基于图谱的忠实P&ID推理:通过恢复证据图约束视觉语言模型

arXiv cs.LG ↗ · 2026-09-10 缓存

本文介绍了一种基于图谱的视觉语言模型工具,通过从图像中恢复证据图,来提高回答管道和仪表图拓扑问题的准确性。

0 人收藏 0 人点赞
#grounding

审计合成回忆录:测量LLM生成自传中相对于生活文档记录的场景级别虚构

arXiv cs.AI ↗ · 2026-08-26 缓存

本文审计了LLM生成的自传中相对于文档化真实语料库的场景级别虚构,发现96.7%的验证失败率,并贡献了一个可重复使用的审计工具和一个基础补救措施。

0 人收藏 0 人点赞
#grounding

V-Rubrics:基于评估准则的强化学习实现视觉忠实性

Hugging Face Daily Papers ↗ · 2026-08-26 缓存

提出一种基于评估准则的强化学习方法,通过将回答分解为原子命题,并从视觉忠实性、推理一致性和指令遵循度三个维度进行评分,从而提升视觉语言模型的视觉忠实性。

0 人收藏 0 人点赞
#grounding

@llama_index: 大多数文档提取API无法告知数据来源。对于ExtractBench,我们严格评估了溯源性:一个…

X AI KOLs Timeline ↗ · 2026-08-17 缓存

ExtractBench 是一个新的文档提取基准测试,严格评分溯源准确性,显示 VLMs 和编码代理缺乏证据,而 LlamaExtract Agentic Plus 以高性能领先于页面级和单词级指标。

0 人收藏 0 人点赞
#grounding

从拒绝到丰富:用于长文幻觉强化学习的评分标准奖励

arXiv cs.CL ↗ · 2026-08-14 缓存

本文研究了长文幻觉强化学习中基础支撑与覆盖范围之间的权衡,提出了基于评分标准的奖励来表示问题所需和可选的信息。对基础支撑、评分标准覆盖和相关性进行软性组合,可以在支持性和丰富性之间取得最佳平衡。

0 人收藏 0 人点赞
#grounding

LiquidAI/LFM2.5-VL-3B · Hugging Face

Reddit r/LocalLLaMA ↗ · 2026-08-12 缓存

LiquidAI releases LFM2.5-VL-3B, a 3B multimodal model for on-device deployment with improved OCR, grounding, and efficient inference, available in multiple formats including GGUF, ONNX, and MLX.

0 人收藏 0 人点赞
#grounding

LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge

Hugging Face Blog ↗ · 2026-08-12 缓存

LiquidAI announces LFM2.5-VL-3B, an efficient vision-language model for edge hardware with improved screen understanding, grounding, multi-image input, and function calling, trained with 4x more vision data and post-training via SFT and RL.

0 人收藏 0 人点赞
#grounding

Search-G1:通过基于表示的内部奖励实现有依据的搜索代理

arXiv cs.CL ↗ · 2026-08-11 缓存

Search-G1提出了一种面向搜索增强语言代理的基于表示的内部奖励框架,利用干预校准的读出机制来平衡检索必要性与证据依赖,从而在无需昂贵标注的情况下提高搜索效率。

0 人收藏 0 人点赞
#grounding

大型语言模型的地理空间概念探测:抽象性、组合性与接地

arXiv cs.CL ↗ · 2026-08-10 缓存

本文引入了一个以概念为中心的基准,用于探测LLM对方向、距离和拓扑等地理空间概念的理解,测试不同模型架构和规模下的抽象性、组合性与接地性。研究结果揭示了当前LLM在概念理解上的明显局限。

0 人收藏 0 人点赞
#grounding

Evidence-RL:迈向证据密集型视觉推理

Hugging Face Daily Papers ↗ · 2026-08-08 缓存

本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。

0 人收藏 0 人点赞
#grounding

GeoArbiter:遥感多模态大语言模型的可验证性引导接地

arXiv cs.LG ↗ · 2026-08-04 缓存

GeoArbiter 提出了一种免训练流程,选择性地将图像无法验证的地理事实注入遥感多模态大语言模型,以减少知识幻觉,同时保留检索准确率的提升。

0 人收藏 0 人点赞
#grounding

更好的语义搜索无法修复从不验证上下文的智能体

Reddit r/AI_Agents ↗ · 2026-08-03

文章认为,更好的语义搜索或更大的上下文窗口无法修复不可靠的AI智能体;相反,智能体必须在回答或行动之前重新打开原始来源以验证检索到的上下文。

0 人收藏 0 人点赞
#grounding

我们的AI助手对我们并不销售的东西说了“可以”,日志却无法告诉我原因

Reddit r/AI_Agents ↗ · 2026-07-31

本文回顾了一起AI助手错误确认服务的事件。故障排查发现知识库检索未被记录,导致无法将回答归因于检索到的上下文。文章强调,为验证回答的依据,需要对检索进行按对话轮次可追溯的日志记录。

0 人收藏 0 人点赞
#grounding

我在构建多智能体系统时犯了这5个错误,你可能也会犯

Reddit r/AI_Agents ↗ · 2026-07-31

作者分享了构建客户支持多智能体系统的经验,认为检索和落地失败(而非提示词或模型)是智能体产生幻觉的主要原因。作者列出了五项落地检查,并指出禁止无依据回答使升级率降低了40%。

0 人收藏 0 人点赞
#grounding

ExtractBench:面向模式引导的企业文档抽取基准

Hugging Face Daily Papers ↗ · 2026-07-31 缓存

ExtractBench 是一个用于模式引导的企业文档抽取的新基准,在 4,869 页企业文档上评估值准确率、记录完整性、溯源性和成本。作者发现,商业 VLM 在处理长文档时表现不佳,而编码智能体虽然更准确但成本较高;LlamaExtract AgenticPlus 在所有指标上均领先。

0 人收藏 0 人点赞
#grounding

RefCaptioner:多参考图像 grounded 视频字幕生成

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。

0 人收藏 0 人点赞
#grounding

CLBench-V: 从上下文基础到知识获取的多模态上下文学习评估

Hugging Face Daily Papers ↗ · 2026-07-28 缓存

CLBench-V是一个用于评估多模态上下文学习的基准,涵盖上下文基础、新信息应用和新知识学习。最佳模型仅达到0.2847,表明该任务仍然具有挑战性。

0 人收藏 0 人点赞
#grounding

我如何通过知识库约束演示文稿生成智能体,让它不再编造幻灯片

Reddit r/AI_Agents ↗ · 2026-07-24

一位开发者分享了如何通过检索纪律将智能体锚定到知识库(而非使用更好的模型)来解决自动幻灯片生成中的幻觉问题。该方法将检索与写作分离,并在渲染前强制执行来源检查。

0 人收藏 0 人点赞
#grounding

少复制,多扎根:通过基于证据感知的强化学习克服长上下文推理中的重复复制

arXiv cs.CL ↗ · 2026-07-22 缓存

本文识别了长上下文推理大型语言模型中的重复复制问题,并提出GEAR,一种奖励塑造方法,通过奖励与关键证据的重叠并惩罚无关上下文复制来改进扎根,实现了高达+4.6平均分的持续改进。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈