grounding

标签

Cards List
#grounding

在紧凑世界模型中空间关系的接地:指令泄露与无目标动态修复

arXiv cs.AI ↗ · 2026-07-09 缓存

本文识别了在用于空间关系的目标条件紧凑世界模型中的一种混淆因素——'指令泄露',即模型通过转录指令而非真正接地关系来达到高精度。作者提出了一种检测协议和修复方法,该方法从动态中移除目标并监督读取路径,从而恢复真正的接地。

0 人收藏 0 人点赞
#grounding

本地LLM在适配法律文档时持续自信地产生虚构引用——是否有接地/模型/流水线的思路?

Reddit r/LocalLLaMA ↗ · 2026-07-06

用户报告称,本地LLM在适配法律文档时以高自信度虚构引用,并寻求关于如何通过接地、模型或流水线思路来缓解此问题的建议。

0 人收藏 0 人点赞
#grounding

DigitalCoach:人机与自主计算机使用辅导中的沟通与基础差距

arXiv cs.AI ↗ · 2026-07-02 缓存

介绍了DigitalCoach,一个包含72场人类专家-新手计算机使用辅导课程的多模态数据集,并评估了最先进模型教授软件技能的能力。模型倾向于直接给出指令而不提供解释或视觉基础,而人类教练则提供更具适应性的指导。

0 人收藏 0 人点赞
#grounding

LabGuard:将自然语言实验室规则转化为具身实验室代理的运行时防护

arXiv cs.AI ↗ · 2026-07-01 缓存

LabGuard 引入了一个框架,将自然语言实验室安全规则转化为具身代理的可执行运行时监控器,在不影响任务成功率的情况下,将不安全事件从 39.5% 降至 23.8%。

0 人收藏 0 人点赞
#grounding

看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础

arXiv cs.CL ↗ · 2026-07-01 缓存

本文研究了视觉-语言模型在非对称对话中能否区分潜在共同基础与已确立共同基础。在MapTask数据上的实验表明,提供任务相关的地图内容(视觉或文本)会使模型倾向于过度预测对齐,因为它们依赖于静态指示范例而非通过对话历史追踪共同基础的确立过程。

0 人收藏 0 人点赞
#grounding

我们向十个模型提出了一个设计问题:达成正确答案的最佳方式是什么?它们没有选边站队——而是针对每种问题推荐了合适的工具。RoundTable 已有其一,于是我们构建了另一个。

Reddit r/artificial ↗ · 2026-06-26 缓存

十个 AI 模型被问及回答问题的最佳方式;它们推荐针对高风险决策采用委员会模式,针对事实查询采用基于来源的事实核查器。这促使 RoundTable 构建了 'Check mode',一项将强大模型与基于网页的事实核查器配对的新功能。

0 人收藏 0 人点赞
#grounding

GAVEL:有依据的描述错误验证与定位

arXiv cs.CL ↗ · 2026-06-26 缓存

GAVEL 提出了一个新任务,用于验证、解释和定位图像-文本对中的错误,并附带一个数据集和基准。一个监督基线显示出相对于强闭源模型的改进。

0 人收藏 0 人点赞
#grounding

先定位后排序:重新审视基于知识的VQA中的免训练实体识别

arXiv cs.CL ↗ · 2026-06-24 缓存

本文提出了一种免训练的“先识别后回答”(IBA)框架,用于基于知识的视觉问答(KB-VQA),该框架将实体识别与证据排序解耦,在降低复杂度的同时优于微调的多模态检索增强生成基线。

0 人收藏 0 人点赞
#grounding

DiagFlowBench: 评估语言模型在基于流程的诊断对话中如何处理非程序输入

arXiv cs.AI ↗ · 2026-06-17 缓存

本文介绍了DiagFlowBench,这是一个包含1,676个多轮诊断对话的基准数据集,这些对话源自工业流程图,旨在评估语言模型处理非程序输入及避免给出不恰当建议的能力。

0 人收藏 0 人点赞
#grounding

先见后思:解耦感知与推理实现抗捷径的多模态在策略自蒸馏

Hugging Face Daily Papers ↗ · 2026-06-17 缓存

本文介绍了ViGOS,一种多模态在策略自蒸馏方法,通过让学生模型先产生视觉描述再进行推理来解耦感知与推理,减少对捷径的依赖并改善图像接地行为。

0 人收藏 0 人点赞
#grounding

视觉具象化推理

Hugging Face Daily Papers ↗ · 2026-06-15 缓存

本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。

0 人收藏 0 人点赞
#grounding

帮助图表讲述它们的故事!基于论文的视频生成,解释复杂的科学图表

arXiv cs.CL ↗ · 2026-06-12 缓存

介绍了 MINARD,一个从科学图表及其论文生成带旁白、区域定位的讲解视频的流水线,以及 FigTalk 基准和新的定位指标。

0 人收藏 0 人点赞
#grounding

视觉语言模型是在“看”还是在“猜”?通过措辞控制的基准测试衡量并减少对文本先验的依赖

arXiv cs.CL ↗ · 2026-06-10 缓存

本文介绍了一个措辞控制的基准测试,用于衡量视觉语言模型在多大程度上依赖文本先验而非图像内容。在十一个模型上的实验表明,当文本泄漏最小时,性能显著下降,作者证明上下文学习和GRPO后训练可以减少这种依赖。

0 人收藏 0 人点赞
#grounding

Reroute,而非移除:面向视觉语言模型的可恢复视觉令牌路由

Hugging Face Daily Papers ↗ · 2026-06-10 缓存

提出Reroute,一种无需训练的视觉语言模型插件,用可恢复的路由替代不可逆的视觉令牌剪枝,允许令牌在后续阶段重新进入流水线,从而在激进的令牌缩减下提升接地性能,同时保持VQA性能。

0 人收藏 0 人点赞
#grounding

从执行结果自举文本到SQL的语义层

arXiv cs.CL ↗ · 2026-06-05 缓存

介绍GATE(从执行结果中测试后接地)方法,该方法从执行反馈中自举缺失的语义接地,以处理文本到SQL任务中未明确指定的用户短语,持续提升超越强基线。

0 人收藏 0 人点赞
#grounding

@DataChaz: NVIDIA 刚完成了一项疯狂之举:通过移除整个行业认为必不可少的步骤,将边界框检测速度提升至10倍。

X AI KOLs Timeline ↗ · 2026-06-01 缓存

NVIDIA研究人员开发了一种技术,通过消除VLM基础模型用于自动回归逐token预测的步骤,将边界框检测速度提升了10倍。

0 人收藏 0 人点赞
#grounding

通过物理交互涌现的世界模型语义表征,无需语言监督

arXiv cs.LG ↗ · 2026-05-29 缓存

本文表明,通过随机物理探索训练世界模型,能够在不依赖任何语言监督的情况下,使潜在表征编码出空间语义结构(方向和位置),突显物理几何作为组织原则。

0 人收藏 0 人点赞
#grounding

图对齐拓扑作为接地检测的归纳偏置

arXiv cs.CL ↗ · 2026-05-25 缓存

本文介绍了将图对齐拓扑作为接地检测的归纳偏置,使用图神经网络对参考信息与LLM输出之间的对齐结构进行建模。该方法在多个幻觉和问答数据集上取得了最先进的结果,性能优于GPT-4o。

0 人收藏 0 人点赞
#grounding

模型能建模,但不能绑定:文本到优化中的结构化接地

arXiv cs.LG ↗ · 2026-05-22 缓存

本文介绍了Text2Opt-Bench,一个可扩展的文本到优化基准,并发现大语言模型在“绑定”(问题数据接地)方面存在困难,而非“建模”(选择优化结构)。作者提出了BIND,一种简单的推理时方法,将数值数据外部化,显著提高了各模型的准确率。

0 人收藏 0 人点赞
#grounding

评估了一个RAG聊天机器人,最昂贵的模型表现最差。关于真正影响性能的因素的笔记。

Reddit r/LocalLLaMA ↗ · 2026-05-15

对RAG客户支持聊天机器人的详细评估揭示:检索问题常被误认为是LLM问题,启发式评估器具有误导性,去重可提升质量,严格基于文档的约束会在帮助性和准确性之间取舍,而模型扫查可在提升性能的同时大幅降低成本。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈