hallucination-reduction

标签

Cards List
#hallucination-reduction

InSight-doc:面向长文档理解的智能体视觉感知

Hugging Face Daily Papers · 2天前 缓存

InSight-doc 是一个面向长文档理解的智能体视觉感知框架,在推理过程中自适应地分配视觉分辨率,在提高文档 VQA 基准准确率的同时减少幻觉和推理延迟。该论文发布了 8B 模型、数据集和代码。

0 人收藏 0 人点赞
#hallucination-reduction

GrAInS:基于梯度的归因方法用于大语言模型和视觉语言模型的推理时引导

arXiv cs.CL · 2026-07-13 缓存

GrAInS 是一种基于对比梯度的归因方法,利用积分梯度识别影响最大的词元,并构建引导向量,在推理时对大语言模型(LLM)和视觉语言模型(VLM)进行引导,从而提升真实性并减少幻觉,同时不损害流畅性。

0 人收藏 0 人点赞
#hallucination-reduction

@alex_verem: 一组研究人员刚刚证明,你不需要更大的模型,你需要更聪明的计划。来自清华大学和……

X AI KOLs Timeline · 2026-07-11 缓存

来自清华大学和华南理工大学的研究人员引入了原子任务图(ATG),这是一个框架,通过基于有向图的规划和内部模拟,大幅降低幻觉率,使7B-8B开源模型在不进行微调的情况下,在复杂智能体基准测试中超越GPT-4。

0 人收藏 0 人点赞
#hallucination-reduction

Check:面向AI智能体的反幻觉层。

Reddit r/AI_Agents · 2026-06-28

一位创始人宣布推出Check,这是一个面向AI智能体的SaaS反幻觉层,可将幻觉减少至少50%,并声称它能释放AI的真正能力。

0 人收藏 0 人点赞
#hallucination-reduction

@neural_avb: 最酷的 RLM 轨迹之一,让我直呼“哇哦”——RLMs(Minimax M3)启动带有清晰 p… 的子代理群

X AI KOLs Timeline · 2026-06-08 缓存

Neural_avb 强调 Minimax M3 的 RLM 如何使用带有 pydantic 契约的子代理群进行类型检查和模式验证,从而降低幻觉率和失败的子代理调用。

0 人收藏 0 人点赞
#hallucination-reduction

Visual Para-Thinker++: 视觉推理的单策略多智能体框架

Hugging Face Daily Papers · 2026-06-08 缓存

Visual Para-Thinker++提出了一种用于视觉推理的单策略多智能体框架,该框架使用角色条件化智能体(主智能体、工作智能体、汇总智能体)和专用训练方法,以减少幻觉并提高效率,在幻觉敏感基准测试上优于基线。

0 人收藏 0 人点赞
#hallucination-reduction

更新:“温和编码”已被数学证明。1500+次测试运行显示Kimi K2.6有显著提升,GLM-5.1提升更大!GPT 5.4/5.5和Claude Sonnet 3.5/Opus 4.6也表现更佳,且全面无回归。

Reddit r/LocalLLaMA · 2026-05-29

'温和编码'技术已在1500+次测试中得到经验验证,通过减少循环和幻觉,为多个模型(包括Kimi K2.6、GLM-5.1、GPT 5.4/5.5和Claude Sonnet 3.5/Opus 4.6)带来了显著改进(零回归)。

0 人收藏 0 人点赞
#hallucination-reduction

扩散模型中减少幻觉的分数控制

Hugging Face Daily Papers · 2026-05-29 缓存

本文介绍了方差引导的分数调制(VSM),通过控制分数函数的平滑度来减少扩散模型中的幻觉,在保持图像质量的同时实现了高达约25%的减少。

0 人收藏 0 人点赞
#hallucination-reduction

Claude Opus 4.8:"微小但切实的改进"

Simon Willison's Blog · 2026-05-28 缓存

Anthropic 发布了 Claude Opus 4.8,这是对其前代产品的一次小幅增量改进,重点提升了诚实性并降低了幻觉率,同时还引入了新功能,如对话中系统消息和更低的提示缓存最小值。

0 人收藏 0 人点赞
#hallucination-reduction

预见与学习:在主动式智能体中释放空闲时间计算能力

Hugging Face Daily Papers · 2026-05-25 缓存

ProAct 是一种主动式智能体架构,利用空闲时间计算来预见用户需求,提升任务完成的效率与准确性。它引入了 ProActEval 基准测试,涵盖 40 个领域的 200 个场景,相比被动式基线取得了显著提升:所需交互轮次减少 14.8%,用户努力降低 11.7%,幻觉率下降 28.1%。

0 人收藏 0 人点赞
#hallucination-reduction

通过多轮提示验证提升量化模型在定性分析中的性能

arXiv cs.CL · 2026-05-21 缓存

本文提出一种多轮提示验证方法,以提升量化LLM(LLaMA-3.1 8B)在定性分析中的性能,减少幻觉,并在不同量化级别(8位、4位、3位、2位)下提高稳定性。

0 人收藏 0 人点赞
#hallucination-reduction

伪代码引导的结构化推理:实现视觉语言模型中可靠推理的自动化

arXiv cs.AI · 2026-05-20

提出了伪代码引导的结构化推理框架(PStar),该框架自适应地选择结构化伪代码推理路径以减少视觉语言模型中的幻觉,在POPE和MMStar基准测试上取得了最先进的分数。

0 人收藏 0 人点赞
#hallucination-reduction

@HowToAI_: Meta 发现了一种技术,使 LLM 的准确率提升 94%。这彻底颠覆了我们之前的认知……

X AI KOLs Timeline · 2026-05-16 缓存

Meta 的 Chain-of-Verification (CoVe) 提示技术通过四步自验证流程,将 LLM 的事实准确率提升 94%,无需微调即可减少幻觉。

0 人收藏 0 人点赞
#hallucination-reduction

EnvSimBench:用于评估和改善基于大语言模型的环境模拟的基准

arXiv cs.AI · 2026-05-11 缓存

本文介绍了 EnvSimBench,这是一个用于评估大语言模型在智能体训练中模拟环境能力的基准。它指出了当前大语言模型中存在的“状态变化悬崖”问题,并提出了一种约束驱动的流水线以减少幻觉和降低成本。

0 人收藏 0 人点赞
#hallucination-reduction

@GigaAI: 推出幻觉纠正功能。我们将幻觉率降低了70%。Giga的幻觉率约为1%。更胜一筹……

X AI KOLs Timeline · 2026-05-07 缓存

GigaAI 宣布推出新的幻觉纠正功能,将模型的幻觉率降至约1%,并声称其可靠性优于前沿模型。

0 人收藏 0 人点赞
#hallucination-reduction

GPT-5.3 Instant:更流畅、更实用的日常对话

OpenAI Blog · 2026-03-03 缓存

OpenAI发布了GPT-5.3 Instant,这是ChatGPT最常用模型的更新。它改善了对话流畅度,减少了不必要的拒绝,并在高风险领域将幻觉率降低了高达26.8%。该更新基于用户反馈,专注于语气、相关性和实际可用性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈