标签
InSight-doc 是一个面向长文档理解的智能体视觉感知框架,在推理过程中自适应地分配视觉分辨率,在提高文档 VQA 基准准确率的同时减少幻觉和推理延迟。该论文发布了 8B 模型、数据集和代码。
GrAInS 是一种基于对比梯度的归因方法,利用积分梯度识别影响最大的词元,并构建引导向量,在推理时对大语言模型(LLM)和视觉语言模型(VLM)进行引导,从而提升真实性并减少幻觉,同时不损害流畅性。
来自清华大学和华南理工大学的研究人员引入了原子任务图(ATG),这是一个框架,通过基于有向图的规划和内部模拟,大幅降低幻觉率,使7B-8B开源模型在不进行微调的情况下,在复杂智能体基准测试中超越GPT-4。
一位创始人宣布推出Check,这是一个面向AI智能体的SaaS反幻觉层,可将幻觉减少至少50%,并声称它能释放AI的真正能力。
Neural_avb 强调 Minimax M3 的 RLM 如何使用带有 pydantic 契约的子代理群进行类型检查和模式验证,从而降低幻觉率和失败的子代理调用。
Visual Para-Thinker++提出了一种用于视觉推理的单策略多智能体框架,该框架使用角色条件化智能体(主智能体、工作智能体、汇总智能体)和专用训练方法,以减少幻觉并提高效率,在幻觉敏感基准测试上优于基线。
'温和编码'技术已在1500+次测试中得到经验验证,通过减少循环和幻觉,为多个模型(包括Kimi K2.6、GLM-5.1、GPT 5.4/5.5和Claude Sonnet 3.5/Opus 4.6)带来了显著改进(零回归)。
本文介绍了方差引导的分数调制(VSM),通过控制分数函数的平滑度来减少扩散模型中的幻觉,在保持图像质量的同时实现了高达约25%的减少。
Anthropic 发布了 Claude Opus 4.8,这是对其前代产品的一次小幅增量改进,重点提升了诚实性并降低了幻觉率,同时还引入了新功能,如对话中系统消息和更低的提示缓存最小值。
ProAct 是一种主动式智能体架构,利用空闲时间计算来预见用户需求,提升任务完成的效率与准确性。它引入了 ProActEval 基准测试,涵盖 40 个领域的 200 个场景,相比被动式基线取得了显著提升:所需交互轮次减少 14.8%,用户努力降低 11.7%,幻觉率下降 28.1%。
本文提出一种多轮提示验证方法,以提升量化LLM(LLaMA-3.1 8B)在定性分析中的性能,减少幻觉,并在不同量化级别(8位、4位、3位、2位)下提高稳定性。
提出了伪代码引导的结构化推理框架(PStar),该框架自适应地选择结构化伪代码推理路径以减少视觉语言模型中的幻觉,在POPE和MMStar基准测试上取得了最先进的分数。
Meta 的 Chain-of-Verification (CoVe) 提示技术通过四步自验证流程,将 LLM 的事实准确率提升 94%,无需微调即可减少幻觉。
本文介绍了 EnvSimBench,这是一个用于评估大语言模型在智能体训练中模拟环境能力的基准。它指出了当前大语言模型中存在的“状态变化悬崖”问题,并提出了一种约束驱动的流水线以减少幻觉和降低成本。
GigaAI 宣布推出新的幻觉纠正功能,将模型的幻觉率降至约1%,并声称其可靠性优于前沿模型。
OpenAI发布了GPT-5.3 Instant,这是ChatGPT最常用模型的更新。它改善了对话流畅度,减少了不必要的拒绝,并在高风险领域将幻觉率降低了高达26.8%。该更新基于用户反馈,专注于语气、相关性和实际可用性。