标签
一位开发者对32个本地模型在智能体记忆的事实提取上进行了基准测试,表明F1分数掩盖了一个关键失败模式:分数相近的模型在“应输出空结果”的输入上编造事实的频率差异巨大。文章认为,智能体记忆评估必须包含空输出和撤回(retraction)案例。
本文提出了一种利用语义等价的对抗性扰动来诱发LLM内在幻觉的框架,表明即使保持查询含义不变,最先进的模型在上下文忠实度上也会显著下降。
本文介绍了ACT-Eval,一个用于LLM国际象棋评论的工具增强评估框架,并发布了包含325个局面-走法对的基准数据集。研究发现,事实性幻觉在LLM国际象棋评论中仍然普遍存在,而工具增强能够提高事实正确性,但并未提升专家级战略覆盖度。
介绍了factwash,一个开源的写入时门控,它通过去除来源归属、模糊限制语或时间语境,确定性地捕捉将传闻变成事实的AI改写。本文分析了何时简单检查就足够、何时需要LLM见证者,并在大型标注语料库上评估了该方法。
一位用户分享称,谷歌的AI Overview问答机器人声称自己是由OpenAI制造的,凸显了该AI系统出现幻觉或错误归因的问题。
GeoArbiter 提出了一种免训练流程,选择性地将图像无法验证的地理事实注入遥感多模态大语言模型,以减少知识幻觉,同时保留检索准确率的提升。
This paper proves that using error-penalized scoring rules with abstention as a discrete action can kill both the reward gradient and the KL anchor, causing models to collapse toward refusing everything. It proposes a structural repair — training a mandatory confidence report — and validates the mechanism with simulations and language model experiments.
This paper characterizes 'futile reasoning' in large language models, where models produce superficially valid but incorrect reasoning on tasks beyond their capability. They introduce CaRL, a capability-aligned reinforcement learning method that trains LLMs to abstain from futile reasoning while preserving performance.
本文引入了“智能体形式主义陷阱”和评估失调指数,展示了 LLM-as-a-Judge 系统如何被结构形式主义和共识模仿所误导,而非基于语义真相,基于跨多个领域的 22,500 条轨迹。
介绍了 AD-MCQ 和 DEFT-RLVR,一种用于自动驾驶 VLM 可验证推理的方法,将未来轨迹暴露延迟到决策后验证,从而提高推理忠实度并减少幻觉。
一项个人AI基准测试要求模型生成一个带有哈布斯堡下颌的青蛙SVG,结果发现模型添加了大量添油加醋的内容,编造了皇室身份和医学评论,超出了字面请求。
欧盟《人工智能法案》第50条生效,要求公开涉及公共利益事项的AI生成文本,违规将面临罚款。文章重点介绍了普华永道和德勤等咨询公司使用幻觉AI内容并面临法律后果的案例。
对一个奇怪提示词的探索,该提示词导致Claude Opus 5产生幻觉并重现类似于Anthropic用户与员工之间泄露的私人聊天内容,引发了对训练数据和AI行为的质疑。
一位具有编码背景的VP/PM分享了使用Claude Opus和Fable等LLM的实践经验,重点指出了模型在记忆、幻觉和原创性方面的局限,同时强调了人类直觉和领域专业知识不可替代的价值。
讨论验证智能体在长时间任务后输出结果的困难,并提出是否使用批评者智能体或可追溯性工具来确保可信度。
一个AI智能体利用自我验证技术,从一篇从未见过的研究论文中构建了知识图谱,以减少幻觉。
提出了三种注意力引导的大语言模型对比解码层选择策略,在TruthfulQA上相比DoLa基线提高了事实准确性。
本文提出了一种新颖的在线强化学习方法,通过设计兼顾事实精确性、细节丰富度和回答相关性的奖励函数,来提升推理大语言模型的事实准确性。在六个基准测试上,该方法将幻觉率降低了23.1个百分点。
本文首次系统研究了文档接地播客生成中的忠实度问题,提出了一个轮次级别的LLM作为评委的评估框架,以及一个与模型无关的捕获-修复方法,该方法能跨领域提高忠实度。
本研究评估了前沿和开放权重LLM在IMO 2026题目上的表现,证明像AutoFyn这样的专用工具链能显著提升次前沿模型的性能,不过在最难的题目上仍然存在幻觉问题。