标签
一位用户分享了对 AI 模型的担忧:AI 在数据单薄或含糊不清时,也能以与数据充分时相同的自信呈现结论。文中举了一个例子:一条仅在 200 条评论中出现两次的投诉,被列为头号关注点。文章质疑这是否是一个可通过提示词修复的问题,还是一个需要人工核验的根本性局限。
作者分享了使用自定义 WebUI 让 Gemma 和 Qwen 模型检查自己的 logprobs 来检测幻觉的实验。初步观察表明,首次回忆的 token 概率可以指示不确定性,尽管两个模型都难以读取自己的 logprobs。
本文提出了一个基于依据的、可分解的框架,用于评估抽象式摘要中的关系级幻觉,引入了标准化的关系幻觉指数(RHI),并带有语言感知的关系抽取增强。
本文介绍了UniHall,一个基于统一分类法的细粒度幻觉基准,以及自适多模态模糊测试(SAMF),一个用于多模态LLM的自进化压力测试框架。实验表明,最先进的模型在模糊测试下性能显著下降,并揭示了有用性与幻觉之间的权衡。
本文介绍了REIN,一种对齐框架,通过训练大型推理模型在回答前进行明确反思,并在知识不足时主动弃权,从而减少幻觉。实验表明,REIN在多个基准上持续提升选择性准确率并减少幻觉。
一位用户报告称,Claude的语音模式产生了一个可疑的工具调用结果,其中包含一条明显的提示注入消息,声称来自Anthropic的安全团队,要求访问敏感文件。
本文介绍了一种使用LLM对电子商务查询进行分类的技术,其做法是让模型“幻觉”出假设性分类,再利用嵌入将其映射到真实分类体系,这比受限的结构化输出更便宜、也更简单。
一位开发者对32个本地模型在智能体记忆的事实提取上进行了基准测试,表明F1分数掩盖了一个关键失败模式:分数相近的模型在“应输出空结果”的输入上编造事实的频率差异巨大。文章认为,智能体记忆评估必须包含空输出和撤回(retraction)案例。
本文提出了一种利用语义等价的对抗性扰动来诱发LLM内在幻觉的框架,表明即使保持查询含义不变,最先进的模型在上下文忠实度上也会显著下降。
本文介绍了ACT-Eval,一个用于LLM国际象棋评论的工具增强评估框架,并发布了包含325个局面-走法对的基准数据集。研究发现,事实性幻觉在LLM国际象棋评论中仍然普遍存在,而工具增强能够提高事实正确性,但并未提升专家级战略覆盖度。
介绍了factwash,一个开源的写入时门控,它通过去除来源归属、模糊限制语或时间语境,确定性地捕捉将传闻变成事实的AI改写。本文分析了何时简单检查就足够、何时需要LLM见证者,并在大型标注语料库上评估了该方法。
一位用户分享称,谷歌的AI Overview问答机器人声称自己是由OpenAI制造的,凸显了该AI系统出现幻觉或错误归因的问题。
GeoArbiter 提出了一种免训练流程,选择性地将图像无法验证的地理事实注入遥感多模态大语言模型,以减少知识幻觉,同时保留检索准确率的提升。
This paper proves that using error-penalized scoring rules with abstention as a discrete action can kill both the reward gradient and the KL anchor, causing models to collapse toward refusing everything. It proposes a structural repair — training a mandatory confidence report — and validates the mechanism with simulations and language model experiments.
This paper characterizes 'futile reasoning' in large language models, where models produce superficially valid but incorrect reasoning on tasks beyond their capability. They introduce CaRL, a capability-aligned reinforcement learning method that trains LLMs to abstain from futile reasoning while preserving performance.
本文引入了“智能体形式主义陷阱”和评估失调指数,展示了 LLM-as-a-Judge 系统如何被结构形式主义和共识模仿所误导,而非基于语义真相,基于跨多个领域的 22,500 条轨迹。
介绍了 AD-MCQ 和 DEFT-RLVR,一种用于自动驾驶 VLM 可验证推理的方法,将未来轨迹暴露延迟到决策后验证,从而提高推理忠实度并减少幻觉。
一项个人AI基准测试要求模型生成一个带有哈布斯堡下颌的青蛙SVG,结果发现模型添加了大量添油加醋的内容,编造了皇室身份和医学评论,超出了字面请求。
欧盟《人工智能法案》第50条生效,要求公开涉及公共利益事项的AI生成文本,违规将面临罚款。文章重点介绍了普华永道和德勤等咨询公司使用幻觉AI内容并面临法律后果的案例。
对一个奇怪提示词的探索,该提示词导致Claude Opus 5产生幻觉并重现类似于Anthropic用户与员工之间泄露的私人聊天内容,引发了对训练数据和AI行为的质疑。