hallucination

标签

Cards List
#hallucination

AI 自信犯错的程度远超人们想象,不服来辩

Reddit r/ArtificialInteligence ↗ · 2026-08-12

一位用户分享了对 AI 模型的担忧:AI 在数据单薄或含糊不清时,也能以与数据充分时相同的自信呈现结论。文中举了一个例子:一条仅在 200 条评论中出现两次的投诉,被列为头号关注点。文章质疑这是否是一个可通过提示词修复的问题,还是一个需要人工核验的根本性局限。

0 人收藏 0 人点赞
#hallucination

Gemma 和 Qwen 模型能否通过观察自己的 logprobs 来发现幻觉?

Reddit r/LocalLLaMA ↗ · 2026-08-11

作者分享了使用自定义 WebUI 让 Gemma 和 Qwen 模型检查自己的 logprobs 来检测幻觉的实验。初步观察表明,首次回忆的 token 概率可以指示不确定性,尽管两个模型都难以读取自己的 logprobs。

0 人收藏 0 人点赞
#hallucination

抽象摘要中关系级幻觉评估的基于依据的分解框架

arXiv cs.CL ↗ · 2026-08-11 缓存

本文提出了一个基于依据的、可分解的框架,用于评估抽象式摘要中的关系级幻觉,引入了标准化的关系幻觉指数(RHI),并带有语言感知的关系抽取增强。

0 人收藏 0 人点赞
#hallucination

多模态大语言模型的统一幻觉模糊测试

arXiv cs.CL ↗ · 2026-08-11 缓存

本文介绍了UniHall,一个基于统一分类法的细粒度幻觉基准,以及自适多模态模糊测试(SAMF),一个用于多模态LLM的自进化压力测试框架。实验表明,最先进的模型在模糊测试下性能显著下降,并揭示了有用性与幻觉之间的权衡。

0 人收藏 0 人点赞
#hallucination

REIN:通过反思与弃权对齐弥合推理与可靠性之间的差距

arXiv cs.AI ↗ · 2026-08-11 缓存

本文介绍了REIN,一种对齐框架,通过训练大型推理模型在回答前进行明确反思,并在知识不足时主动弃权,从而减少幻觉。实验表明,REIN在多个基准上持续提升选择性准确率并减少幻觉。

0 人收藏 0 人点赞
#hallucination

Claude语音模式做了一些令人担忧的事情

Reddit r/ArtificialInteligence ↗ · 2026-08-10

一位用户报告称,Claude的语音模式产生了一个可疑的工具调用结果,其中包含一条明显的提示注入消息,声称来自Anthropic的安全团队,要求访问敏感文件。

0 人收藏 0 人点赞
#hallucination

不要分类,要幻觉!

Hacker News Top ↗ · 2026-08-10 缓存

本文介绍了一种使用LLM对电子商务查询进行分类的技术,其做法是让模型“幻觉”出假设性分类,再利用嵌入将其映射到真实分类体系,这比受限的结构化输出更便宜、也更简单。

0 人收藏 0 人点赞
#hallucination

我测试了32个模型的提取能力,结果令人惊讶

Reddit r/AI_Agents ↗ · 2026-08-06

一位开发者对32个本地模型在智能体记忆的事实提取上进行了基准测试,表明F1分数掩盖了一个关键失败模式:分数相近的模型在“应输出空结果”的输入上编造事实的频率差异巨大。文章认为,智能体记忆评估必须包含空输出和撤回(retraction)案例。

0 人收藏 0 人点赞
#hallucination

通过语义等价的对抗性攻击诱发LLM的内在幻觉

arXiv cs.CL ↗ · 2026-08-06 缓存

本文提出了一种利用语义等价的对抗性扰动来诱发LLM内在幻觉的框架,表明即使保持查询含义不变,最先进的模型在上下文忠实度上也会显著下降。

0 人收藏 0 人点赞
#hallucination

棋盘上的幻觉:工具增强的LLM国际象棋评论评估

arXiv cs.CL ↗ · 2026-08-06 缓存

本文介绍了ACT-Eval,一个用于LLM国际象棋评论的工具增强评估框架,并发布了包含325个局面-走法对的基准数据集。研究发现,事实性幻觉在LLM国际象棋评论中仍然普遍存在,而工具增强能够提高事实正确性,但并未提升专家级战略覆盖度。

0 人收藏 0 人点赞
#hallucination

FACTWASH:捕捉将传闻洗成事实的AI改写

arXiv cs.CL ↗ · 2026-08-05 缓存

介绍了factwash,一个开源的写入时门控,它通过去除来源归属、模糊限制语或时间语境,确定性地捕捉将传闻变成事实的AI改写。本文分析了何时简单检查就足够、何时需要LLM见证者,并在大型标注语料库上评估了该方法。

0 人收藏 0 人点赞
#hallucination

@BenjaminDEKR:谷歌内置的AI Overview问答机器人刚刚告诉我它是OpenAI制造的。

X AI KOLs Timeline ↗ · 2026-08-04 缓存

一位用户分享称,谷歌的AI Overview问答机器人声称自己是由OpenAI制造的,凸显了该AI系统出现幻觉或错误归因的问题。

0 人收藏 0 人点赞
#hallucination

GeoArbiter:遥感多模态大语言模型的可验证性引导接地

arXiv cs.LG ↗ · 2026-08-04 缓存

GeoArbiter 提出了一种免训练流程,选择性地将图像无法验证的地理事实注入遥感多模态大语言模型,以减少知识幻觉,同时保留检索准确率的提升。

0 人收藏 0 人点赞
#hallucination

Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

arXiv cs.LG ↗ · 2026-08-04 缓存

This paper proves that using error-penalized scoring rules with abstention as a discrete action can kill both the reward gradient and the KL anchor, causing models to collapse toward refusing everything. It proposes a structural repair — training a mandatory confidence report — and validates the mechanism with simulations and language model experiments.

0 人收藏 0 人点赞
#hallucination

Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

arXiv cs.CL ↗ · 2026-08-03 缓存

This paper characterizes 'futile reasoning' in large language models, where models produce superficially valid but incorrect reasoning on tasks beyond their capability. They introduce CaRL, a capability-aligned reinforcement learning method that trains LLMs to abstain from futile reasoning while preserving performance.

0 人收藏 0 人点赞
#hallucination

形式主义陷阱:LLM-as-a-Judge 评估器是否在社会负载下被共识模仿所蒙蔽?

arXiv cs.CL ↗ · 2026-08-03 缓存

本文引入了“智能体形式主义陷阱”和评估失调指数,展示了 LLM-as-a-Judge 系统如何被结构形式主义和共识模仿所误导,而非基于语义真相,基于跨多个领域的 22,500 条轨迹。

0 人收藏 0 人点赞
#hallucination

自动驾驶 VLM 中用于可验证推理的未来轨迹延迟暴露

Hugging Face Daily Papers ↗ · 2026-08-03 缓存

介绍了 AD-MCQ 和 DEFT-RLVR,一种用于自动驾驶 VLM 可验证推理的方法,将未来轨迹暴露延迟到决策后验证,从而提高推理忠实度并减少幻觉。

0 人收藏 0 人点赞
#hallucination

我的个人AI基准测试:“生成一个带有哈布斯堡下颌的青蛙SVG。”

Hacker News Top ↗ · 2026-08-02 缓存

一项个人AI基准测试要求模型生成一个带有哈布斯堡下颌的青蛙SVG,结果发现模型添加了大量添油加醋的内容,编造了皇室身份和医学评论,超出了字面请求。

0 人收藏 0 人点赞
#hallucination

欧盟《人工智能法案》将未披露AI生成内容(尤其是幻觉内容)定为非法,且代价高昂。

Reddit r/artificial ↗ · 2026-08-02

欧盟《人工智能法案》第50条生效,要求公开涉及公共利益事项的AI生成文本,违规将面临罚款。文章重点介绍了普华永道和德勤等咨询公司使用幻觉AI内容并面临法律后果的案例。

0 人收藏 0 人点赞
#hallucination

探索“Dario和Amanda”提示词

Reddit r/singularity ↗ · 2026-07-31 缓存

对一个奇怪提示词的探索,该提示词导致Claude Opus 5产生幻觉并重现类似于Anthropic用户与员工之间泄露的私人聊天内容,引发了对训练数据和AI行为的质疑。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈