hallucinations

标签

Cards List
#hallucinations

为什么在知识库看似正确的情况下,AI 仍然会出错?

Reddit r/AI_Agents ↗ · 2026-07-06

本文探讨了为什么即使底层知识库看起来准确,AI系统仍然会产生错误的输出。

0 人收藏 0 人点赞
#hallucinations

AI经常连非常基础的事实都弄错。模型关注的是平均值——而不是精确答案

Reddit r/ArtificialInteligence ↗ · 2026-07-06

用户报告称,AI模型Gemini和Claude在旅行中提供了错误的公交时刻表信息,这些模型承认它们给出的是近似答案而非精确事实,这凸显了可靠性问题。

0 人收藏 0 人点赞
#hallucinations

RAG 幻觉烦得要命

Reddit r/AI_Agents ↗ · 2026-07-02

团队发现 80% 的 RAG 幻觉是由检索不佳导致的,而非生成模型的问题,强调需要分别评估检索与生成环节,才能有效调试错误答案。

0 人收藏 0 人点赞
#hallucinations

@VikParuchuri: OCR幻觉会污染下游工作流。我们构建了研究驱动的防护措施,将幻觉减少到接近…

X AI KOLs Following ↗ · 2026-07-02 缓存

Vik Paruchuri宣布了研究驱动的防护措施,在其基准测试中将OCR幻觉降至接近零,并为任何残留错误提供单词级边界框和置信度分数。

0 人收藏 0 人点赞
#hallucinations

有人用Gemma4:31b而不是Qwen3.6:27b或35b(a10)吗?

Reddit r/LocalLLaMA ↗ · 2026-06-30

用户在opencode中对比Gemma4:31b与Qwen3.6:27b/35b(a10)用于Python脚本编写,尽管Gemma4有些固执,但因其在拼写错误方面幻觉问题较少而更受偏爱。

0 人收藏 0 人点赞
#hallucinations

在极限中生成,含有无限多个幻觉

arXiv cs.CL ↗ · 2026-06-30 缓存

本文分析了极限中的语言生成,引入了一个精度概念来研究召回率-精度的权衡。研究表明,当对手隐藏大部分目标语言时,允许无限多个幻觉(频率递减)可以提高召回率。

0 人收藏 0 人点赞
#hallucinations

AI Overviews 频繁出错

Reddit r/ArtificialInteligence ↗ · 2026-06-29

AI Overviews,谷歌的AI搜索功能,频繁生成错误答案,引发批评。

0 人收藏 0 人点赞
#hallucinations

问题不在于AI犯错,而在于它犯错时如此自信

Reddit r/ArtificialInteligence ↗ · 2026-06-29

讨论了AI模型以高置信度产生错误答案的问题,强调了AI输出中的过度自信问题。

0 人收藏 0 人点赞
#hallucinations

AI儿童图书:身体恐怖版

Hacker News Top ↗ · 2026-06-26 缓存

分析亚马逊上的AI生成儿童书籍,指出普遍存在的质量问题和怪异的视觉错误(即“身体恐怖”),这些问题削弱了先进AI模型的前景。

0 人收藏 0 人点赞
#hallucinations

我对8个LLM在医疗记录方面进行了基准测试。幻觉罕见;遗漏需关注。

Reddit r/LocalLLaMA ↗ · 2026-06-23

对8个LLM在医疗记录中的基准测试发现,幻觉很少,但遗漏需要引起注意。

0 人收藏 0 人点赞
#hallucinations

幻觉 = 想象力

Reddit r/ArtificialInteligence ↗ · 2026-06-18

一位开发者在构建AI代理封装系统时发现,代理对用户回复的幻觉实际上有助于解决问题,并提议将此类幻觉视为想象中的事件而非错误。

0 人收藏 0 人点赞
#hallucinations

@kaifulee: 以下是我如何使用 Claude 减少谄媚、妥协、幻觉和猜测的方法。很多人抱怨…

X AI KOLs Following ↗ · 2026-06-18 缓存

李开复分享了一个针对 Claude 的详细指令提示,强制按类型、置信度标记声明,反谄媚规则,拒绝捏造,旨在减少谄媚、妥协、幻觉和猜测。

0 人收藏 0 人点赞
#hallucinations

Probably 获得 900 万美元融资,构建更可靠的人工智能

TechCrunch AI ↗ · 2026-06-16 缓存

Probably 从 Andreessen Horowitz 获得 900 万美元种子轮融资,通过确定性验证器系统捕获 LLM 幻觉,构建更可靠的人工智能系统,使小型模型能够在本地硬件上运行。

0 人收藏 0 人点赞
#hallucinations

法院如何应对AI生成诉讼的激增

MIT Technology Review ↗ · 2026-06-04 缓存

一项针对450万联邦民事案件的新研究发现,AI正推动自辩诉讼激增,AI检测到的文本比例从2023年的1%上升至2026年的18%。虽然AI帮助诉讼当事人更清晰地表达论点,但也引入了虚假引用,并引发关于聊天机器人因提供不良法律建议而需承担责任的合法性问题。

0 人收藏 0 人点赞
#hallucinations

当AI代理被赋予金融数据或你的资金的真实API访问权限时,它做过的最离谱的事情是什么?

Reddit r/AI_Agents ↗ · 2026-06-03

一位开发者讲述了这样一个故事:一个拥有真实金融API访问权限的AI代理试图幻觉出一笔批量转账到死钱包,仅因执行层的护栏阻止了它。这个故事凸显了让LLM接触真实资金的风险。

0 人收藏 0 人点赞
#hallucinations

毒性幻觉:扰动提示并追踪LLM电路

arXiv cs.CL ↗ · 2026-06-01 缓存

本文研究了提示中的毒性词汇扰动如何降低LLM的事实准确性并增加不确定性,并使用归因图分析追踪内部变化。研究发现,增加毒性会放大对扰动敏感的变异节点,而核心推理节点保持不变。

0 人收藏 0 人点赞
#hallucinations

CanLegalRAGBench: 评估加拿大判例法上的检索增强生成

arXiv cs.CL ↗ · 2026-06-01 缓存

介绍了CanLegalRAGBench,这是一个基于真实查询和专家标注答案来评估加拿大判例法上检索增强生成的基准。评估显示对设计选择敏感、开源嵌入模型具有竞争力,以及生成答案中持续存在的幻觉问题。

0 人收藏 0 人点赞
#hallucinations

Ernst & Young 发布的网络安全报告充满幻觉

Hacker News Top ↗ · 2026-05-30 缓存

GPTZero 调查了 Ernst & Young Canada 关于忠诚度欺诈的网络安全报告,发现其中包含大量幻觉引用和 AI 生成的文本,突显了咨询报告中'氛围引用'的泛滥。

0 人收藏 0 人点赞
#hallucinations

我的AI智能体自信地给出了完全错误的信息。以下是我的收获。

Reddit r/AI_Agents ↗ · 2026-05-30

一位开发者分享了其AI智能体产生幻觉数据的亲身经历,以及关于验证和提示具体性的教训。

0 人收藏 0 人点赞
#hallucinations

生产构建基准测试

Reddit r/AI_Agents ↗ · 2026-05-29

讨论如何对生产构建进行基准测试和分级,重点关注关键性能指标,如上下文漂移、幻觉和治理。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈