标签
用户报告称,AI模型Gemini和Claude在旅行中提供了错误的公交时刻表信息,这些模型承认它们给出的是近似答案而非精确事实,这凸显了可靠性问题。
团队发现 80% 的 RAG 幻觉是由检索不佳导致的,而非生成模型的问题,强调需要分别评估检索与生成环节,才能有效调试错误答案。
Vik Paruchuri宣布了研究驱动的防护措施,在其基准测试中将OCR幻觉降至接近零,并为任何残留错误提供单词级边界框和置信度分数。
用户在opencode中对比Gemma4:31b与Qwen3.6:27b/35b(a10)用于Python脚本编写,尽管Gemma4有些固执,但因其在拼写错误方面幻觉问题较少而更受偏爱。
本文分析了极限中的语言生成,引入了一个精度概念来研究召回率-精度的权衡。研究表明,当对手隐藏大部分目标语言时,允许无限多个幻觉(频率递减)可以提高召回率。
分析亚马逊上的AI生成儿童书籍,指出普遍存在的质量问题和怪异的视觉错误(即“身体恐怖”),这些问题削弱了先进AI模型的前景。
李开复分享了一个针对 Claude 的详细指令提示,强制按类型、置信度标记声明,反谄媚规则,拒绝捏造,旨在减少谄媚、妥协、幻觉和猜测。
Probably 从 Andreessen Horowitz 获得 900 万美元种子轮融资,通过确定性验证器系统捕获 LLM 幻觉,构建更可靠的人工智能系统,使小型模型能够在本地硬件上运行。
一项针对450万联邦民事案件的新研究发现,AI正推动自辩诉讼激增,AI检测到的文本比例从2023年的1%上升至2026年的18%。虽然AI帮助诉讼当事人更清晰地表达论点,但也引入了虚假引用,并引发关于聊天机器人因提供不良法律建议而需承担责任的合法性问题。
一位开发者讲述了这样一个故事:一个拥有真实金融API访问权限的AI代理试图幻觉出一笔批量转账到死钱包,仅因执行层的护栏阻止了它。这个故事凸显了让LLM接触真实资金的风险。
本文研究了提示中的毒性词汇扰动如何降低LLM的事实准确性并增加不确定性,并使用归因图分析追踪内部变化。研究发现,增加毒性会放大对扰动敏感的变异节点,而核心推理节点保持不变。
介绍了CanLegalRAGBench,这是一个基于真实查询和专家标注答案来评估加拿大判例法上检索增强生成的基准。评估显示对设计选择敏感、开源嵌入模型具有竞争力,以及生成答案中持续存在的幻觉问题。
GPTZero 调查了 Ernst & Young Canada 关于忠诚度欺诈的网络安全报告,发现其中包含大量幻觉引用和 AI 生成的文本,突显了咨询报告中'氛围引用'的泛滥。
一位开发者分享了其AI智能体产生幻觉数据的亲身经历,以及关于验证和提示具体性的教训。