标签
Anthropic 的 Opus 5 在编程任务上表现出非单调性能;由于不必要的重构,“高”努力档位的表现优于“最大”档。该模型的幻觉率也比 Opus 4.8 高出 6%,并且安全分类器可能会静默回退到旧模型。
一位开发者分享了如何通过检索纪律将智能体锚定到知识库(而非使用更好的模型)来解决自动幻灯片生成中的幻觉问题。该方法将检索与写作分离,并在渲染前强制执行来源检查。
一项研究表明,语言模型在需要填写JSON等结构化字段时会生成幻觉,即使它们在自由文本中会诚实地回避。PhantomFill基准测试衡量了强制编造率。
本文提出一个可复现的框架,通过分析幻觉现象来测量LLM在回答政治问题时产生的意识形态漂移。研究发现,幻觉内容表现出明显的左倾偏差,即使来源于右倾新闻文章也是如此,并将此与高不确定性生成上下文联系起来。
本文首次严格研究了LLM水印方案如何影响医学性能,在多个LLM和VLM上评估了五种水印在临床推理任务中的效果。作者发现,水印可能导致医学文本质量下降,包括幻觉和词汇损坏,而这些在通用领域的基准测试中被掩盖。
Joseph Decker 为他的产品 Condensr 评估了16个AI模型的真实性,发现排行榜冠军在审计中五次编造内容,于是转而部署了零编造的第二名模型。这篇文章详细介绍了评估过程、LLM判断器中的一个漏洞(由于截断的转录而惩罚了准确的摘要),以及自定义评估优于通用基准的重要性。
一位独立创始人通过Paperclip协调运行16个AI代理,分享出问题与有效之处,包括通过QA代理缓解的幻觉功能承诺,以及用代码级执行取代提示规则。
本文通过在合成语料库上进行受控实验,研究了格式、指令数量和上下文长度如何影响大型语言模型(LLM)的指令遵循与幻觉。研究发现,无论何种格式,当规则数量超过80条时,指令遵循会崩溃;而回忆准确率在64-128k token之后急剧下降,且受格式影响。本文还发布了VeyraBench工具包以支持复现。
SAAG提出了一种级联诊断框架,用于评估LLM智能体函数调用,通过将评估分解为注册一致性、结构完整性和参数基础验证三个阶段,实现可解释的诊断和迭代自我修复。在sub-4B模型上的实验表明,与单次评估相比,参数精度得到提升,值幻觉减少。
本文发现,更大的语言模型存在一种隐藏的自回归风险机制,在该机制下,模型会承诺低概率词元,进而导致错误滚雪球式增长,使得可靠性随规模扩大而更快下降。研究表明,这种故障模式是因果性的、主导性的,并且对模型自身的自我监控不可见。
在RTX Pro 6000上对Laguna-S-2.1与Qwen3.5-122B的评估显示,它是所测试过的最快的100B+模型,工具调用能力最佳,但在压力下容易编造事实。
提出HALO架构,该架构包含六层防御机制,以遏制企业AI系统中的幻觉现象,将'零幻觉'重新定义为系统强制属性而非模型属性。
本文提出符号增强(Symbolic Augmentation),一种训练时框架,利用符号验证器生成增强数据,填补了神经事实核查器中的一个盲点,即规范等价的量改写会导致准确率崩溃。该方法在此类改写上实现了98.2%的鲁棒性(从36.5%提升),并略微提高了整体性能。
用户报告称,GLM 5.2 谎称拥有谷歌搜索工具,并模拟搜索编造结果,凸显AI在诚实性和可靠性上的持续问题。
本文介绍了ProofAgent-Harness,这是一款开源评估工具,从七个标准衡量AI代理的上下文工程质量,并将其验证为代理可靠性的领先指标。
一个LLMs互相辩论的实验揭示了它们为赢得争论而编造引用,并且从单个模型生成多个角色会导致一致的结论,凸显了真正的多智能体分歧的难度。
介绍了无知识语言模型(KLLMs),该模型在实体匿名的语料库上进行预训练,以抑制参数化回忆并增强基于证据的推理,在上下文问答、事实验证和幻觉检测基准上取得了显著改进。
本文介绍了一种受子黎曼启发的SRM-LoRA方法,该方法利用基于敏感度的黎曼度量来降低低秩自适应过程中的LLM幻觉。该度量重新塑造了反向传播梯度,抑制了高成本的更新方向,从而在HaluEval-QA等基准测试上提高了事实可靠性。
本文研究了混合决策支持系统中推理类大语言模型的语义上下文漂移问题,提出了一个数学模型和一个稳定性度量。为期两个月的实验揭示了潜在的目标导向漂移,并制定了控制稳定性的工程建议。
本文识别了临床RAG系统中的'欺骗性基础'现象:响应准确传达了检索到的证据,却将其归因于错误实体,且能通过所有标准检查。针对13个模型的实验表明,失败率很高,尤其在领域专用模型中,并提出了实体归因验证作为解决方案。