@HowToAI_: Meta 发现了一种技术,使 LLM 的准确率提升 94%。这彻底颠覆了我们之前的认知……

X AI KOLs Timeline 论文

摘要

Meta 的 Chain-of-Verification (CoVe) 提示技术通过四步自验证流程,将 LLM 的事实准确率提升 94%,无需微调即可减少幻觉。

Meta 发现了一种技术,使 LLM 的准确率提升 94%。 这彻底颠覆了我们之前对提示工程的所有认知。 它被称为 Chain-of-Verification (CoVe)。 不同于让 AI 直接回答提示,CoVe 强制模型通过一个四步流程来批判性地审视自己的思考: 1. 生成基线:AI 快速写一个粗略的初稿回复。 2. 规划验证:它扫描自己的初稿,列出一系列事实性问题用于自我交叉检验。 3. 独立执行:它完全脱离初稿来回答这些问题,以避免重复自身的偏差。 4. 最终修订:它仅使用验证过的事实重写整个答案。 传统提示告诉模型:“回答这个问题。” CoVe 告诉模型:“回答这个问题,找出你可能对我撒了哪些谎,秘密地进行自我事实核查,然后修正你的错误。” 结果是一场彻底的范式转变: - 在复杂数据任务上,事实准确性翻倍以上。 - 幻觉实体大幅减少。 - 无需任何微调。 - 立即适用于 GPT、Claude 和 Gemini。 它之所以有效,原因简单得几乎令人发笑。 LLM 不善于一次生成长篇且完全真实的叙述。但它们非常擅长回答简短、有针对性的验证问题。
查看原文
查看缓存全文

缓存时间: 2026/05/17 01:25

Meta 发现了一种让大语言模型准确率提升 94% 的技术。

它彻底颠覆了我们对提示工程的既有认知。

这项技术叫作链式验证(Chain-of-Verification,简称 CoVe)

传统的做法是让 AI 直接回答问题,而 CoVe 则强制模型通过一个四步流水线对自己的思维进行批判性审视:

  1. 生成基线:AI 先快速写出一份粗糙的初稿。
  2. 规划验证:它扫描自己的初稿,列出一系列事实性问题,用于自我拷问。
  3. 独立执行:它完全独立于初稿回答这些问题,从而避免重复自身的偏差。
  4. 最终修订:它仅依据验证过的事实重写整个答案。

传统提示告诉模型:“回答这个问题。”

CoVe 则告诉模型:“回答这个问题,然后找出你可能在哪些地方对我撒了谎,私下进行自我事实核查,最后修正你的错误。”

结果带来了彻底的范式转变:

  • 在处理复杂数据任务时,事实准确性提升超过一倍。
  • 大幅减少虚构实体的出现。
  • 完全无需微调。
  • 可立即在 GPT、Claude 和 Gemini 上工作。

其根本原理简单得近乎冒犯。

大语言模型在一次性生成冗长且完全准确的内容方面表现糟糕,但它们在回答简短、有针对性的验证问题时却异常精准。

相似文章

面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)

arXiv cs.AI

本文提出了一种针对高风险领域LLM输出的神经符号验证架构,结合形式化符号方法与神经语义分析。在一个医疗器械损伤评估系统上进行的评估显示,该架构对结构化实体的幻觉检测率超过83%,语义虚构的检测率达72%,报告创建时间缩短30%。