我们是否在为更聪明的AI支付'推理税'?
摘要
本文探讨了AI模型中增强推理如何可能增加幻觉率,提出了'推理税'概念,并强调在企业应用中需要健壮的上下文治理。
更多的推理并不自动意味着更高的事实可靠性。OpenAI的评估产生了一个反直觉的结果:在PersonQA上,o3的幻觉率为33%,而o1为16%。在SimpleQA上,报告的幻觉率o3为51%,较小的o4-mini为79%。这些结果并不证明推理模型总是产生更多幻觉。它们确实显示了企业AI的重要一点:在许多任务上更强的推理性能并不能消除事实错误——有时甚至能让无根据的答案变得更精巧和令人信服。我们可以将这种操作风险视为'推理税':当模型被给予不足或治理不善的上下文时,额外的推理可能会扩展错误的前提,而不是纠正它。
为什么会发生这种情况?对大型推理模型的研究已经识别出两种相关的行为模式:
1 缺陷重复:一旦推理从错误的前提开始,模型可能会重复遵循相同错误逻辑的变体,而不是重新考虑前提。
2 思考-答案不匹配:模型的最终答案可能无法忠实反映其先前推理过程中得出的结论。
这些发现不应被推广到每个模型或每个推理任务。但它们强化了一个重要的架构教训:模型智能无法弥补缺失、模糊、过时或检索不良的业务上下文。
生产响应:治理上下文
一个生产AI系统需要的不仅仅是一个强大的模型。一个上下文充分性门可以在生成前评估检索到的证据是否足够。如果可用上下文不足,系统可以放弃、请求澄清、扩展检索或将查询路由到人工审查。
一个治理的上下文层可以添加:
* 经验证的企业知识
* 实体和关系结构
* 业务定义和本体
* 来源出处和血统
* 访问和治理规则
* 证据链接的响应
* 置信度和放弃策略
这就是图增强检索变得有价值的地方。系统不再仅仅依赖语义相似的文本片段,而是可以检索连接的实体、关系和相关证据,同时保持对原始来源的可追溯性。它无法保证LLM永远不会产生幻觉。它可以大幅减少模型被迫推测的空间——并使无根据的答案更容易检测和控制。
大脑只有在提供的证据和边界下才可靠。
相似文章
@cerebras: https://x.com/cerebras/status/2067357992929153268
关于AI推理模型的经济性和性能影响的分析,表明启用推理可以将准确率提高10-20%,但消耗的token数量增加5-10倍,并讨论了不同的推理类型及其应用。
AI推理是否因错误的原因而正确?
《Quanta Magazine》的一篇文章探讨了AI推理研究的混乱现状,权衡了关于大型推理模型能力的相互矛盾的证据,以及它们的行为对真正推理意味着什么。
打造增强人类推理能力的AI工具
《哈佛商业评论》文章探讨AI工具如何削弱批判性思维,并提出设计原则以强化人类推理能力。
思考的代价:推理努力作为模型特定的API契约
本论文研究了AI模型API契约中推理努力参数的影响,基于对Sonnet 5的实验,表明显式高努力导致更高成本,而未检测到准确性提升。
An Alien Mind
OpenAI researchers reflect on the rapid scaling of reasoning models and warn that AI systems are likely to achieve recursive self-improvement within years, calling for extreme caution and broader interventions beyond technical solutions.