标签
本文提出了一种名为SOFAI的多智能体AI架构,灵感来源于Kahneman的双系统理论,旨在通过元认知和平衡快慢推理过程来增强AI能力。
本文探讨了对自主研究代理的压力测试,发现失败源于元认知问题,而非能力问题,并介绍了ARFT——一种包含45种模式的故障分类体系。
这篇文章描述了在Devin/Cascade中的LLM编码智能体的元认知反思,展示了其在代码分析任务中的推理和置信度评分。
本文介绍了AutoResearchEval,一个用于自动化科学研究中AI智能体的评估框架,揭示了元认知能力的关键缺失作为跨模型的反复失败模式。
一项对照研究评估了大型语言模型在医学推理中的元认知敏感性,发现部分但存在缺陷的置信度校准,其随证据强度和冲突情境而变化。
该论文提出了Sophia,一种用于模块化人工意识的递归认知精炼架构,它通过引入元认知子层,借助一致性检查、上下文综合与记忆感知再解释,对中间语义状态进行递归精炼。
本研究论文探讨了AI建议如何降低人们表达不确定性的意愿,即使建议错误且准确性受到激励,从而改变元认知阈值。
本文首次全面概述了LLM中的元认知,认为置信度校准和自我验证等行为是统一元认知能力的各个方面,并对评估和提升这些能力以增强LLM可靠性和透明性的方法和基准进行了分类。
本文研究了在大型语言模型(LLM)答案生成过程中置信度相关信息的演化,并提出了未来置信度蒸馏方法。该方法利用后解决方案正确性探针生成的教师置信度估计,对前解决方案隐藏表示进行预测器训练,从而实现可靠且样本高效的置信度估计。
一篇新的研究论文介绍了 RLMF(Reinforcement Learning with Metacognitive Feedback),一种两阶段方法,利用模型自身的自我判断来校准置信度并忠实地表达不确定性,在保持准确性的同时,在多种任务上实现了最先进的校准,并且比标准 RL 提升了高达 63%。
本文分离了大型推理模型(LRMs)和人类中的难度登记与思考分配,发现LRMs在答错的问题上花费更多token,而人类在失败上花费更少时间,揭示了尽管跨项目难度相关性相似但项目内模式相反。
一位从业者讨论了LLM代理中的校准与效用权衡,分享了基于验证器的流水线经验,该流水线将幻觉工具调用减少了约60%,但引入了延迟成本并丢失了简单的正确答案。
这项研究提出了探针目标微调(LoRA)方法,使LLM能够口头表达其内部置信度,实现了对置信度输出的因果控制,并证明模型通常知道自己是正确还是错误,但未能表达出来。
本文认为,近期关于LLMs内省能力的说法并不成立,因为仅凭行为证据无法区分真正的内省与基于表面线索的模式匹配。作者重新审视了两种评估范式,发现模型依赖于输入层特征,而非真正访问内部状态。
本文研究了前沿大语言模型是否表现出个体化元认知——即超越共享信号评估自身项目级别能力的能力。通过对20个模型和六个基准进行因子分析和成对校准,作者未发现此类元认知的证据;置信度差异归结为一个单一的共享难度因子,表明模型依赖于共同的难度信号而非模型特定的自我认知。
一篇新的谷歌论文认为,LLMs应侧重于诚实表达不确定性,而非追求完美的事实性,并提出“忠实的不确定性”以建立信任。
介绍了元认知即奖励(MaR),一个基于元认知知识与调控信号指导大语言模型推理的强化学习框架,在推理基准上相比基准方法最高提升11%。
本文认为,在生产AI中,评估是最难的问题,而非生成,并将AI的自我知识分解为校准、判别和表达,这对系统设计具有启示意义。