metacognition

标签

Cards List
#metacognition

人工智能中的Thinking Fast and Slow:元认知的角色

Hacker News Top ↗ · 6天前 缓存

本文提出了一种名为SOFAI的多智能体AI架构,灵感来源于Kahneman的双系统理论,旨在通过元认知和平衡快慢推理过程来增强AI能力。

0 人收藏 0 人点赞
#metacognition

@HuggingPapers: 自主研究代理无法自我纠正 我们在100个真实前沿研究任务上测试了8种框架-模型组合…

X AI KOLs Following ↗ · 2026-08-23 缓存

本文探讨了对自主研究代理的压力测试,发现失败源于元认知问题,而非能力问题,并介绍了ARFT——一种包含45种模式的故障分类体系。

0 人收藏 0 人点赞
#metacognition

我的智能体的反思 - 第二部分

Reddit r/AI_Agents ↗ · 2026-08-18

这篇文章描述了在Devin/Cascade中的LLM编码智能体的元认知反思,展示了其在代码分析任务中的推理和置信度评分。

0 人收藏 0 人点赞
#metacognition

智能体在AutoResearch上的失败分析:基于100个真实前沿研究任务的端到端诊断评估

arXiv cs.CL ↗ · 2026-08-18 缓存

本文介绍了AutoResearchEval,一个用于自动化科学研究中AI智能体的评估框架,揭示了元认知能力的关键缺失作为跨模型的反复失败模式。

0 人收藏 0 人点赞
#metacognition

大型语言模型在医学推理中表现出元认知敏感性

arXiv cs.AI ↗ · 2026-08-18 缓存

一项对照研究评估了大型语言模型在医学推理中的元认知敏感性,发现部分但存在缺陷的置信度校准,其随证据强度和冲突情境而变化。

0 人收藏 0 人点赞
#metacognition

脑中的张力

Lobsters Hottest ↗ · 2026-07-29 缓存

一篇反思性文章,探讨AI辅助阅读和编码如何减少了深度学习所必需的心智负担,以及作者通过手写和手写代码来恢复这种认知挑战的个人努力。

0 人收藏 0 人点赞
#metacognition

帮我将这篇论文送到合适的人手中:Sophia——面向模块化人工意识的递归认知精炼架构

Reddit r/artificial ↗ · 2026-07-26

该论文提出了Sophia,一种用于模块化人工意识的递归认知精炼架构,它通过引入元认知子层,借助一致性检查、上下文综合与记忆感知再解释,对中间语义状态进行递归精炼。

0 人收藏 0 人点赞
#metacognition

AI建议抑制人们说“我不知道”的意愿,即使建议错误且准确性受到激励

arXiv cs.AI ↗ · 2026-07-16 缓存

本研究论文探讨了AI建议如何降低人们表达不确定性的意愿,即使建议错误且准确性受到激励,从而改变元认知阈值。

0 人收藏 0 人点赞
#metacognition

@omarsar0: 强烈推荐的LLM元认知概述。(请收藏) LLM中有趣的行为如置信度校准…

X AI KOLs Timeline ↗ · 2026-07-14 缓存

本文首次全面概述了LLM中的元认知,认为置信度校准和自我验证等行为是统一元认知能力的各个方面,并对评估和提升这些能力以增强LLM可靠性和透明性的方法和基准进行了分类。

0 人收藏 0 人点赞
#metacognition

大语言模型中的元认知:基础、进展与机遇

Hugging Face Daily Papers ↗ · 2026-07-13 缓存

本文全面概述了大语言模型中的元认知,涵盖了测量方法、改进技术及未来方向。

0 人收藏 0 人点赞
#metacognition

大型语言模型中的未来置信度蒸馏

arXiv cs.CL ↗ · 2026-07-09 缓存

本文研究了在大型语言模型(LLM)答案生成过程中置信度相关信息的演化,并提出了未来置信度蒸馏方法。该方法利用后解决方案正确性探针生成的教师置信度估计,对前解决方案隐藏表示进行预测器训练,从而实现可靠且样本高效的置信度估计。

0 人收藏 0 人点赞
#metacognition

@dair_ai: 来自谷歌的新研究。LLMs 以高置信度产生幻觉,忽视自身知识边界,并错误报告不确定性…

X AI KOLs Timeline ↗ · 2026-07-02 缓存

一篇新的研究论文介绍了 RLMF(Reinforcement Learning with Metacognitive Feedback),一种两阶段方法,利用模型自身的自我判断来校准置信度并忠实地表达不确定性,在保持准确性的同时,在多种任务上实现了最先进的校准,并且比标准 RL 提升了高达 63%。

0 人收藏 0 人点赞
#metacognition

人类放弃,推理模型坚持:分离难度登记与思考分配

arXiv cs.AI ↗ · 2026-06-26 缓存

本文分离了大型推理模型(LRMs)和人类中的难度登记与思考分配,发现LRMs在答错的问题上花费更多token,而人类在失败上花费更少时间,揭示了尽管跨项目难度相关性相似但项目内模式相反。

0 人收藏 0 人点赞
#metacognition

LLM代理中的忠实不确定性:实践中校准与效用权衡

Reddit r/MachineLearning ↗ · 2026-06-04

一位从业者讨论了LLM代理中的校准与效用权衡,分享了基于验证器的流水线经验,该流水线将幻觉工具调用减少了约60%,但引入了延迟成本并丢失了简单的正确答案。

0 人收藏 0 人点赞
#metacognition

通过探针目标微调,让LLM真正表达其自信程度。[研究]

Reddit r/MachineLearning ↗ · 2026-05-29

这项研究提出了探针目标微调(LoRA)方法,使LLM能够口头表达其内部置信度,实现了对置信度输出的因果控制,并证明模型通常知道自己是正确还是错误,但未能表达出来。

0 人收藏 0 人点赞
#metacognition

LLMs 能内省吗?现实检验

arXiv cs.AI ↗ · 2026-05-27 缓存

本文认为,近期关于LLMs内省能力的说法并不成立,因为仅凭行为证据无法区分真正的内省与基于表面线索的模式匹配。作者重新审视了两种评估范式,发现模型依赖于输入层特征,而非真正访问内部状态。

0 人收藏 0 人点赞
#metacognition

LLMs 未显示出个体化元认知迹象

arXiv cs.LG ↗ · 2026-05-26 缓存

本文研究了前沿大语言模型是否表现出个体化元认知——即超越共享信号评估自身项目级别能力的能力。通过对20个模型和六个基准进行因子分析和成对校准,作者未发现此类元认知的证据;置信度差异归结为一个单一的共享难度因子,表明模型依赖于共同的难度信号而非模型特定的自我认知。

0 人收藏 0 人点赞
#metacognition

@rohanpaul_ai: 谷歌新论文称LLMs应停止假装确定,而是清楚地表明不确定。幻觉…

X AI KOLs Following ↗ · 2026-05-25 缓存

一篇新的谷歌论文认为,LLMs应侧重于诚实表达不确定性,而非追求完美的事实性,并提出“忠实的不确定性”以建立信任。

0 人收藏 0 人点赞
#metacognition

元认知作为奖励:通过知识与调控信号强化大语言模型推理

arXiv cs.CL ↗ · 2026-05-25 缓存

介绍了元认知即奖励(MaR),一个基于元认知知识与调控信号指导大语言模型推理的强化学习框架,在推理基准上相比基准方法最高提升11%。

0 人收藏 0 人点赞
#metacognition

@IntuitMachine: https://x.com/IntuitMachine/status/2058141021842571510

X AI KOLs Timeline ↗ · 2026-05-23 缓存

本文认为,在生产AI中,评估是最难的问题,而非生成,并将AI的自我知识分解为校准、判别和表达,这对系统设计具有启示意义。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈