标签
A detailed walkthrough explains how Claude Shannon's 1948 information theory underlies LLMs and shows that the 'next-token prediction' story is misleading, linking compression and prediction mathematically.
本文利用ChaosNLI数据,衡量形式语义结构在多大程度上解释了自然语言推理(NLI)中的人类标注变异,发现了对熵的群体级效应,但存在项目级上限和空组合效应。
本文使用言语流畅性数据比较人类与大语言模型之间的语义搜索动态,发现人类表现出更加多变和探索性的搜索模式,而当前模型无法重现这些模式。
本研究使用语义熵(一种基于NLP嵌入的度量),比较盲人与明眼人的语义记忆导航。结果表明,视觉经验影响熵的模式:明眼人对抽象概念的熵更高,而盲人对视觉显著性具体概念的熵更高。
本文识别了大型语言模型在On-Policy Self-Distillation中的'Thinking Collapse'现象,其特点是中间推理步骤的减少,并提出了AD-OPSD控制框架,通过将高风险抑制令牌锚定到参考先验来缓解这种崩溃。该方法在数学基准测试上实现了高达+4.1%的绝对平均准确率提升。
本文介绍了一种针对大语言模型的自监督早期退出方法,允许在置信度较高时在中间层提前停止计算,从而降低推理成本。此外,还提出了动态自推测解码(DSSD),相比现有基线实现了更高的令牌接受率。
本文在Qwen3-4B上跨越7个数据集评估了Anthropic的J-Space幻觉检测方法,发现该方法在捕捉事实检索中的高置信度错误方面有效,但对内化的虚构内容视而不见,并且在阈值无法迁移的数学任务上失效。
一篇直观、可视化的信息论入门介绍,涵盖熵、互信息和信道容量,仅需基础概率知识。该论文阐述了压缩和传输的基本极限。
这篇推文探讨了统计力学与人工智能之间的关系,并引用了一篇论文,该论文提出了机器学习系统的热力学理论,引入了温度、熵和能量等概念,将训练过程视为相变。
提出独立组合令牌(ICT)框架,利用令牌logit分布之间的Jensen-Shannon散度识别关键分支点,防止RLVR在LLM推理中的熵坍缩和熵爆炸。在Qwen模型上实现了高达14.9%的pass@4改进。
本文揭示了PPO和GRPO中的裁剪机制在LLM的RLVR中引入了熵偏差:低裁剪增加熵,高裁剪减少熵。作者证明,即使在随机奖励的情况下,标准裁剪也会降低熵,并表明调整低裁剪可以防止熵塌陷并促进探索。
这是一篇长达两万五千余字的科普文章,从熵的起源讲起,回顾了耗散系统理论的发展历程,并探讨了AI是否属于耗散系统的三层分析(硬件层、训练层、静态模型)。
本文提出全局-局部不确定性(GLU),一种无监督单次评分方法,融合词元级局部熵与隐藏状态几何全局熵,用于LLM不确定性量化,证明两者近乎正交,共同捕捉自信但错误的失效模式。
Bebop 提出了熵感知的多 token 预测,结合拒绝采样和一种新的 TV 损失,以加速 LLM 的 RL 训练,实现最高 1.8 倍的加速。该方法通过优化训练目标,解决了 RL 训练中接受率下降的问题。
本文从熵的视角审视多智能体系统(MAS),分析智能体内部与之间的动态。研究发现,单个智能体通常优于MAS,并引入了熵判断算法以提高MAS性能。