标签
这项实证研究测试了思维链提示何时有助于或损害LLM推理,发现CoT在GSM8K和MATH等深层串行任务上带来巨大收益,但在MMLU和ARC-Challenge等浅层任务上则是冗余的,这与串行深度瓶颈框架一致。
一项预注册研究提出了一种使用内部模型信号跨10个模型进行首token幻觉检测的方法,发现没有通用检测器,但存在一个普遍高于随机水平的底线,并公开了代码和验证脚本。
本文对LLM评判的有用性是否能够可靠地区分AI辅导中直接给出答案与教学引导进行了预注册审计。作者发现,通用有用性并非可靠的教学信号,建议改用针对教学的评分标准和确定性过程度量。
这项预注册研究测试了和乐(一种几何度量)是否集中在Gemma 2 2B语言模型的主动SAE特征平面上。与语义集中预测相反,主动特征平面比匹配的混合特征控制平面携带更少的和乐,导致了一个狭窄的操作性反转,其根本原因仍然未知。
本文报告了一项关于前沿LLM智能体(Claude Opus 4.8)小型经济的预注册实验,测试了关于财富增长的信息论容量区域以及人口失调的平均场残差标度律的预测。结果证实了将智能体知识与收益联系起来的定量信息定律,但拒绝了平均场假设,揭示了离散吸引子动力学。