pre-registered

标签

Cards List
#pre-registered

思维链何时有帮助、何时有害:LLM推理中串行深度瓶颈的实证研究

arXiv cs.CL · 3天前 缓存

这项实证研究测试了思维链提示何时有助于或损害LLM推理,发现CoT在GSM8K和MATH等深层串行任务上带来巨大收益,但在MMLU和ARC-Challenge等浅层任务上则是冗余的,这与串行深度瓶颈框架一致。

0 人收藏 0 人点赞
#pre-registered

没有通用的幻觉检测器,但有一个通用的底线——预注册,10个模型。来打破它。[R]

Reddit r/MachineLearning · 2026-08-03

一项预注册研究提出了一种使用内部模型信号跨10个模型进行首token幻觉检测的方法,发现没有通用检测器,但存在一个普遍高于随机水平的底线,并公开了代码和验证脚本。

0 人收藏 0 人点赞
#pre-registered

重新思考LLM评判的有用性作为教学信号:跨辅导模型的预注册审计

arXiv cs.CL · 2026-07-31 缓存

本文对LLM评判的有用性是否能够可靠地区分AI辅导中直接给出答案与教学引导进行了预注册审计。作者发现,通用有用性并非可靠的教学信号,建议改用针对教学的评分标准和确定性过程度量。

0 人收藏 0 人点赞
#pre-registered

主动SAE特征平面是否携带更多和乐?Gemma中的预注册反转

arXiv cs.LG · 2026-07-24 缓存

这项预注册研究测试了和乐(一种几何度量)是否集中在Gemma 2 2B语言模型的主动SAE特征平面上。与语义集中预测相反,主动特征平面比匹配的混合特征控制平面携带更少的和乐,导致了一个狭窄的操作性反转,其根本原因仍然未知。

0 人收藏 0 人点赞
#pre-registered

前沿LLM智能体经济中的信息极限与吸引子动力学:一项预注册测试

arXiv cs.AI · 2026-07-08 缓存

本文报告了一项关于前沿LLM智能体(Claude Opus 4.8)小型经济的预注册实验,测试了关于财富增长的信息论容量区域以及人口失调的平均场残差标度律的预测。结果证实了将智能体知识与收益联系起来的定量信息定律,但拒绝了平均场假设,揭示了离散吸引子动力学。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈