人类认知与行为的小型基础模型
摘要
本文在Psych-101数据集上训练了14个小语言模型(参数规模从1.35亿到140亿),该数据集包含来自160个实验的1070万次逐试次人类选择。研究发现,小型模型足以匹配分布内数据,而大型模型在分布外泛化方面表现更好。诊断结果表明,遮蔽刺激和反馈会破坏大部分已学信息,表明仅凭选择历史是不够的。
查看缓存全文
缓存时间: 2026/08/10 14:15
论文页面 - 人类认知与行为的小型基础模型
来源:https://huggingface.co/papers/2608.05224
摘要
大规模语言模型在人类行为数据上进行微调后,已成为通用的认知代理,但所需规模,以及这些模型是处理任务结构还是利用统计捷径,仍是悬而未决的问题。我们在 Psych-101 上训练了十四个模型,参数规模从 135M 到 14B,涵盖四个架构家族。Psych-101 是一个包含来自 160 项实验的 1070 万次试验级选择的数据集。在分布内,规模几乎无关紧要。模型表现落在一个狭窄区间内,仿佛触及天花板;0.6B 到 1B 参数就足以在留出参与者上匹配 70B 基线。在分布外,该区间展开为明显更陡峭的缩放梯度,更大的模型在泛化到新颖任务结构时显然更具优势。为了确定这些模型使用了哪些信息,我们运行了两项诊断。我们在 27 个实验中逐步剥离四个提示通道——任务指令、实验刺激、结果反馈和选择历史——并打乱试验顺序。遮蔽刺激和反馈的内容会破坏 75.7% 已学习的信息,并将模型推向低于随机水平,这表明仅凭选择历史无法解释模型表现。打乱顺序揭示了在独立试验任务上的不变性,但在试验顺序由先前反应决定的任务上则表现出敏感性。因此,小型认知微调模型作为心理实验的噪声上限估计器展现出潜力,尽管其范围仍受限于训练中见过的范式。
查看 arXiv 页面 (https://arxiv.org/abs/2608.05224)
查看 PDF (https://arxiv.org/pdf/2608.05224)
GitHub3 (https://github.com/socius-org/Centauri)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05224)
相似文章
人类认知与行为的小型基础模型
本文研究在人类行为数据上微调的小型基础模型是否可以作为认知代理,发现规模在分布内影响甚微,但较大模型在分布外具有更好的泛化能力。
使用认知模型改进语言模型对人类说服游戏的模拟
本文提出方程到行为提示和强化学习,引导大型语言模型模拟说服游戏中多样的人类决策模式,显示出改进的信念准确性和训练结果。
通过小型语言模型实现AI民主化:面向本地部署的结构化基准测试与参数高效微调
本文在结构化基准上评估了九个开放权重的小型语言模型(参数量135M至3B),并证明参数高效微调显著提升了准确率,使其在结构化小众工作负载的本地部署中具备可行性。
小型本地模型用于自动化,真的可行吗?
一位 Reddit 用户探讨了小规模本地语言模型(1B-4B 参数)在自动化和脚本编写方面的潜力,并询问了专注于这一应用场景的资源。
@rohanpaul_ai:Meta新论文显示,小模型可能并非规模预测效果不佳,或许只是未获得充分调优。研究发现……
Meta最新论文显示,小型模型能够准确预测缩放规律,但需要更全面的超参数调优。研究发现,缩放规律在参数量约400万时开始显现,通过恰当调优其特征会变得更加清晰。