标签
本文介绍了BehaviorBench,一个用于评估基础模型在行为科学任务(包括行为预测、战略决策、主体特征推断和行为知识应用)上表现的综合基准。它还介绍了Be.FM-1.5,一个经过微调的模型,实现了出色的分布对齐,突显了通用模型与行为适应模型之间的差距。
本文提出将基于任务向量和上下文学习推理之间的分布对齐作为设计任务向量的准则,并引入线性任务向量(LTV),通过闭式线性映射最小化下一个标记概率差异。LTV 在八个基准测试和五个大语言模型上比基线平均准确率提高 9.2%。