LifeSentence:语言模型可从纵向面板数据编码人类生命历程轨迹
摘要
LifeSentence通过对一项纵向面板研究(SOEP)的结构化自然语言记录进行微调,训练一个240亿参数的语言模型,在生命结果预测上取得了更优表现,并支持对人生传记进行反事实查询。
查看缓存全文
缓存时间: 2026/06/11 13:36
# LifeSentence:语言模型可从纵向面板数据编码人类生命历程轨迹。来源:https://arxiv.org/html/2606.11220 \(2026年5月5日\) 摘要 预测人类生命结果对于理解个人如何获得长寿与健康的生活至关重要。传统统计方法准确度有限,其原因可能在于忽略了生命历程的顺序结构。诸如Transformer架构等现代方法需要大规模训练数据,而大多数纵向面板研究缺乏此类数据。在此,我们介绍LifeSentence,一个用于生命历程推理的模型,它桥接了大型语言模型与纵向面板数据。通过将每个生命事件表示为结构化的自然语言记录,并对一个预训练的240亿参数语言模型进行指令微调,覆盖一个包含预测、鲁棒性和推理的18项任务评估分类体系,LifeSentence利用预训练中已编码的分布知识来补充面板数据。LifeSentence在来自德国社会经济面板的约65,000名个体上训练(比先前基于Transformer的方法少约45倍),在所有任务族中均优于经典和深度学习基线,在联合事件与时间预测上实现最佳基线的三倍提升,并在从去除时间戳的事件集合中重建时间顺序时达到91.2%的Kendall tau系数。在没有明确监督的情况下,该模型仅从离散事件序列中恢复了已记录的社会分层模式,包括教育溢价、性别工资差距和母亲惩罚。自然语言接口进一步实现了定性新颖的研究查询,例如将早期生活史连接到指定的晚期终点,使LifeSentence既成为预测工具,也成为人类传记反事实探索的探针。 ## 引言 准确预测人类生命的轨迹,为了解个人如何实现长寿、健康与幸福的生活提供了基础性见解。1–3然而,经过数十年的探究,标准模型的预测准确性仍然有限,4–6表明主流分析范式未能捕捉人类存在的高维、序列化逻辑。研究生命轨迹的必要性跨越多个学科。7,8冲击在整个生命周期中累积,关键期将早期生活条件与晚期终点联系起来。9,10累积优势理论阐明了微小的初始差异如何随时间放大,11而社会时钟理论则将规范性事件的时间安排描述为社会控制的一种机制。12总体而言,这些框架确立了生命是一个由时间、背景和累积经验塑造的动态序列。13,14 传统统计工具丢弃了序列信息,将生命历程丰富的 temporal 结构扁平化。15,16“脆弱家庭挑战”揭示,即使是复杂的机器学习也难以预测生命结果。4Transformer架构17,18提供了可能的解决方案。19–21life2vec研究22通过在覆盖六百万丹麦公民的登记数据上训练一个类似BERT的Transformer验证了这种方法,证明时间事件序列携带着关于死亡率及其他生命结果的预测信号。然而,life2vec暴露了一个基本限制:从头训练Transformer需要大型数据集。23,24主要的纵向面板研究追踪了更广泛的变量,但仅涉及数万而非数百万参与者。 在此,我们介绍LifeSentence,一个用于生命历程推理的基础模型,它桥接了大型语言模型与纵向面板数据。LifeSentence并非从头学习,而是将每个事件表示为结构化的自然语言描述,并在生命历程预测任务上对预训练的大型语言模型进行指令微调。由于预训练语言模型已经编码了关于教育水平、职业和健康状况等概念之间语义关系的分布知识,微调仅需教会模型这些概念在传记中如何相互关联。25–27 LifeSentence在使用大约65,000名个体(比life2vec少约15倍)的18项任务评估分类体系28上优于传统模型。除了预测准确性,LifeSentence还揭示,人类生命的序列结构编码了比先前分析提取的更多的社会分层信息。4,29没有任何明确监督将特定人口统计特征与结果联系起来时,模型生成轨迹复现了已充分记录的社会经济分层模式,包括先前文献中确立的教育收入溢价、30,31性别工资差距、32,33以及仅从事件序列中推断的母亲惩罚,34,35表明离散生命事件的共现结构足以恢复已知的社会经济分层模式。这些表示结合自然语言接口(可实现定性新颖的研究查询,如“生成直到退休的所有事件”、“将此早期历史连接到该晚期状态”),使LifeSentence既成为预测工具,也成为生命历程序列的假设情境探索探针。 ## 结果 ### 模型方法 ![[无标题图片]](https://arxiv.org/html/2606.11220v1/article_media/media/image1.png) 图1 — LifeSentence框架概览。(a)一条生命句子将个体的完整传记编码为一系列按时间顺序排列的离散生命事件,涵盖教育、就业、家庭和健康领域。每个事件记录其相关细节、个体年龄和日历年份。伴随离散事件的是连续状态的周期性测量值。(b)18项任务评估分类体系,分为三个家族。预测任务评估不同时间跨度的预测能力。鲁棒性任务通过掩码事件、删除时间段和静默删除来测试对不完整信息的韧性。推理任务探究对传记本身的结构性理解,包括异常检测和重新排序。(c)推理流程。将结构化的生命历史、特定任务指令和系统提示拼接成单一的自然语言输入。微调后的模型生成结构化的JSON预测,并与真实轨迹进行评估。 我们将个体生命表示为按时间顺序排列的离散生命事件序列——我们称之为生命句子——这些事件取自德国社会经济面板(SOEP),36,37一个覆盖数十年观测的纵向家庭调查(图1a)。一条生命句子编码了一段传记:一名女性18岁完成中学教育,开始学徒生涯,成为护士全职工作,26岁结婚,育有两个孩子,52岁被诊断出高血压,63岁退休:每个事件记录其相关细节、个体年龄和日历年份。事件涵盖教育(升学、证书、学位)、就业(职业变化、职位级别、退休)、家庭(结婚、离婚、生育、丧偶)以及健康(诊断疾病、死亡)。伴随离散事件的是连续状态变量(收入、生活满意度、健康满意度和职业声望)的周期性测量值,为个体随时间变化的情况提供了补充画像。 每个生命事件并非表示为分类索引,而是表示为结构化的自然语言记录,使用带有语义内容的职业名称、教育水平和诊断术语。这种表示方式使模型能够利用预训练大型语言模型中已存在的分布知识38,39:“学徒”与“职业证书”之间的关系无需仅从面板数据中学习。我们使用低秩适应40对Mistral Small 3.1(240亿参数)进行微调,针对下面描述的18项生命历程预测任务。将结构化的生命历史、任务指令和系统提示拼接成单一输入;模型生成结构化的JSON预测,并与真实轨迹进行评估(图1c)。 LifeSentence通过一个包含18项任务的分类体系进行评估,该体系分为三个推理需求递增的家族(图1b)。预测任务4,22评估预测能力:预测下一个事件、生成完整轨迹、预测到给定年份、估计转变时间。鲁棒性任务通过掩码事件、删除时间段或静默移除观测来测试对不完整信息的韧性:这些条件反映了面板数据中常见的缺失情况。41,42推理任务探究结构性理解:检测异常事件、插补静默移除的事件、从无时间戳的乱序序列中恢复时间顺序,以及将离散事件序列转化为它们所产生的连续社会经济轨迹。 ### LifeSentence以高保真度预测生命事件 我们首先通过评估下一个事件预测来评估LifeSentence:给定在随机点截断的个体观察历史,预测紧接着的事件类型和时间。LifeSentence在所有指标上均优于所有基线(表1)。该模型实现了35.3%的联合准确率(同时正确预测特定事件类型及其发生年龄),相较于最接近的深度学习基线提升了三倍,并且是最佳次优模型的两倍多。当事件类型预测正确时,LifeSentence将其放置在真实年龄的1.15年内,而所有其他基线为1.78年或更差。 表1. 下一个事件任务的预测性能。LifeSentence与传统(逻辑回归、XGBoost)和深度学习(LSTM、GRU、Transformer)基线的比较。报告指标包括事件准确率(正确预测事件类型)、联合准确率(同时正确预测事件类型和年龄)以及条件平均绝对误差(MAE,在正确事件预测下以年为单位的时间误差)。95%置信区间(通过1,000次bootstrap计算)显示在括号中。 性能在整个生命历程中系统性地变化(补充图1a–c)。所有模型在20–30岁年龄段准确率降低,这与将成年初显期描述为密集生命事件时期的特征一致。43–45LifeSentence在此时期保持较高的准确率,即使在高波动期联合准确率仍保持在约25%以上,而基线降至10%以下。从1930年代到2000年代的出生队列中性能一致(补充图2d–f),表明模型捕捉了可推广的时间依赖性,而非特定队列的伪影。按事件类型分析显示,LifeSentence在社会规范结构化事件(教育完成)和更多变过渡(工作变动)上均表现良好(补充图2a–c)。特别值得注意的是死亡率预测:LifeSentence以29.8%的准确率预测死亡为下一个事件,几乎是次优基线(XGBoost的10.3%)的三倍。当模型未能预测死亡时,它几乎总是预测医疗诊断,这在观察数据中疾病常先于死亡的情况下是上下文连贯的。此错误模式与模型已学习事件类型之间的时间依赖性结构(特别是疾病-死亡序列)一致,而非仅依赖边际事件频率。对紧邻下一个事件转移概率的分析证实了这一点:LifeSentence的转移概率误差是所有基线的三分之一(补充图3a–c)。例如,基线未能学习到服兵役开始几乎总是紧随其后的是服役结束。这些单步转移结果确立了模型已适当捕捉短程事件转移依赖性。 ### 轨迹生成在长视界内保持结构准确性 下一个事件预测评估了单步前向的局部准确性。为了确定LifeSentence是否能在更长视界内维持连贯的叙述弧线,我们评估了其完整轨迹生成能力:从截断点开始预测剩余生命事件的完整序列,直至个体观察历史结束。轨迹的组合空间很大。47使用20种事件类型跨越典型40年视界,可能轨迹的空间很大;我们测试集中96%的轨迹在第八个事件时是唯一的(补充图5),意味着模型不能依赖记忆的模板。平均而言,每个测试案例需要预测个体接下来23年的生命。图2展示了两个示例案例,一个输入历史较短(18岁截断),一个输入历史较长(29岁截断)。对于两者,LifeSentence生成的轨迹与真实情况高度吻合。基线模型展现了典型失败:Transformer退化为密集重复的事件循环,而XGBoost恢复了一些正确事件类型但时间间隔不当。 ![[无标题图片]](https://arxiv.org/html/2606.11220v1/article_media/media/image2.png) 图2—两个个体跨模型的轨迹生成。LifeSentence、XGBoost和从头训练的Transformer的预测生命轨迹与真实情况的比较。截断点(虚线)之前的事件构成观察历史(蓝色阴影);右侧事件为模型预测(绿色阴影)或真实未来事件(每个面板的顶行)。(a)个体A,18岁截断,预测视界约55年。LifeSentence产生的轨迹在事件组成和时间间隔上都与真实情况高度吻合,捕捉了教育完成、结婚、生育、长期职业稳定、退休以及晚期诊断。XGBoost恢复了几种正确事件类型但分布不均匀。从头训练的Transformer呈现模式崩溃,退化为密集重复的事件循环。(b)个体B,29岁截断。LifeSentence再次以合理的时间间隔恢复了主要的传记弧线。Transformer再次崩溃为重复的早期生命生成,而XGBoost错过了结婚等关键事件。 定量评估在多个轨迹准确性维度上证实了这一优势(补充表2)。LifeSentence的事件类型重叠Jaccard相似度48为0.627,Levenshtein距离49为8.10——意味着生成的轨迹需要大约八次编辑才能匹配现实,而深度学习基线为20次或更多。包括时间位移(Wasserstein距离)50和事件频率保真度(Multiset Jaccard)51在内的完整指标比较在补充表2中报告。LifeSentence还复现了生命事件的非均匀时间分布,准确捕捉了25至30岁之间的事件密度高峰(补充图6),而基线模型要么未能捕捉到适当峰值,要么高估了事件频率。关于生育年龄、结婚年龄和死亡年龄的核密度估计与经验分布紧密吻合。
相似文章
大语言模型的序贯统计推断:表征、有效性与监控
本文主张采用序贯推断框架来增强LLM的可信度,通过将交互建模为依赖随机过程,确保在重复使用下的有效性,并实现行为变化的在线监控。
LiFT:指令微调能否提升大语言模型的纵向建模上下文学习能力?
## 指令微调能否提升大语言模型的纵向建模上下文学习能力? 来源:[https://arxiv.org/html/2604.16382](https://arxiv.org/html/2604.16382) Iqra Ali¹, Talia Tseriotou¹, Mahmud Elahi Akhter¹, Yuxiang Zhou¹, Maria Liakata¹,² ¹伦敦玛丽女王大学(英国),²艾伦·图灵研究所(英国) {iqra.ali,t.tseriotou,m.liakata}@qmul.ac.uk ###### 摘要 纵向NLP任务要求对时间有序的文本进行推理,以检测人类行为和观点的持续性和变化。然而,大语言模型的上下文学习在模型必须整合历史上下文、跟踪不断演变的交互,以及处理罕见变化事件的任务上存在困难。我们提出了LiFT,一个纵向指令微调框架,将多样化的纵向建模任务统一在共享的指令模式之下。LiFT采用课程式方法,在逐步增加时间难度的同时融入少样本结构和时间条件化,以鼓励有效利用过去上下文。我们在五个数据集上评估了LiFT。在不同时间粒度级别上针对纵向任务训练的模型,在两个独立数据集上进行了泛化能力测试。在不同参数规模的模型(OLMo(1B/7B)、LLaMA-8B和Qwen-14B)中,LiFT始终优于基线模型的上下文学习,在分布外数据和少数类变化事件上表现出显著的提升。
语言模型通过控制搜索引导符号方程发现
本文介绍了LLM-PySR,一种通过控制搜索参数让语言模型引导符号方程发现的方法,同时使用数值符号回归进行拟合。该方法在基准任务上实现了准确性与复杂性的良好平衡。
大语言模型中的语言习得装置
本文提出了一种受LAD启发的预预训练方法,使用一种名为MP-Struct的形式语言,该语言编码了类自然语言结构。研究表明,这种方法提高了token效率,并赋予了模型类似人类的对结构不合理语言的抵抗力,挑战了先前关于有效预预训练语言的假设。
StageMem:面向语言模型的生命周期管理记忆框架
StageMem 提出了一种面向语言模型的生命周期管理记忆框架,该框架将记忆划分为瞬态、工作状态和持久状态三个阶段,并引入明确的置信度与强度指标,将记忆视为一种有状态的处理流程而非静态存储,从而在容量受限的条件下更精准地管理信息的保留与遗忘。