LEXIC: 通过注入复杂度实现的轻量级眼动追踪扩展
摘要
本文介绍LEXIC,一种轻量级方法,通过将预计算的词级难度信号(GPT-2意外值、词频、词长)注入仅眼动模型中,用于阅读理解预测,在EyeBench基准上相比基线略有提升。
arXiv:2607.08152v1 公告类型:新论文
摘要:在最近的EyeBench基准上,通过眼动预测阅读理解暴露了一个明显差距:使用预训练语言模型的文本感知模型达到56-63%的AUROC,而仅眼动模型表现如随机水平。我们探究通过轻量级、无语言模型的条件化,仅眼动模型能推进到何种程度。基于EyeBench AhnCNN基线LEXIC-Base,我们提出两种机制,将三个预计算的词级难度信号(GPT-2意外值、词频和词长)注入每注视点输入:直接拼接(LEXIC-Concat)和残差机制(LEXIC-Res),其中一个小头部预测典型读者的眼动响应,编码器根据偏差进行条件化。在OneStop阅读理解任务上,通过K=5种子集成训练跨十折,两种机制在未见文本上均产生统计一致的AUROC提升,+1.8至+2.2个百分点,Wilcoxon p <= 0.065。LEXIC-Concat还在未见读者上提升+2.9个百分点,p=0.010。我们追溯LEXIC-Res在未见读者上的架构边界(+1.8个百分点,p=0.19)到预测头部针对训练读者校准,对分布外读者迁移不完美。
查看缓存全文
缓存时间: 2026/07/10 06:13
# LEXIC:通过注入复杂性实现的轻量级眼动追踪扩展 来源:https://arxiv.org/html/2607.08152 Sumin Lee¹, Kyeonghun Kim²,³, Subeen Lee¹, Jiwon Yang¹ ¹首尔大学, ²OUTTA, ³首尔大学, ⁴首尔大学 [email protected], [email protected], [email protected], [email protected] Tien Nguyen¹, Ken Ying‑Kai Liao⁵, Nam‑Joon Kim¹† ¹首尔大学, ⁵NVIDIA, ¹首尔大学 [email protected], [email protected], [email protected] ###### 摘要 在最近的 EyeBench 基准测试中,通过眼动预测阅读理解能力暴露了一个明显的差距:使用预训练语言模型的文本感知模型达到 56–63% 的 AUROC,而纯眼动模型的表现则接近随机水平。我们探究了在无需语言模型的情况下,通过轻量级条件注入能将纯眼动模型推动多少。基于 EyeBench AhnCNN 基线(LEXIC-Base),我们提出了两种机制,用于将三个预先计算的词级难度信号(GPT-2 惊奇度、词频和词长)注入到每次注视输入中:直接拼接(LEXIC-Concat)和残差机制(LEXIC-Res),其中一个小型头部预测典型读者的注视响应,编码器则根据偏差进行调节。在 OneStop 阅读理解任务上,使用 K=5 种子集成训练,跨越十折交叉验证,两种机制都在未见文本上产生了统计上一致的 AUROC 提升(+1.8 到 +2.2 个百分点,Wilcoxon p≤0.065);LEXIC-Concat 还在未见读者上提升了 +2.9 个百分点(p=0.010)。我们将 LEXIC-Res 在未见读者上的架构边界(+1.8 个百分点,p=0.19)归因于预测头部对训练读者的校准,从而在分布外读者上转移不完美。 ††通讯作者 ## I 引言 阅读过程中收集的眼动反映了从词汇访问到话语理解的认知过程[5]。从这些眼动中预测读者级别的认知状态或读者-文本交互,具有科学价值(用于完善认知理论)和实际价值(用于自适应界面)。EyeBench 基准测试[14]将六个数据集上的这些预测任务标准化,评估模型在 OneStop[2] 和 MECO[15] 等语料库上的分布外泛化能力。 在 EyeBench 的读者-文本任务中——特别是二元阅读理解分类——预测认知处理已成为一个活跃的跨学科目标[8,7]。排行榜显示出一个明显的二分法:通过大型预训练语言模型(PLM)摄入文本内容的模型达到 56–63% 的 AUROC 范围[19,13],而纯眼动模型则表现接近或处于随机水平(49.6–50.0%)[1,14]。在没有语言模型的情况下用语言特征增强眼动的模型(如 BEyeLSTM[12])则介于两者之间(52.5%)。理解力在很大程度上取决于所读内容;因此,纯眼动模型缺乏文本方面的信号。 我们提出疑问:能否通过注入轻量级文本信号(而非完整文本)将纯眼动模型提升到随机水平以上?我们使用三个预先计算的词级难度信号:GPT-2[10] 惊奇度、英语词频[17]和词长。所有三个信号在每个数据集上离线计算一次,然后合并到注视行中;推理时无需调用语言模型的前向传播。对纯眼动 AhnCNN 骨干架构的修改非常小:三个额外的输入通道(拼接),或者一个小型辅助头部预测典型读者的眼动,其与观测眼动的残差增强输入(残差注入)。 我们的贡献如下: - •我们提出了两种轻量级机制,用于将预先计算的词级难度特征注入到 EyeBench 的纯眼动 AhnCNN 基线中,部署时无需语言模型推理。 - •在十个交叉验证折和三个评估场景下,使用 K=5 种子集成,两种机制都在未见文本上产生了统计显著的 AUROC 提升(Wilcoxon p≤0.065)达 1.8 到 2.9 个百分点,并且在未见读者上(针对拼接)同样如此,基线重现误差在 0.3 个百分点内。 - •我们表征了一个架构边界条件:残差机制的典型读者预测头部针对训练读者进行了校准,从而削弱了其在未见读者场景下的提升——这阐明了何时简单的拼接机制更可取。 参见图注 图 1:提出的 LEXIC 变体:(a) LEXIC-Base 接收一个 4 通道注视张量。(b) LEXIC-Concat 追加预先计算的难度信号(惊奇度、频率、词长),得到 7 通道输入。(c) LEXIC-Res 使用 NormativeGazeHead(MLP 3→32→2)预测典型读者的注视 ĝ;残差 r_t = g_t^obs - stopgrad(ĝ_t) 被拼接到基本通道中。所有变体共享下游骨干。 ## II 相关工作 眼动预测建模:眼动长期以来一直被研究作为阅读过程中词汇访问、注意力分配和理解力的指标[11]。最近的计算工作已从手工特征转向基于注视序列和扫描路径的神经模型[1]。Ahn 等人[1]引入了 EyeBench[14] 采用的 AhnCNN 和 AhnRNN 基线架构;这些仍然是强大的纯眼动基线,但在 OneStop 阅读理解任务上表现接近随机水平。Reich 等人[12]引入了 BEyeLSTM,它吸收了注视级别和词级语言特征,介于纯眼动和文本感知机制之间。EyeBench v1.0[14]还评估了集成 PLM 的文本感知模型[19,13],这些模型以高推理成本主导了排行榜。 轻量级语言特征:词级惊奇度、频率和长度是注视持续时间的标准心理语言学预测因子。惊奇度可追溯至 Hale 基于期望的解释[4]及其与阅读时间的对数关系[16];频率和长度对注视持续时间和跳读概率有独立且记录良好的影响[6]。我们使用这些信号是因为它们与注视行为高度相关,同时计算上轻量:所有特征离线预计算,并在推理时重复使用,无需任何运行时语言模型执行。 本工作定位:我们不以最大化排行榜性能为目标,而是研究在严格的轻量级推理约束下能获得多少性能提升。我们的约束是推理时不进行语言模型前向传播;我们在该约束下考察从随机水平基线能获得多大的提升。 ## III 方法 ### III-A 骨干:LEXIC-Base 我们使用 EyeBench AhnCNN 基线[1,14]作为骨干。LEXIC-Base 接收一个每次注视的四通道张量——持续时间、瞳孔大小和位置 (x,y)——通过三个一维卷积层(核大小 3,ReLU)。最大池化、丢弃和展平后连接一个三层线性全连接分类头部,生成 logits。我们保留了已发布基线[14]的架构和优化协议。 ### III-B 难度特征 对于每个词,我们使用由 EyeBench 流水线预计算的三个难度信号: - •gpt2_surprisal:GPT-2(基本版)[10]下的惊奇度。 - •wordfreq_frequency:来自 wordfreq[17] 的英语频率。 - •word_length:词的字符长度。 这些信号在词级别定义,推理时从不重新生成。 ### III-C 拼接机制 (LEXIC-Concat) 最简单的注入方式是将三个难度信号作为额外通道追加,通过继承的 fixation_dim 机制将输入宽度从 4 扩展到 7。我们在前向步骤中应用一个 nan_to_num 传递,将所有 NaN 条目替换为零,以防止未对齐标点符号上的 NaN。 ### III-D 残差机制 (LEXIC-Res) 该机制将眼动解释为与典型读者在给定局部难度下产生的眼动之间的偏差。一个 NormativeGazeHead(MLP 3→32→2)将难度向量 d_t ∈ R³ 映射到典型读者预测 ĝ_t ∈ R²(持续时间和眼跳幅度)。残差为: r_t = g_t^obs - stopgrad(ĝ_t), (1) 其中 g_t^obs ∈ R² 是观测值。CNN 输入是 4 个基本通道和 2 个残差通道的拼接(共 6 个)。NormativeGazeHead 通过辅助 MSE 损失进行塑造: L_aux = (1/|T_0|) Σ_{t∈T_0} ∥ĝ_t - g_t^obs∥₂². (2) 该损失仅限于错误回答的试次(T_0)。总损失为: L = L_cls + λ L_aux, λ = 0.3. (3) λ=0.3 继承自原始残差头部规范,并在所有实验中固定。 ### III-E 推理成本 两种机制均执行一次骨干前向传播。LEXIC-Res 增加了一个通过小型 3→32→2 MLP 的前向传播。由于难度信号是文本侧特征,每个刺激计算一次并在读者之间共享,因此推理时不调用任何语言模型。 ## IV 实验设置 数据集和任务:我们使用来自 EyeBench v1.0[14] 的 OneStop 阅读理解任务,基于 OneStop 眼动语料库[2],专注于二元分类,判断读者是否正确回答了理解问题([错误, 正确])。根据 EyeBench[14] 的标准,OneStop 包含 180 名参与者,阅读总数为 19,428 词的段落(110 万次注视)。该任务包含 9,718 个试次实例(每位参与者 54 个段落)。我们使用常规阅读子集。 交叉验证协议:EyeBench 定义了十个交叉验证折,在三个分布外场景下进行评估:未见文本(未见文本,已见读者)、未见读者(已见文本,未见读者)和两者均未见。我们评估全部十折。对于每一折,我们训练一个 K=5 的独立种子集成,平均每个试次的概率。运行级别的选择基于验证交叉熵损失。 指标和阈值策略:AUROC 是我们的主要无阈值指标,可直接与已发布的 AhnCNN 排行榜(49.7%)进行比较。0.5 处的平衡准确率(balacc0.5)允许与排行榜的平衡准确率(50.0%)进行比较。调谐阈值处的平衡准确率(balaccτ)作为次要指标。每折中,τ 的选择基于在三个场景上汇总的验证试次上最大化平衡准确率,然后不变地应用于每个场景的测试试次。鉴于有限的每折验证集大小,汇总稳定了阈值选择。我们报告成对差值、符号一致性和 Wilcoxon 符号秩检验 p 值[18,3]。 ## V 结果 基线重现:LEXIC-Base 紧密地重现了 EyeBench[14] 上已发布的 AhnCNN 基线:各场景下的 AUROC 为 0.489–0.512(排行榜:0.497),balacc0.5 为 0.500(排行榜:0.500),验证了我们的流水线。 主要结果:表 I 显示了绝对性能。两种机制都将 AUROC 提升到随机基线以上:达到 0.51–0.56。在阈值调谐下,balaccτ 增加到 0.51–0.54,达到了与 BEyeLSTM(已发布 52.5%[14,12])相同的性能层级,而 BEyeLSTM 消耗了显著更丰富的全局和语言特征。 表 I:测试 AUROC 和调谐阈值下的平衡准确率(balaccτ),以十折(K=5 种子集成)的平均值±标准差报告。最佳均值以粗体显示。 | 模型 | 未见文本 AUROC | 未见读者 AUROC | 两者均未见 AUROC | 未见文本 balaccτ | 未见读者 balaccτ | 两者均未见 balaccτ | |------|----------------|----------------|------------------|------------------|------------------|--------------------| | LEXIC-Base (基线) | 0.511±0.015 | 0.489±0.033 | 0.489±0.030 | 0.519±0.011 | 0.500±0.010 | 0.500±0.009 | | LEXIC-Concat (本研究) | 0.529±0.019 | **0.519±0.035** | 0.492±0.033 | 0.530±0.010 | 0.536±0.019 | **0.555±0.052** | | LEXIC-Res (本研究) | **0.532±0.019** | 0.508±0.029 | **0.533±0.075** | **0.531±0.011** | **0.523±0.016** | 0.559±0.046 | 成对差值和符号一致性:表 II 详细列出了每折内的成对增益。LEXIC-Concat 在未见文本(+1.82 个百分点,9/10,p=0.065)和未见读者(+2.92 个百分点,8/10,p=0.010)上显示出显著的 AUROC 增益。LEXIC-Res 在未见文本上实现了显著的 AUROC 增益(+2.18 个百分点,9/10,p=0.010),但在未见读者上趋势较弱(+1.84 个百分点,7/10,p=0.19)。在阈值调谐下,balaccτ 差值一致更大,且在六个单元格中的五个中统计显著(p≤0.05)。 表 II:每折内相对于基线的成对差值。符号表示十折中正差值的折数。粗体值表示统计上显著的正面改善(Δ>0 且 p≤0.10)。 | 模型 | 场景 | Δ (pp) | 符号 | p | |------|------|--------|------|---| | AUROC | | | | | | LEXIC-Concat | 未见文本 | **+1.82** | 9/10 | 0.065 | | | 未见读者 | **+2.92** | 8/10 | 0.010 | | | 两者均未见 | +0.33 | 5/10 | 1.000 | | LEXIC-Res | 未见文本 | **+2.18** | 9/10 | 0.010 | | | 未见读者 | +1.84 | 7/10 | 0.193 | | | 两者均未见 | +4.44 | 6/10 | 0.275 | 调谐阈值下的平衡准确率 (balaccτ) | LEXIC-Concat | 未见文本 | **+1.15** | 9/10 | 0.084 | | | 未见读者 | **+3.65** | 9/10 | 0.020 | | | 两者均未见 | **+5.51** | 9/10 | 0.020 | | LEXIC-Res | 未见文本 | **+1.27** | 9/10 | 0.084 | | | 未见读者 | **+2.28** | 9/10 | 0.020 | | | 两者均未见 | **+5.96** | 7/10 | 0.049 | 边界条件:LEXIC-Res 在未见读者上的表现:LEXIC-Res 在未见文本与未见读者之间呈现出明显的不对称性(AUROC 增益 +1.84 个百分点对比 +2.18 个百分点)。在未见读者上的增益大约为 LEXIC-Concat 增益的一半(+2.92 个百分点)。我们将这种转移瓶颈归因于 LEXIC-Res 中的典型读者预测头部,该头部针对训练读者进行了总体平均注视响应的校准
相似文章
利用人类阅读行为进行关键词抽取:基于网络摄像头的眼动追踪语料库
本文探讨利用基于网络摄像头的轻量级眼动追踪特征来改进中文论文摘要的关键词抽取,介绍了CLIS-ET语料库,并表明注视特征能够提升关键词抽取(KPE)性能。
DysLexLens:一种用于分析在线论坛中阅读障碍学习者见解的低资源LLM框架
本文提出DysLexLens,一种低资源LLM框架,利用在线论坛数据分析阅读障碍学习者使用AI工具的体验,具有词典驱动过滤、知识图谱推理和评估指标等功能。
HyperLens:利用细粒度置信度轨迹量化大型语言模型的认知努力
本文介绍了 HyperLens,一种高分辨率探针,可通过追踪层间的细粒度置信度轨迹来量化大型语言模型(LLMs)的认知努力。研究表明,复杂任务需要更高的认知努力,并展示了监督微调(SFT)如何降低这种努力,从而可能导致性能下降。
Lens:重新思考基础文本到图像模型的训练效率
Lens是微软推出的一款紧凑型38亿参数文本到图像模型,在训练计算量显著降低的同时,通过密集描述、多分辨率批处理和高效架构,达到了与更大模型竞争甚至超越的性能。
视觉世界实验中的注视行为可用现成的语言-视觉编码器建模
本文提出使用现成的CLIP风格多模态编码器,结合双模态归因方法来预测视觉世界实验中的注视行为,无需微调即可成功复现一项关于人类预测加工的开创性研究。