利用人类阅读行为进行关键词抽取:基于网络摄像头的眼动追踪语料库
摘要
本文探讨利用基于网络摄像头的轻量级眼动追踪特征来改进中文论文摘要的关键词抽取,介绍了CLIS-ET语料库,并表明注视特征能够提升关键词抽取(KPE)性能。
arXiv:2608.10688v1 公告类型:新
摘要:目的:关键词是在统计和语义上重要的文本单元,也能在阅读理解过程中吸引读者的注意力。然而,现有的关键词抽取(KPE)研究主要集中于改进文本表示,而在很大程度上忽略了人类阅读行为。本研究考察了基于网络摄像头的轻量级眼动追踪特征是否能够改进图书馆与情报科学(LIS)领域中文论文摘要的关键词抽取。
方法:为解决中文学术阅读眼动数据可用性有限的问题,我们利用开源SearchGazer库开发了一个基于网络摄像头的轻量级数据收集平台,并构建了中文LIS眼动追踪语料库(CLIS-ET)。将三个字符级眼动追踪特征——首次注视持续时间(FFD)、注视次数(FN)和总注视持续时间(TFD)——纳入KPE模型,以评估其对抽取性能的影响。
结果:眼动追踪特征持续改善了KPE性能。在Att-BiLSTM+CRF模型上,FN与TFD的组合取得了最佳结果,表明读者的注视行为为识别学术摘要中的关键词提供了有用信号。
原创性/价值:本研究引入了一种经济有效的基于网络摄像头的眼动追踪方法用于KPE,并提供了包含FFD、FN和TFD特征的中文学术眼动追踪语料库CLIS-ET。结果证明了将人类阅读行为融入关键词抽取的价值。数据集与代码:https://github.com/yan-xinyi/ET_AKE 和 https://github.com/yan-xinyi/Reading_ET_System。
查看缓存全文
缓存时间: 2026/08/12 08:37
# 利用人类阅读行为进行关键短语抽取:基于网络摄像头的眼动追踪语料库 来源:https://arxiv.org/abs/2608.10688 查看 PDF(https://arxiv.org/pdf/2608.10688) > 摘要:目的:关键短语是在统计上和语义上重要的文本单元,也能在阅读理解过程中吸引读者的注意力。然而,现有的关键短语抽取(KPE)研究主要集中于改进文本表示,而在很大程度上忽视了人类阅读行为。本研究考察了轻量级基于网络摄像头的眼动追踪特征是否能够提升图书情报学(LIS)中文学术摘要的KPE效果。方法:为解决中文学术阅读眼动追踪数据可用性有限的问题,我们使用开源SearchGazer库开发了一个轻量级基于网络摄像头的眼动追踪数据采集平台,并构建了中文LIS眼动追踪语料库(CLIS-ET)。将三种字符级眼动追踪特征(首次注视时长(FFD)、注视次数(FN)和总注视时长(TFD))纳入KPE模型,以评估其对抽取性能的影响。结果:眼动追踪特征持续提升了KPE性能。FN和TFD的组合在Att-BiLSTM+CRF模型上取得了最佳效果,表明读者的注视行为为识别学术摘要中的关键短语提供了有用信号。原创性/价值:本研究为KPE引入了一种经济高效的基于网络摄像头的眼动追踪方法,并提供了包含FFD、FN和TFD特征的中文学术眼动追踪语料库CLIS-ET。结果证明了将人类阅读行为纳入关键短语抽取的价值。数据集和代码:此https链接(https://github.com/yan-xinyi/ET_AKE)和此https链接(https://github.com/yan-xinyi/Reading_ET_System)。 ## 提交历史 来自:Chengzhi Zhang [查看电子邮件(https://arxiv.org/show-email/39c1cad4/2608.10688)] **[v1]** 周二,2026年8月11日 09:11:42 UTC(4,204 KB)
相似文章
利用人类阅读时产生的认知信号增强微博关键词提取
本文研究了脑电图信号能否补充眼动追踪信号用于微博的自动关键词提取。使用ZuCo语料库,作者表明认知信号,特别是脑电图信号,在不同模型上均能提升自动关键词提取的性能。
LEXIC: 通过注入复杂度实现的轻量级眼动追踪扩展
本文介绍LEXIC,一种轻量级方法,通过将预计算的词级难度信号(GPT-2意外值、词频、词长)注入仅眼动模型中,用于阅读理解预测,在EyeBench基准上相比基线略有提升。
Attention Expansion: Enhancing Keyphrase Extraction from Long Documents with Attention-Augmented Contextualized Embeddings
本文提出了一种注意力扩展机制,通过使用上下文外信息增强PLM token表示,提升长文档的关键词提取性能,在不需全文档注意力或昂贵LLM推理的情况下,持续优于最先进模型。
视觉世界实验中的注视行为可用现成的语言-视觉编码器建模
本文提出使用现成的CLIP风格多模态编码器,结合双模态归因方法来预测视觉世界实验中的注视行为,无需微调即可成功复现一项关于人类预测加工的开创性研究。
DysLexLens:一种用于分析在线论坛中阅读障碍学习者见解的低资源LLM框架
本文提出DysLexLens,一种低资源LLM框架,利用在线论坛数据分析阅读障碍学习者使用AI工具的体验,具有词典驱动过滤、知识图谱推理和评估指标等功能。