ChronoLens:跨时间、跨语言和语言层面的语言变化测量

Hugging Face Daily Papers 论文

摘要

ChronoLens是一个框架,利用多语言语言模型和crosscoders测量五个议会传统(1803–2026年)中4498万篇文档跨语言层面的历史语言变化,表明变化幅度和方向在不同语言和不同时间会有所不同。

历史语言变化影响形态、句法、语义和语用,然而计算研究通常使用不兼容的表示来考察这些层面,因此无法确定它们是否在不同语言中共同演化。我们通过在一个单一分析空间中考察变化的幅度和方向如何跨语言层面、语言和历史时期而变化,来解决这个问题。我们提出了ChronoLens这一框架,它结合了冻结的多语言语言模型、特征对齐的crosscoders和事后语言干预,并将其应用于跨越1803–2026年五个议会传统的4498万篇文档和约172亿个token。由此得到的稀疏表示与语言统计的一致性显著强于稠密嵌入或池化稀疏自编码器(ρ=0.72,后两者分别为0.29和0.28),并揭示出,在同一语言内,形态、句法、语义和语用通常以大致相当的幅度变化,而不同语言在变化时间、幅度和方向上存在显著差异。这些发现表明,历史语言变化是一个结构化、多维的过程:相似的变化幅度可能掩盖不同的轨迹,而有意义的跨语言比较需要同时测量距离和方向。
查看原文
查看缓存全文

缓存时间: 2026/08/05 17:46

论文页面 - ChronoLens:跨时间、跨语言、跨语言层面的语言变化测量

来源:https://huggingface.co/papers/2608.03507

摘要

历史语言变化影响形态学、句法学、语义学和语用学,然而计算研究通常使用不兼容的表征来考察这些层面,因此无法确定它们是否在不同语言中共同演化。我们通过在一个统一分析空间中探究变化的幅度和方向如何随语言层面、语言及历史时期而变化,来解决这一问题。我们提出了ChronoLens框架,它结合了冻结的多语言语言模型、特征对齐的交叉编码器(crosscoders)以及事后语言干预,并将其应用于来自五个议会传统、时间跨度1803至2026年的4498万份文档、约172亿个token。由此得到的稀疏表示与语言学统计的一致性远强于稠密嵌入或池化稀疏自编码器(ρ=0.72,对比0.29和0.28),并揭示出:在同一语言内部,形态学、句法学、语义学和语用学的变化幅度大体相当;而不同语言在变化发生的时间、变化幅度大小以及变化方向上则存在显著差异。这些发现表明,历史语言变化是一个结构化的、多维的过程:相似的变化幅度可能掩盖不同的演变轨迹,而有意义的跨语言比较需要同时测量距离和方向。

查看 arXiv 页面 (https://arxiv.org/abs/2608.03507)查看 PDF (https://arxiv.org/pdf/2608.03507)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.03507)

在您的智能体中获取此论文:

hf papers read 2608\.03507

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2608.03507,即可在本页面关联该模型。

引用此论文的数据集0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.03507,即可在本页面关联该数据集。

引用此论文的Space0

暂无Space关联此论文

在Space README.md中引用 arxiv.org/abs/2608.03507,即可在本页面关联该Space。

收录此论文的收藏集0

暂无收藏集收录此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面关联它。

相似文章

Chronicle:用于联合语言和时间序列理解的多模态基础模型

arXiv cs.LG

Chronicle 是一个 324M 参数的纯解码器 Transformer,从零开始在自然语言和时间序列上预训练,在 NLU 和时间序列分类任务上取得了有竞争力的性能,并在 UCR/UEA 数据集上的冻结嵌入时间序列分类中创造了新的最先进水平。

衡量跨语言理解差距:证据语言如何影响语言模型的理解

arXiv cs.CL

本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。

ChronoVision:通过潜在状态重建进行时间推理

Hugging Face Daily Papers

ChronoVision 是一个多模态框架,通过将视觉逻辑与潜在图像对齐,使用重构视觉头、ROI 注意力定位模块和强化学习,改进视觉语言模型中的时间推理。它引入了 Vbvr-VQA 数据集,并在时间跟踪基准上达到了 SOTA 准确率。

LLM翻译中数字本地化分析

arXiv cs.CL

本文分析了五款大语言模型在英德互译中对时间、数字和日期进行本地化的能力,并测试了改进准确率的策略,发现将本地化原则嵌入提示上下文可带来统计上显著的改进。