小型语言模型中的可解释跨语言对齐:探究日英双语大语言模型中的文化与语用推理

arXiv cs.CL 论文

摘要

本文通过探究文化和语用推理,研究小型日英双语语言模型中的跨语言对齐,引入J-PragEval-v0基准,并提出用于推理时干预的Pragmatic Representation Steering方法。

arXiv:2608.14896v1 公告类型:新 摘要:大型语言模型在英语上表现良好,但在与之类型学距离较远的语言上表现方式难以理解。日语是一个典型的例子,其中的评估仍然依赖于翻译质量和JGLUE风格的基准,这些基准将词汇、句法和语用能力合并为一个分数。通用模型让日语用户失败的现象是语用方面的:敬语、内群体和外群体指代、上下文敏感的礼貌、零回指。 我引入了J-PragEval-v0,一个最小对基准,隔离了四种此类现象而不考虑表面流畅性,并将其与线性探针和教师强制对数概率评估相结合,以询问TinySwallow-1.5B(28层,隐藏大小1536)内部的相应对比存在于何处。这四个特征分为三类。敬语寄存器清晰地位于残差流中:在第15层的平衡准确率为0.96,并且模型在93%的项目上根据场景翻转其首选延续。隐含主语和内群体指代在最终提示标记处不可线性解码(0.48和0.38),但翻转率分别为0.77和0.79,因此对比是在生成过程中完成的,而不是存储在提示中。间接拒绝是负面案例:探针准确率为0.95,在长度归一化教师强制下翻转率降至0.43,因为当前最小对将礼貌与延续长度混为一谈。 我还指定了Pragmatic Representation Steering,一种无参数的推理时方法,它沿着探针识别的类均值差方向编辑残差流激活。可行性是间接论证而非演示的:对比激活添加基线,即该方法将注入的相同几何结构,在存在线性信号的任何地方都能将探针准确率恢复到逻辑回归的1到2个百分点内。扩展到Llama-3.1-Swallow-8B是下一步。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:55

# 小型语言模型中可解释的跨语言对齐:探查日英双语LLM中的文化与语用推理  
来源:https://arxiv.org/html/2608.14896  
braunf\.com附属机构:\[2pt\] ORCID: 0009\-0003\-5285\-9327  

2026年4月  

###### 摘要  

大型语言模型在英语上表现良好,但在类型学差异较大的语言上表现难以理解,日语就是一个典型例子。本文聚焦日语LLM研究的两个核心问题。第一个问题关于*小型语言模型*。日本团队如Sakana AI(TAID, TinySwallow\-1\.5B)和东京科学研究所的Swallow项目在SLM领域的许多方面领先国际,但评估仍依赖翻译质量和JGLUE式基准测试,这些基准将词汇、句法和语用能力混为单一分数。第二个问题涉及日语的语用与文化层面:敬语、内/外群体指代、上下文敏感的礼貌表达、零形回指。这恰恰是通用LLM在日语用户面前表现最差的领域,也是现有基准测试最缺乏说明的部分。  

本文通过一项可解释性驱动研究同时应对这两个问题。我引入J\-PragEval\-v0,这是一个将四种日语语用现象与表层流畅度隔离的最小对立对基准测试,并结合线性探针和强制教师对数概率评估,探究TinySwallow\-1\.5B(28层,隐藏维度1536)中对应的语用对比实际存在于何处。四个特征分为三组:敬语层级清晰地位于残差流中——探针在第15层达到0\.96平衡准确率,且模型在93%的项目中随场景变化翻转其首选续写;隐式主语和内/外群体指代在最终提示符处无法线性解码(平衡准确率分别为0\.48和0\.38),但行为翻转率达0\.77和0\.79,表明对比是在生成过程中而非存储于提示符时完成的;间接拒绝是反例:探针准确率0\.95,但在长度归一化的强制教师评估下翻转率仅为0\.43,因为当前最小对立对集将礼貌性与续写长度混为一谈。在控制方法上,我提出*语用表征引导*(PRS),这是一种无需参数的推理时方法,沿探针识别的类均值差异方向编辑残差流激活。可行性通过间接论证:CAA基线(即PRS将注入的相同几何结构)在线性信号存在处可将探针准确率恢复至逻辑回归的1–2个百分点内。将干预扩展到Llama\-3.1\-Swallow\-8B并在MMLU/HellaSwag上测量能力保持度是下一步计划。本研究立足于东北大学坂口–乾实验室、理研AIP自然语言理解团队及东京科学研究所Swallow项目的活跃研究群。  

关键词:大型语言模型,小型语言模型,日语NLP,跨语言迁移,机械可解释性,激活补丁,表征工程,语用学,文化对齐。  

## 1 引言  

### 1\.1 动机  

过去两年,NLP社区对语言模型的认知有两个关键转变,本文正立足于二者的交汇点。第一,参数量不再是唯一重要维度。蒸馏、稀疏专家混合与小型稠密模型如今能在特定领域内以极小计算量完成前沿系统的大量功能。第二,可解释性已从特殊工具变为常规工程。激活补丁、稀疏自编码器与表征工程已从边缘探索转变为常用工具,“模型为何如此行动”这一问题正开始通过内部计算而非仅输入输出行为来解答。  

日本恰在这两方面都具备优势。Sakana AI与东京科学研究所Swallow团队合作开发的时序自适应插值蒸馏(TAID),催生了TinySwallow\-1\.5B——一个在日语任务上大幅超越更大基线模型的1\.5B参数日语模型。面向文化的小型模型并非猎奇之作;它们本身就是严肃的研究方向。在可解释性方面,理研AIP自然语言理解团队的使命明确为“可解释、可信的自然语言处理”,而东北大学坂口–乾实验室(由坂口敬介与乾健太郎共同领导,坂口于2026年4月晋升正教授)持续发表关于LLM思维链可解释性与文化理解的成果,在EACL 2026、ICLR 2026上获得录用,并在宇都宫NLP2026会议上派出最大规模代表团。  

这两个方向之间存在鸿沟。双语日英小型模型的实际评估常依赖翻译质量、JGLUE式阅读理解或JCommonsenseQA。这些基准测试告诉我们模型输出了什么,却几乎无法揭示其如何内部表征日语的语用与文化维度。然而正是这些维度(敬语、隐式主语、内/外群体指代)让通用LLM最频繁地在日本用户面前出丑。弥合鸿沟意味着将文化能力视为表征属性而非行为结果:它是可探测、可定位、可编辑的。  

### 1\.2 问题陈述  

设M为日英双语SLM。由此引出三个问题,它们将贯穿全文:日本语用特征实际存在于网络何处?如何在避免表层流畅度干扰的情况下评估语用能力?能否通过一种不改变英语能力的轻量干预*提升*该能力?  

### 1\.3 研究问题  

RQ1,定位问题。在日英双语SLM中,日本语用特征(如敬语、隐式主语、内/外群体标记)在网络何处编码(哪些层、哪些注意力头、残差流的哪些子空间)?  

RQ2,评估问题。如何*独立于*表层翻译质量评估语用与文化能力,从而避免JGLUE式任务上的良好结果掩盖深层文化失败?  

RQ3,干预问题。在语用特征已定位的前提下,是否存在一种无需全面微调的轻量推理时方法,在保持英语能力不变的同时提升日语SLM的语用能力?  

### 1\.4 贡献  

本文贡献有四:第一,J\-PragEval\-v0,一个覆盖四种日语语用现象的最小对立对评估套件:敬语层级选择、隐式主语消解、内/外群体指代与间接拒绝。测试项设计使正确答案由语用而非语义决定。发布版本每个特征包含56个已标注项目(共224个),其发布架构支持未来扩展而不改变接口。第二,对TinySwallow\-1\.5B的探针与行为研究,报告三种探针方法(逻辑回归、类均值差异/CAA、随机方向)在五次随机划分下的逐层平衡准确率,结合长度归一化的强制教师场景敏感性评估。研究显示四个特征分为:可清晰解码的案例(敬语)、场景效应为行为性但在线性提示符最终标记处不可见的两个特征(隐式主语、内/外群体指代),以及探针信号在行为评估下被证明为数据集假象的特征(间接拒绝)。第三,提出语用表征引导(PRS)规范及基于CAA的可行性论证:凡存在探针信号之处,PRS将注入的类均值差异方向可在逻辑回归准确率的几个百分点内恢复精度,这是引导机制有效的算术前提。PRS的完整行为评估、向Llama\-3.1\-Swallow\-8B的跨模型迁移及在MMLU/HellaSwag上的能力保持测量是后续研究的核心。第四,开放研究资产:代码、基准测试项、缓存残差流激活、探针权重及分块结果JSON均以宽松许可证发布,以支持可重复性及日语NLP社区的进一步研究。  

### 1\.5 论文结构  

第2节(https://arxiv.org/html/2608.14896#S2)回顾跨语言迁移、小型语言模型、机械可解释性及日语语用学的相关研究。第3节(https://arxiv.org/html/2608.14896#S3)固定符号表示。第4节(https://arxiv.org/html/2608.14896#S4)构建探针框架、J\-PragEval基准测试及PRS干预方法。第5节(https://arxiv.org/html/2608.14896#S5)报告实验:模型、数据、指标、探针结果、强制教师行为评估、基于CAA的PRS可行性论证及消融研究。第6节(https://arxiv.org/html/2608.14896#S6)阐述研究的科学、社会与伦理意义,包括其与日本NLP研究格局的关系。第7节(https://arxiv.org/html/2608.14896#S7)列出局限与风险。第8节(https://arxiv.org/html/2608.14896#S8)作结。  

## 2 背景与相关工作  

### 2\.1 LLM中的跨语言迁移  

跨语言迁移实践中有三种形式:零样本迁移将英语优先模型直接用于目标语言,依赖预训练数据中偶然存在的多语言信号;持续预训练(如Swallow项目方法)通过大规模日语网络文本、维基百科及平行语料扩展Llama系列,生成Llama\-Swallow模型;指令微调则在预训练模型上叠加相对小的目标语言指令集。  

当目标语言在类型学上与英语差异显著时,这三种范式评估效果不佳。它们将三方面混为单一分数:模型是否选择可信的日语词汇、是否正确处理话题标记/零形回指/一致关系、是否选择恰当语态、保持视角一致并尊重内/外群体区分。标准基准可靠地衡量第一点,部分衡量第二点,基本忽略第三点。模型可能在JGLUE上表现良好却产生社交不当或语用不连贯的输出。  

### 2\.2 小型语言模型与蒸馏  

日本对SLM领域最重要的近期贡献是TAID\[1 (https://arxiv.org/html/2608.14896#bib.bib1)\],它在蒸馏过程中以时间依赖方式插值学生与教师分布。TAID催生了TinySwallow\-1\.5B——由东京科学研究所Swallow团队与Sakana AI共同发布的1\.5B参数日语模型\[2 (https://arxiv.org/html/2608.14896#bib.bib2)\]。该模型在日本基准测试中超越远大于它的基线模型,这正是将SLM视为首要研究对象而非实用妥协的动力。Preferred Networks的PLaMo系列及日益增长的领域专用蒸馏模型构成了完整图景:日本AI生态正快速迈向高效、可部署的系统。  

在国际上,SLM研究已产生一系列被广泛研究的通用模型,包括Phi、Mistral、Gemma和Llama\-3\-8B。本文中它们主要作为英语优先基线,用于与日本适配模型比较。  

### 2\.3 机械可解释性  

机械可解释性旨在将神经网络逆向工程为人类可理解的内部计算。三类方法至关重要:线性探针从某层激活中解码目标特征,拟合成本低但仅能建立相关性而非因果性;激活补丁与路径补丁\[13 (https://arxiv.org/html/2608.14896#bib.bib13),14 (https://arxiv.org/html/2608.14896#bib.bib14)\]通过将损坏前向传播的激活替换为干净传播的激活并衡量行为恢复程度来建立因果关系;表征工程\[15 (https://arxiv.org/html/2608.14896#bib.bib15)\]在推理时编辑激活以推动模型行为向期望方向发展,无需梯度更新。理研AIP自然语言理解团队在2026年持续发表该领域成果,包括LLM如何内部执行思维链推理的工作。  

### 2\.4 日语语用学  

日语语用学在多个语法化维度上与英语存在差异,这些正是本文的实证研究目标。敬语(keigo)构成强制性的语态系统:尊敬语(sonkeigo)、自谦语(kenjōgo)与郑重语(teineigo)。语态选择受说话人-听话人关系及动词所指对象双重制约。主语省略是无标记情况而非例外,这使得解释依赖于内/外群体(uchi/soto)推理。动词对如ageru/kureru与iku/kuru编码说话人的视角对齐而非真值条件。而间接拒绝(如用“有点...”礼貌推辞)则是仅从翻译中无法察觉的语用推理。  

### 2\.5 LLM中的文化对齐  

文化对齐是ICLR 2026的显著议题,日本与国际团队记录了通用LLM在文化特定任务上的失败。多数工作停留在行为层面评估,通常不深入模型内部探究失败实际发生在计算的何处。本文旨在作为补充:提供与行为分析并行的机械性解释。  

### 2\.6 日语NLP研究格局  

三个研究团队是本文的学术同行:东北大学(信息科学研究科)坂口–乾实验室在LLM可解释推理与文化理解方面的工作,其在EACL 2026与ICLR 2026的产出及宇都宫NLP2026会议上73场报告(单个团队最多)直接映射至本文方法论;理研AIP自然语言理解团队的使命声明“可解释、可信的自然语言处理”几乎与本文动机逐字对应;东京科学研究所(冈崎与横田实验室,联合AIST)Swallow项目产出Llama\-3\.1\-Swallow与Llama\-3\.3\-Swallow系列,并与Sakana AI共同生成本文主要实验对象TinySwallow\-1\.5B蒸馏模型。Sakana AI与Preferred Networks提供产业背景:高效、文化适配的日语LLM是其产品(Sakana 2026年3月发布的Namazu系列及Preferred的PLaMo家族是可见案例),市场需求持续增长。  

## 3 预备知识与符号表示  

L

相似文章

安全对齐幻觉:LLMs中的跨语言安全差距

arXiv cs.AI

本文介绍了INCLUDE,一个多语言评估基准,用于量化LLMs中以印度为中心的社会文化偏见,揭示非英语印度语言比英语表现出更高的偏见,表明存在跨语言安全对齐差距。

跨语言探索参数化知识

arXiv cs.CL

本文探索了跨语言提示策略,以改进对大语言模型中参数化知识的访问,并在涵盖17种语言的多语言基准测试中展示了知识迁移和事实召回方面的显著提升。