写作风格相似性反映学术谱系
摘要
本研究表明,学术写作风格是从导师那里继承的,并在学术兄弟姐妹之间共享,这导致作者归属系统出现误报。
arXiv:2608.14843v1 Announce Type: new
摘要:随着作者归属系统越来越多地用于检测代写和AI生成的论文,其错误可能支持对合法作者的指控。这些系统假设每位作者的风格是其独有的。然而,研究人员在导师指导下学习,并继承其风格特征。我们从数学谱系项目图中构建了一个包含arXiv作者的语料库,这些作者有$\geq 2$篇独立论文,共涉及$5{,}803$位作者和$2{,}501$对真实的导师-学生配对。使用微调模型的嵌入,导师在余弦距离上比随机同领域作者更接近其学生$39.9\%$。两个开放编码器在$12.6\%$和$14.5\%$上重现了这一效应。\emph{学术兄弟姐妹},即一位导师的两位可能从未见面的学生,在$8{,}360$对配对中更接近$30.4\%$,即使他们在不同机构学习。仅共享机构和领域的配对显示出可忽略的相似性。在相同语料库上进行闭集归属任务时,系统错误发生在真实作者的导师和学术兄弟姐妹身上的概率比随机高出$11$倍。
查看缓存全文
缓存时间: 2026/08/18 09:53
# 写作风格相似性反映学术谱系
来源:https://arxiv.org/html/2608.14843
###### 摘要
随着作者归属系统越来越多地被用于检测代笔和人工智能生成的论文,其错误可能被用来指控合法作者。这些系统假设每位作者的风格是独有的。然而,研究人员在导师指导下学习,并继承其风格特点。我们从数学家谱项目图谱中构建了一个包含≥2篇独立论文的arXiv作者语料库,共有5,803位作者和2,501对真实导师-学生配对。使用微调模型的嵌入向量,导师与学生的余弦距离比随机同领域作者近39.9%。两个开放编码器分别重现了12.6%和14.5%的效果。*学术同门*——来自同一导师的两位学生即使从未见面,在8,360对配对中距离也近30.4%,即使他们就读于不同院校。仅共享院校和领域的配对相似性微乎其微。在对同一语料库进行的封闭集归属任务中,系统错误发生在真实作者的导师和学术同门身上的概率比随机高出11倍。
## 1引言
当归属系统将学生的论文标记为其导师所写时,这种误报在同行评议中难以反驳。此类系统是否系统性产生此类误指控,取决于研究者的写作风格有多少来自导师。
导师与学生共享子领域、院系和母语。每个因素都会独立地夸大风格相似性。因此,我们控制共享领域和院校以发现真实效应。此外,这些关系应可验证而非推断,而现有导师影响的测量缺乏此点(第2节)。为解决此限制,我们从经整理的数学家谱项目图谱构建语料库。
我们的贡献是基于真实数据测量学术谱系在写作风格中的体现。我们将整理后的MGP记录与作者归属嵌入关联,创建2,501对导师-学生配对和14,398对同门配对(包括8,360对不同院校)。据我们所知,这是首次对学术同门进行风格分析。我们用这些结果展示该效应如何导致封闭集归属任务中的显著失败。
## 2相关工作
#### 写作风格动态。
Lazebnik与Rosenfeld (2025) 建模了1370万篇出版物中个体学术风格的演变,发现轨迹在第13篇左右趋于稳定,导师影响在职业生涯早期可测。他们将导师推断为学者前三年出版物中最频繁的合著者,分析未超出直接导师联系。Danescu-Niculescu-Mizil等人(2011;2012)证明在线社区中说话者会向高地位对话者风格靠拢,为导师效应提供理论机制。我们通过对照真实谱系记录及延伸至学术同门来扩展这两条线。
#### 学术谱系。
对MGP的研究追踪研究主题如何通过导师谱系传播。Malmgren等人(2010)显示指导结构塑造物理学生产力轨迹,导师网络位置预测学生长期产出模式。两者都将谱系图视为传递职业属性的渠道;我们询问风格是否通过同一渠道传递。
#### 作者归属。
作者归属系统将文本映射为作者嵌入,通过嵌入空间最近邻搜索识别作者。专用编码器(如LUAR)和内容无关模型(如StyleDistance)代表最先进水平。这些系统基于隐含假设:每位作者风格独立——了解一位作者风格无法推断另一位。我们利用社会结构数据挑战此假设。
## 3数据与方法
#### 语料库。
我们爬取了5,715个数学家谱项目页面,获得6,133位合格人员(拥有≥2篇单作者arXiv论文),其中5,803人有文本和嵌入。我们控制日期为2024年前,以避免大型语言模型普及带来的风格剧变。全部使用单作者论文使嵌入反映真实个体风格。作者文本为每位作者单作者论文的*摘要*,取自arXiv元数据快照(人均5.7篇,中位4篇);嵌入前剥离单位字符串以防止字面重叠夸大同院校相似性。
#### 嵌入。
我们的主编码器(下文“微调编码器”)基于Mistral模型微调,遵循Kandula等人(2025)的作者归属方法。权重和训练数据未发布。块级嵌入(1536维)平均池化至论文级,再到作者级。我们使用余弦距离作为相似性度量。
#### 院校分配。
我们采用每人MGP页面记录的博士学位授予院校。这记录作者*获得博士学位*的地点,非现工作地。我们获得3,609人(59%),来自459所独特院校。
#### 导师-学生配对。
关系直接从MGP图谱数字页面ID读取。将人员解析至arXiv记录时,按精确规范全名匹配,*丢弃*被两个谱系人物认领的姓名(丢弃230人)。得到2,771对导师-学生配对和15,936对同门配对,其中2,501对和14,398对双方均有嵌入,形成分析样本。同门配对按是否同院校训练划分(6,038对/8,360对)。仅不同院校子集支持独立于共享环境的谱系主张,我们将其作为主要同门结果。附录D分析了1,286对导师按职业阶段。
#### 统计验证。
我们每个领域内打乱关系标签(导师或院校)并重新计算均值距离;p值为1,000次打乱中低于或等于观测值的比例(同实验室测试为10,000次)。
#### 开放模型复现。
我们使用LUAR和StyleDistance复现。
## 4结果
### 4.1同实验室相似性
去除导师-学生和同门链接后,仅共享博士院校不会产生可靠风格效应。在作者级置换检验下,同院校均值在微调编码器下比置换零值低3.2%,涉及57,250对(3,083人)。LUAR为-1.0%(p=1.000),StyleDistance为-0.6%(p=0.997)。在标准化尺度上,微调编码器数值为随机陌生人至同一作者距离的5.0%,而导师为61.7%。
表1:按关系的写作风格相似性,微调编码器结果,均以相同随机配对基线测量。%cl = 比随机配对近的百分比。同一作者值使用同一作者论文两半的距离,作为表3的0点。
### 4.2导师-学生相似性
置换检验p<0.001适用于所有编码器。两个开放模型在方向和显著性上与微调编码器一致,但幅度较小:微调编码器下39.9%,LUAR下12.6%,StyleDistance下14.5%。比较嵌入空间存在噪声,我们还发现标准化尺度(表3),微调编码器与StyleDistance接近(61.7%与62.7%趋向同一作者)。
表2:关系距离 vs. 随机同领域基线。导师-学生配对不区分领域,如导师可能与学生发表在不同领域。%cl = 比零值近的百分比。
### 4.3学术同门相似性
同一导师的两位学生在所有编码器下比随机写得更相似(表2)。同门间无经证实联系,且经常在团队中无时间重叠。因此,我们推断其共同风格源于共同导师。
可能有异议认为同门通常同院系训练。但划分配对后,同院校同门比零值近34.2%,不同院校同门近30.4%,差距小于四点。两个开放模型显示此趋势(见表3)。
### 4.4对归属系统的影响
相似性结果本身不确立对作者归属系统的影响。因此我们运行封闭集归属任务并记录其错误。
对语料库中每位至少四篇论文的作者,我们撤出一篇论文,用其余论文构建其档案,按撤出论文的余弦距离排列所有候选作者。池限于相同主arXiv类别。使用微调模型,2,881位作者中系统45.9%情况下将真实作者排第一,产生1,559个错误。
这些错误中有125例(8.02%)系统选择的真实作者是其社会关联人(导师、学生、学术同门或同博士院校)。均匀分布错误仅产生0.73%此情况,因此此结果发生概率比随机高11.0倍(p=6.1×10^{-85})。领域内方向相同:cs 16.6倍、math 11.9倍、cond-mat 10.0倍、math-ph 7.8倍、hep-th 1.8倍。
## 5讨论
我们的结果表明指导在写作风格中留下可测痕迹,而仅共享院校则无此效应。导师及同门相似性的这种差异可能混淆归属系统,其速率比随机高出一个数量级。
导师信号在作者职业生涯中衰减(附录D)与导师风格印记一致。即使学生最初选择写作风格相似的导师,也无法解释相似性随时间下降的特征——这是独立风格出现的标志。
同门可能从未见面或甚至发表在同一领域,排除了合著或共享词汇。因此,共同导师仍是他们写得如此相似的最清晰解释。
#### 局限性。
*领域多样性*:因MGP起源于数学,语料库71%为数学,8% cs,4% hep-th,2% stat,其余40个其他arXiv类别。
*子领域聚集与共享语言背景*:主题混淆受StyleDistance内容无关训练和跨领域检查(附录C)约束。附录B显示语言背景贡献18.1%,我们无法从指导中解析此因素。
## 参考文献
- Danescu-Niculescu-Mizil等人(2011)
- Danescu-Niculescu-Mizil等人(2012)
- Lazebnik与Rosenfeld(2025)
- Malmgren等人(2010)
- Stamatatos等人(2024)
- David等人(2022)
- Rivera-Soto等人(2021)
- Patel等人(2024)
- Kandula等人(2025)
## 附录A标准化效应量尺度
表3:效应量尺度,0锚定于作者自身拆半距离,1锚定于随机同领域作者。LUAR无单文档向量,其下限未定义。
## 附录B负面控制:姓名碰撞误匹配
我们评估2,712对同姓无关同领域作者对。结果共享姓氏的作者风格比随机配对近18.1%(p<0.001)。姓氏是语言背景的合理代理,影响英文写作风格。但同领域导师效应(43.2%)和不同院校同门效应(30.4%)远大于姓氏效应(18.1%)。我们仍报告此现象作为局限性。
## 附录C跨领域稳健性检查
473对跨领域导师配对(定义上不共享子领域)比零值近26.7%(p<0.001),同领域配对为43.2%。效应较弱但仍然显著。若现象纯由主题驱动,此效应不会出现。
## 附录D职业阶段分析
使用1,286对学生有至少四篇带日期论文的配对,我们将每位学生的论文按arXiv日期排序,将前一半合并为早期职业档案,后一半为晚期职业档案,然后分别计算与导师档案的余弦距离。相似文章
当写作风格漂移时:基于题材、时间与AI时代分布偏移的作者验证基准评测
本文介绍了AVShift,这是首个针对题材、时间和AI时代分布偏移下的作者验证的德语基准测试。它评估了基于特征、基于嵌入和基于LLM的方法,发现时间偏移显著影响性能,而未检测到可衡量的AI时代偏移。
AI 写作工具是否正在悄然将所有人的写作风格拉平为同一种声音?
这篇文章探讨了一个假设:AI 写作工具正在微妙地将个人写作风格拉平为一种共同的平均风格,从而可能随着时间的推移降低风格的多样性。
如何复制自己的写作风格
用户询问,在本地LLM中提供其写作风格的样本,是放在对话中更有效,还是放在系统提示中更有效。
LLM生成文本中的文学非风格
本文使用n-gram分布分析LLM生成文本中的统计模式,揭示了其风格缺陷,并表明风格与语义不可分离。
PersonalBench: 衡量大型语言模型个性化中的作者身份差距
PersonalBench 是一个新的基准,通过作者身份验证、LLM-as-judge 和文体测量学来评估 LLM 中的推理时个性化方法。研究发现,虽然这些方法能产生作者区分的输出,但它们并未缩小与人类作者之间的差距。