标签
本文分析了122种语言,表明依存长度最小化在功能性依存(短且不变)与词汇性依存(较长且可变)上的作用不同,这表明语法为语言处理提供了局部支撑。
本文介绍了UD_Czech-PDTC,这是通用依赖框架下捷克语的一个大型、体裁多样的树库,源自Prague Dependency Treebank-Consolidated。文章描述了转换过程以及两种标注方案之间的差异。
大语言模型能够通过结构化的语言学推理轨迹改善低资源语言的翻译,其最显著的效益出现在推理阶段而非训练阶段。
本文研究大语言模型是否编码了通用依存关系(UD)无法捕捉的句法抽象(如阶段边界),通过在wh-移动刺激上设计UD距离不变的结构探针,在13个LLM中发现了阶段结构表示的证据,且这些表示具有因果活性。
本文介绍了一种可复现的流水线,用于构建面向Katharevousa希腊语议会文本的Universal Dependencies风格解析资源,包括OCR重建、LLM辅助标注以及多个解析器的评估。最佳模型(XLM-R)达到了0.8893的UPOS准确率和0.5162的LAS,显著优于现成的基线模型。
CAIT 是一个开源的句法分析工具包,用于分析儿童-成人互动,包含一个依存句法分析器、词性标注器和构式标注器,这些模型基于 UD-English-CHILDES 树库训练,性能优于 SpaCy 和 Stanza 等通用英语句法分析器。
乔治城大学研究团队通过将通用依存句法解析与双语注释一起加入上下文提示,显著提升了低资源科普特语到英语的翻译效果,刷新最佳纪录。