标签
本文介绍了一个包含17k句子的语料库,该语料库对COVID-19期间三个德国政治领域的论证段落进行了标注,并开展了一项自动识别此类段落的试点研究,发现边界难以确定,且模型存在确认偏差。
本文研究了基于转写的德语视频的作者身份验证问题,在三个自建语料库上比较了传统的 n-gram 方法与基于 Transformer 的方法。传统的字符级和词元级 n-gram 方法优于现代 Transformer 方法,最高达到了 88% 的准确率和 90% 的 AUC。
提出了一种用于东干语的双方言有限状态形态分析器,并通过多体裁评估来衡量词形变化、歧义和词汇覆盖情况。
本文研究了LLM能否在大规模阅读和写作测试中准确预测题目难度等级,发现GPT-4.1准确率中等,但不如ConvBERT,且LLM倾向于低估困难题目的难度。
This paper empirically evaluates how well LLMs align with human emotional perception of news framing, using a YouGov survey of 3,011 UK adults and seven LLMs assessing sympathy in headlines. It finds that alignment varies across models and demographic subgroups, highlighting the importance of differential alignment for AI development.
本数据描述文档介绍了一个大规模语料库,包含从2025年7月为期一个月的实时网络流中捕获的宗教广播转录文本,共计超过70万条录音和6000万行转录文本,并使用大语言模型对节目格式和主题进行了标注。该语料库支持对宗教广播的描述性研究,以及宗教媒体中社会/政治议题的分析。
本文评估了五种阿拉伯语言模型在字符级、单词级和句子级攻击下的对抗鲁棒性,结果表明插入变音符号可使准确率降低92%,对抗训练能提升鲁棒性但存在局限性。
提出了一种深度神经模型,结合多层时序卷积网络和标签级注意力用于医疗编码,在F1和召回率分数上相比先前最先进模型取得了显著提升。
本文评估了大语言模型识别未言明信念(隐含意义)以及通过隐含意义取消来理解信念更新的能力,并引入了专家标注的ImplicatureX数据集。结果表明,大语言模型在自然场景中尤其落后于人类。
本研究评估了四款专有LLM(GPT-4o、GPT-5.2、Claude Sonnet 4.5、DeepSeek)在两个领域英译法的专业术语翻译,并比较了提示策略。结果显示Claude Sonnet 4.5表现最佳,但LLM目前尚无法取代专业语料库。
本文综述了词嵌入计算的各种机制,研究了流行的工具包和嵌入矩阵,并通过选定的实现进行实验以理解其特性。
本文提出了一个用于攻击性语言检测中跨域和跨语言泛化的诊断与优化框架,将性能下降分解为数据集效应和语言效应,并量化了多语言能力与源任务性能之间的权衡。
本文介绍了IHLC在LT-EDI 2026共享任务中的提交方案,使用LoRA微调进行性别中性重写(排名第3)和激活引导进行对立叙事生成(排名第6),同时展示了其潜力与局限性。
本文介绍了一项形成性研究,采用两阶段LLM流水线(Gemini 2.5 Pro 和 Flash)检测电子健康记录中的内部文档不一致性,分析了3000份出院小结,并提出了一种分级本体来对不一致性进行分类。
本研究分析了不同类型的审稿指南(正式会议指南与模仿审稿人指南)如何影响基于LLM的自动化同行评审,发现正式指南产生的结果与人类判断更一致,而严格的评分细则则会降低性能。
本文介绍了GAND,这是一个用于分析机器翻译中性别偏见的性别模糊自然英语句子的基准测试资源,并利用对比翻译进行可解释性分析,以揭示影响性别分配的源词。
Cleanlist AI 是一款用于自然语言潜在客户开发的产品,可帮助查找、丰富和同步潜在客户。
本文研究了使用大语言模型(LLMs)和监督分类器从社交媒体文本中检测抑郁症的方法,提出了一种基于提示的嵌入方法以增强可解释性。在多个数据集上的实验表明,零样本LLMs在二分类任务中表现良好,但在细粒度严重程度分类上表现不佳;而基于LLM摘要嵌入的监督模型在多分类和有序分类任务中取得了更一致的表现。
本文提出了一种使用上下文模型进行多语言怨言标注的方法,改进了单词级词典,解决了循环评估问题,并通过读取上下文实现了更好的性能。
本文通过分析人类对道德场景的标注,探究效价特征是否能够反映自然语言中的道德性,发现显著相关性,并在二元道德分类中实现了0.764的马修斯相关系数。