标签
本综述指出了阿拉伯语NLP中可解释AI的三个关键差距:方法、任务和语言层面,并提出了一个基于语言学的解释分类法和研究议程。
本文介绍了面向古典梵语的基于语境词汇表生成,这一任务涉及从诗句-翻译对中恢复梵语短语并产生翻译驱动的含义。研究从印度教文本构建了一个基准,并评估了多种AI模型,发现指令微调能提升性能,而形态建模被确定为一个关键挑战。
本文分析了2020年至2025年的NLP会议论文,以考察报告的GPU资源与学术影响力之间的关系,发现虽然资源与更高的引用率相关,但它们只能解释影响力的很小一部分方差。
一项关于嵌入与大语言模型成本效益的讨论,引用了名为'embedder's dilemma'的研究,该研究发现大语言模型以显著更高的成本超越了嵌入模型。
SuTRA是一种形态感知的词元化算法,它保留了印度语言中akshara的不可分割性,减少了形态破碎现象,并在机器翻译指标上相较于标准BPE方法有所提升。
本文证明嵌入空间结构不存在理论上的多语言诅咒,表明所需的最小维度仅随语言数量呈对数增长,这意味着实证问题源于数据和训练条件。
本文对情感分类器在讽刺性和AI改写社交文本上的行为进行了实证研究,揭示了对讽刺文本置信度较低、对AI改写文本准确率更高,以及通过处理低置信度输入来提升性能的弃权方法。
本文表明,语言模型中的重复效应取决于读取位置:相邻重复会提高目标概率,而移位重复则产生倒U形曲线。这一发现挑战了完形填空式探测中的假设,并在多个模型和语言中得到了验证。
这篇arXiv论文提出将能力维持型情感对话(CSED)作为情感支持系统的纵向研究范式,认为当前方法侧重于即时缓解而忽视了用户的长期能力。文献审计显示,大多数系统忽略了纵向结果,从而为数据、模型、评估和治理提出了新的议程。
对Web规模LLM预训练数据中叙事特征的细粒度研究,引入了NarraBERT和NarraDolma来测量叙事模式及其在不同来源中的分布。
本文介绍了一种利用大语言模型生成首Token的置信度来检测幻觉的方法,该方法仅需执行单次解码步骤。