标签
本文提出了用于逆转中世纪文本中字符集简化和缩写的神经方法,采用一对一和带状RNN,并通过自监督或平行语料库进行训练,同时介绍了一个用于字母还原的Python库。
本文介绍了L-MAD,一个用于系统性评估法律文本蕴含中多智能体辩论结构的框架。研究发现,增加智能体数量可提升准确率,但延长辩论轮次会导致有害的过度 deliberation 漂移,使得智能体互相强化错误,相较于单智能体基线最高提升8%。
本文提出一个基于大语言模型(LLM)的两阶段系统,利用包含119种事件类型的三层分类法,从SEC 8-K文件中提取可溯事件标签,并具备约束与可审计机制。该系统在近30万份文件上进行了评估,在高质标签上展现出高精确度,并支持区分经济意义上不同事件的事件研究。
斯坦福NLP宣布,一篇题为《大语言模型中的未完成体悖论》的语言学视角NLP论文在ACL 2026上获得最佳论文奖,鼓励对大语言模型进行更细致的语言学评估。
本文审计并缓解大型语言模型中的方言偏见,显示它们系统性地偏好标准美式英语而非非裔美国人英语。作者引入了激活操控,一种无需训练的方法,在保持流畅性的同时显著减少偏见,并发布了迄今为止最大的真实AAE平行语料库。
这篇 ICML 论文介绍了递归模型,这些模型递归地调用自身在隔离上下文中解决子任务,证明它们可以在长时推理中超越上下文受限的自回归模型。在 SAT 求解和围棋博弈树搜索上的实验表明,使用较小的活动上下文能提高准确性。
本文探讨了在使用冻结的预训练语言模型骨干时,显式域适应方法是否对情感迁移有益,发现其有效性取决于骨干是否已经拥有目标域知识。
本文介绍了UCSC NLP在SemEval-2026 Task 10(PsyCoMark)中使用的系统,针对阴谋论标记提取采用了基于边界感知的跨度抽取与RoBERTa,以及文档级别的阴谋论分类(含标签平滑)。该系统在子任务1中排名第7,在子任务2中排名第12。
本研究分析了来自自我报告ADHD和ASD用户的推文,利用NLP刻画DSM-5抑郁症状,发现尽管分类性能有限,但两组在症状表达上存在群体层面的差异。
本文综述了印度语言自然语言处理(NLP)的挑战与演变,强调文化遗产,并提出一个名为“文化感知”的新研究方向,以解决代表性差距并确保AI输出具有文化意义。
本文介绍了Nimblemind多智能体系统(nMAS),用于从胃活检报告中提取幽门螺杆菌感染证据,在216个特征病例决策中达到98.61%的准确率,并显示出相比人工审查显著节省时间。
本研究探讨了大型语言模型能否为投射技术生成合成消费者数据,通过比较人类与LLM在城市旅游感知上的回应,发现两者在主题上高度重叠,但在风格、语言结构和多样性生成方式上存在重要差异。
本文解释了 Genie Ontology 方法如何通过关注底层机制而非营销宣传来提高 text-to-SQL 准确率。
本文介绍了不变-可变解耦状态空间模型(IVD-SSM),这是对 SemEval-2026 任务4的提交,该模型使用混合 Jamba-1.5-Mini 骨干网络和新型结构门控对齐头,从词汇变体中解耦结构不变性,用于叙事相似性评估。
本文提出了一种基于注意力的多实例学习(ABMIL)框架,利用癌症登记处的患者级别标签来训练用于肿瘤组分类的深度学习分类器,无需每份报告的注释,在BC癌症登记处的任务上实现了0.83的宏F1。
本文介绍了CaresAI在SMM4H-HeaRD 2026共享任务上的方法,该任务利用多种嵌入和分类器从病理报告中预测TNM分期,取得了强劲结果,但也指出了泛化问题。
TACG 是一种无需训练的扩散语言模型解码器,通过轨迹感知信号决定何时提交 token,在代码和数学基准测试中提高了准确性和效率。
本文描述了在 CLPsych 2026 共享任务中,使用包括 LSTM、BERT 和 LLMs 在内的自然语言处理方法分析社交媒体帖子中的心理健康状态,并在摘要任务中取得了最高的一致性得分。
一项分析2010年至2026年间14.2万篇NLP论文的研究发现,资深和新兴的NLP作者越来越多地将论文发表在NeurIPS和ICLR等通用机器学习会议上,而非ACL等核心NLP会议,且ML会议具有显著的引用优势。