标签
本文提出了一种使用上下文模型进行多语言怨言标注的方法,改进了单词级词典,解决了循环评估问题,并通过读取上下文实现了更好的性能。
本文通过分析人类对道德场景的标注,探究效价特征是否能够反映自然语言中的道德性,发现显著相关性,并在二元道德分类中实现了0.764的马修斯相关系数。
本文提出了一种三阶段神经符号流水线用于游戏毒性检测,结合了Transformer集成与基于规则的调解,在EEUCA 2026共享任务中取得了最高准确率。
本文介绍了LLM-INSTRUCT,它是ArgMining 2026 UZH Shared Task中段落级论点挖掘任务的获胜系统。该系统采用约束感知检索和选择性辩论来提高准确性和schema合规性。
本文认为,text-to-SQL 基准测试必须考虑到真实世界数据存储的复杂性和挑战,而不仅仅是理想化的数据集。
本文提出了一种基于理据引导的知识蒸馏框架,用于跨语言立场检测,利用大型语言模型的思维链提示,通过双路径蒸馏和对比学习训练一个紧凑的学生模型。
本文探讨了使用微调LLM识别英国警方事件日志中的脆弱性指标(精神健康问题、物质滥用、酒精依赖、无家可归),发现虽然LLM能够产生有意义的患病率估计,但需要谨慎的方法学支持,并且不适用于个人层面的决策。
AEGIS是一个探索性框架,用于研究跨英语、普通话和韩语的跨度级引导的多语言去毒化,分析显式理由如何影响毒性降低与意义保留之间的权衡。
本文介绍了在COLIEE 2026竞赛中用于法律检索、蕴含和判决预测任务的自适应流水线,采用了多阶段检索、重排序和基于LLM的推理。
本文介绍了MoNIM,一种可学习的记忆模块,它将注意力头的归纳能力与前馈网络相结合,使半参数语言模型能够实现可扩展的持续学习,提高了新知识的学习效率与保留能力。
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
庆应义塾大学公开了数字信号处理和自然语言处理的讲义幻灯片,可供任何人用于学习。
本文介绍了认知立场灵活性探测(ESFP),这是一个行为基准,用于测量大语言模型在将主张归因于专家与表达自身立场之间如何转换其认知语域。通过评估八款前沿模型,作者发现认知灵活性在很大程度上与通用能力正交,其中立场内容密度提供了最强的信号。
一篇研究论文,提出了SeRIn,一种多模态融合方案,将模态特定细化与跨模态交互分离,在CH-SIMS和CMU-MOSEI情感分析基准上取得了最先进的结果。
本文探讨了基于翻译的微调作为低资源语言本地语言BERT模型的资源高效替代方案的可行性,发现在六项NLP任务中,53.3%的情况下其性能相当或更优。
Pythia是一个多智能体系统,能够自主编写和优化用于临床概念的提取提示,无需手动提示工程或微调,使用本地托管的开放权重模型。在临床症状检测中,其平均敏感度为0.76,特异度为0.95,在特异度上优于基于词典的方法。
本文引入了参考抽象度(RA)、摘要抽象度(SA)和抽象比率(AR)等度量指标,通过使用文档长度的调和均值与三次非重叠因子来量化文本摘要中的抽象性。在XSUM数据集上对四种模型进行的经验评估表明,这些度量能够有效区分抽取式摘要和生成式摘要,并能识别潜在的幻觉问题。
本文提出了一种由分隔符引导的自底向上成分句法分析器,通过从栈配置推导元数,消除了对显式元操作的需求,在PTB和CTB上以更小的操作库存取得了有竞争力的结果。
介绍深度熵引导采样(DEGS),一种无需训练、测试时的方法,利用大语言模型中逐层熵崩塌来改善推理能力,无需强化学习训练,达到与RL后训练模型相竞争的结果。
本文提出了CasAug,一种基于CasRel框架并采用语义增强机制的关系抽取模型,旨在解决三元组重叠问题,实验表明其性能优于基线模型。