标签
论文描述了提交给 WMT 2026 MIST 共享任务的内容,使用 Tiny Aya Global 模型以及为多语言摘要和问答任务专门设计的 QLoRA 适配器。
本文介绍了REAP,一个用于从LLMs构建闭卷知识库的两阶段流程,它结合了针对特定关系的启发策略与确定性JSON解析,在使用Mistral-Small-24B-Instruct-2501的AKBC Shared Task 2026测试集上实现了0.62的宏F1分数。
This paper presents EVIL-Detect, a multi-signal ensemble framework with conflict-aware fusion for detecting LLM-generated, refined, and human-written Chinese text in the NLPCC 2026 Shared Task 6, achieving first place with a macro-F1 of 0.8888.
本文介绍了uOttawa团队在EvaLatin 2026古典拉丁语命名实体识别共享任务中使用的系统,通过商业LLM(Gemini 2.5 Pro和Claude Sonnet 4-5)的提示工程,在粗粒度和细粒度NER子任务中均获得第一名。
本文提出了一种三阶段神经符号流水线用于游戏毒性检测,结合了Transformer集成与基于规则的调解,在EEUCA 2026共享任务中取得了最高准确率。
本文介绍了LLM-INSTRUCT,它是ArgMining 2026 UZH Shared Task中段落级论点挖掘任务的获胜系统。该系统采用约束感知检索和选择性辩论来提高准确性和schema合规性。
本文宣布了将在NLPCC 2026上举办的首届ChineseBabyLM挑战赛。该挑战赛要求研究人员使用1亿中文词元从头训练语言模型,并在自然语言理解、认知对齐和汉字知识三个任务轨道上进行评估,旨在推动面向中文的高数据效率与认知合理的建模。
本文介绍了NLPCC 2026 共享任务1:难度感知的多语言多模态医学教学视频理解评估(DA-MIVQA)。该任务在以往基准测试的基础上,增加了难度感知标注,并包含三个赛道:时间答案定位、视频语料库检索以及语料库内定位。数据集来自公共频道的医学教学视频,旨在评估系统在不同推理需求下的表现。
本文描述了在 CLPsych 2026 共享任务中,使用包括 LSTM、BERT 和 LLMs 在内的自然语言处理方法分析社交媒体帖子中的心理健康状态,并在摘要任务中取得了最高的一致性得分。
本文介绍了一个基于LLM的流水线,用于从按时间顺序排列的社交媒体帖子中分析心理健康变化,参与CLPsych 2026共享任务。它可以进行帖子级别评估和用户级别时间建模,以捕捉心理健康的转变。
本文介绍了DistilledGemma,一个用于从多语言历史报纸文章中抽取人物-地点关系的系统,该系统采用从26B参数的Gemma教师模型到2.3B参数的学生模型的三阶段知识蒸馏流程,在HIPE-2026共享任务中实现了具有竞争力的准确性和效率。
本文描述了UOL@IDEM在BEA 2026 L1感知词汇难度预测共享任务中的封闭赛道提交方案,结合多语言上下文表示与工程化特征。该系统在西班牙语、德语和中文上取得了有竞争力的RMSE分数,其中词频是最稳定的预测因子。
本文概述了QIAS 2026共享任务,该任务聚焦伊斯兰继承推理,利用MAWARITH基准评估大语言模型在多步骤法律和数值推理方面的能力。
CUNY在CLPsych 2026共享任务中的提交采用了一种流水线方法,结合了上下文学习与开放权重大型语言模型、监督分类器和检索增强生成,用于从Reddit时间线中分类和总结心理健康变化,在多个子任务中取得了最高排名。
本文介绍了 Counter Turing Test 共享任务在AI生成文本检测方面的发现,顶级系统在二分类任务中达到了完美表现,但在模型归因方面性能显著较低,突显了区分不同大语言模型输出的难度。
佛罗里达大学Gators团队提交至AmericasNLP 2026共享任务,该任务涉及面向土著语言的文化图像描述。我们采用双阶段流水线:使用Qwen2.5-VL生成西班牙语中间描述,然后通过检索增强的多示例提示,利用Gemini 2.5 Flash生成目标语言描述。与基线相比,取得了显著提升。
本文提出了一种基于LLM的多语言共指解析的两阶段自适应方法,在CRAC 2026的LLM赛道中以74.32的CoNLL F1分数获得第一名。该方法使用多语言基适配器后接数据集特定适配器对Gemma-3-27b进行微调。
本文介绍了两种词汇难度预测模型:一种是通过软目标损失微调的黑盒大语言模型,实现了高准确度;另一种是可解释模型,能提供对难度因素的深入分析。这些模型参与了BEA 2026共享任务,并取得了强相关性。
本文详细介绍了 RETUYT-INCO 团队参与 BEA 2026 共享任务 2 的情况,提出了一种用于德语简答题基于评分标准(rubric-based)评分的元提示词(meta-prompting)方法。
本文介绍了一个用于 EEUCA 2026 游戏聊天毒性检测共享任务的系统,该系统通过结合合成数据增强微调 Llama 3.1 8B 模型,获得了第四名。文章重点阐述了一种“验证陷阱”现象:由于数据分布偏移,较高的验证分数与测试集表现并不相关。