标签
CMNIE 是一个针对中文军事新闻的新型信息抽取基准,它联合标注事件、实体和关系,以评估模型在模式遵循和精确跨度匹配方面的表现。
GUIDE 是一个用于中文查询纠正的生成式无监督框架,利用语音和视觉共享ID编码来约束纠正并适应不断变化的词汇,在实验和在线A/B测试中超越了基线。
本文提出了SeTox,一种搜索增强的大语言模型框架,通过利用实时网络上下文和公众共识来检测中文新词中的隐性毒性。实验表明,即使是3B规模的模型,在此任务上也优于近期更大的模型。
本文提出CNM,一种轻量级增强方法,通过表意描述序列将汉字的离散组合结构注入BERT,在提升稀有字符和未登录字符性能的同时保持通用自然语言理解准确率。
本文提出了一种用于跨平台中文攻击性评论检测的双阈值难例挖掘策略,以解决因领域偏移导致的性能下降问题。该方法在COLD数据集上微调RoBERTa模型,并利用极少数标记数据将其适应于四个中文社交媒体平台。
本文利用 MIPVU 框架和 PSU 中文隐喻语料库,建立了用于 Token 级中文隐喻识别的可复现多架构基线。研究比较了 RoBERTa 和 MelBERT 等编码器模型与 Qwen3.5-9B 生成式模型的性能,并开源代码和数据以推动后续研究。
北京大学研究人员提出了CFMS,这是首个细粒度中文多模态讽刺检测基准,包含2,796个图像-文本对和三级标注框架(讽刺识别、目标识别、解释生成),以及一种新颖的强化学习增强上下文学习方法(PGDS),该方法显著优于现有基线。