shared-task

标签

Cards List
#shared-task

PSK 在 WMT 2026 MIST:用于多语言摘要和问答的任务专用 QLoRA 适配器

arXiv cs.CL · 2天前 缓存

论文描述了提交给 WMT 2026 MIST 共享任务的内容,使用 Tiny Aya Global 模型以及为多语言摘要和问答任务专门设计的 QLoRA 适配器。

0 人收藏 0 人点赞
#shared-task

REAP:面向LLM的闭卷知识库构建的关系感知启发与解析

arXiv cs.CL · 2026-08-12 缓存

本文介绍了REAP,一个用于从LLMs构建闭卷知识库的两阶段流程,它结合了针对特定关系的启发策略与确定性JSON解析,在使用Mistral-Small-24B-Instruct-2501的AKBC Shared Task 2026测试集上实现了0.62的宏F1分数。

0 人收藏 0 人点赞
#shared-task

EVIL-Detect for NLPCC 2026 Shared Task 6: LLM-Generated Text Detection

arXiv cs.CL · 2026-08-12 缓存

This paper presents EVIL-Detect, a multi-signal ensemble framework with conflict-aware fusion for detecting LLM-generated, refined, and human-written Chinese text in the NLPCC 2026 Shared Task 6, achieving first place with a macro-F1 of 0.8888.

0 人收藏 0 人点赞
#shared-task

通过LLM提示实现古典拉丁语命名实体识别的迁移学习

arXiv cs.CL · 2026-08-06 缓存

本文介绍了uOttawa团队在EvaLatin 2026古典拉丁语命名实体识别共享任务中使用的系统,通过商业LLM(Gemini 2.5 Pro和Claude Sonnet 4-5)的提示工程,在粗粒度和细粒度NER子任务中均获得第一名。

0 人收藏 0 人点赞
#shared-task

thaulab@EEUCA 2026: 谁对谁说了什么?一种目标感知的神经符号流水线用于游戏毒性检测

arXiv cs.CL · 2026-07-24 缓存

本文提出了一种三阶段神经符号流水线用于游戏毒性检测,结合了Transformer集成与基于规则的调解,在EEUCA 2026共享任务中取得了最高准确率。

0 人收藏 0 人点赞
#shared-task

UZH Shared Task 2026中的LLM-INSTRUCT:用于段落级论点挖掘的约束感知检索与选择性辩论

arXiv cs.CL · 2026-07-24 缓存

本文介绍了LLM-INSTRUCT,它是ArgMining 2026 UZH Shared Task中段落级论点挖掘任务的获胜系统。该系统采用约束感知检索和选择性辩论来提高准确性和schema合规性。

0 人收藏 0 人点赞
#shared-task

首届ChineseBabyLM挑战赛:面向中文的高数据效率与认知合理语言模型训练

arXiv cs.CL · 2026-07-14 缓存

本文宣布了将在NLPCC 2026上举办的首届ChineseBabyLM挑战赛。该挑战赛要求研究人员使用1亿中文词元从头训练语言模型,并在自然语言理解、认知对齐和汉字知识三个任务轨道上进行评估,旨在推动面向中文的高数据效率与认知合理的建模。

0 人收藏 0 人点赞
#shared-task

NLPCC 2026 共享任务1综述:难度感知的多语言多模态医学教学视频理解评估

arXiv cs.AI · 2026-07-09 缓存

本文介绍了NLPCC 2026 共享任务1:难度感知的多语言多模态医学教学视频理解评估(DA-MIVQA)。该任务在以往基准测试的基础上,增加了难度感知标注,并包含三个赛道:时间答案定位、视频语料库检索以及语料库内定位。数据集来自公共频道的医学教学视频,旨在评估系统在不同推理需求下的表现。

0 人收藏 0 人点赞
#shared-task

psytechlab 在 CLPsych 2026:利用自然语言处理方法和大型语言模型进行社交媒体文本分析

arXiv cs.CL · 2026-07-07 缓存

本文描述了在 CLPsych 2026 共享任务中,使用包括 LSTM、BERT 和 LLMs 在内的自然语言处理方法分析社交媒体帖子中的心理健康状态,并在摘要任务中取得了最高的一致性得分。

0 人收藏 0 人点赞
#shared-task

Team MKC 在 CLPsych 2026:通过社交媒体时间线动态捕捉和表征心理健康变化

arXiv cs.CL · 2026-07-01 缓存

本文介绍了一个基于LLM的流水线,用于从按时间顺序排列的社交媒体帖子中分析心理健康变化,参与CLPsych 2026共享任务。它可以进行帖子级别评估和用户级别时间建模,以捕捉心理健康的转变。

0 人收藏 0 人点赞
#shared-task

DistilledGemma:多语言历史文章中人物-地点关系抽取的效率与准确性平衡

arXiv cs.CL · 2026-06-30 缓存

本文介绍了DistilledGemma,一个用于从多语言历史报纸文章中抽取人物-地点关系的系统,该系统采用从26B参数的Gemma教师模型到2.3B参数的学生模型的三阶段知识蒸馏流程,在HIPE-2026共享任务中实现了具有竞争力的准确性和效率。

0 人收藏 0 人点赞
#shared-task

UOL@IDEM在BEA 2026共享任务1中的提交:融合神经与丰富特征建模的L1感知词汇难度预测

arXiv cs.CL · 2026-06-24 缓存

本文描述了UOL@IDEM在BEA 2026 L1感知词汇难度预测共享任务中的封闭赛道提交方案,结合多语言上下文表示与工程化特征。该系统在西班牙语、德语和中文上取得了有竞争力的RMSE分数,其中词频是最稳定的预测因子。

0 人收藏 0 人点赞
#shared-task

QIAS 2026: 伊斯兰继承推理共享任务概述

arXiv cs.CL · 2026-06-15 缓存

本文概述了QIAS 2026共享任务,该任务聚焦伊斯兰继承推理,利用MAWARITH基准评估大语言模型在多步骤法律和数值推理方面的能力。

0 人收藏 0 人点赞
#shared-task

CUNY在CLPsych 2026中的工作:一种用于心理健康变化分类与总结的流水线方法

arXiv cs.CL · 2026-05-26 缓存

CUNY在CLPsych 2026共享任务中的提交采用了一种流水线方法,结合了上下文学习与开放权重大型语言模型、监督分类器和检索增强生成,用于从Reddit时间线中分类和总结心理健康变化,在多个子任务中取得了最高排名。

0 人收藏 0 人点赞
#shared-task

Counter Turing Test 的发现:AI生成文本检测

arXiv cs.CL · 2026-05-21 缓存

本文介绍了 Counter Turing Test 共享任务在AI生成文本检测方面的发现,顶级系统在二分类任务中达到了完美表现,但在模型归因方面性能显著较低,突显了区分不同大语言模型输出的难度。

0 人收藏 0 人点赞
#shared-task

面向文化图像描述的长上下文检索增强翻译:Gators在AmericasNLP 2026共享任务中的提交

arXiv cs.CL · 2026-05-21 缓存

佛罗里达大学Gators团队提交至AmericasNLP 2026共享任务,该任务涉及面向土著语言的文化图像描述。我们采用双阶段流水线:使用Qwen2.5-VL生成西班牙语中间描述,然后通过检索增强的多示例提示,利用Gemini 2.5 Flash生成目标语言描述。与基线相比,取得了显著提升。

0 人收藏 0 人点赞
#shared-task

缩小CRAC 2026差距:基于LLM的多语言共指解析的两阶段自适应方法

arXiv cs.CL · 2026-05-19 缓存

本文提出了一种基于LLM的多语言共指解析的两阶段自适应方法,在CRAC 2026的LLM赛道中以74.32的CoNLL F1分数获得第一名。该方法使用多语言基适配器后接数据集特定适配器对Gemma-3-27b进行微调。

0 人收藏 0 人点赞
#shared-task

单词难度由何决定?Sakura在BEA 2026词汇难度预测共享任务中的表现

arXiv cs.CL · 2026-05-15 缓存

本文介绍了两种词汇难度预测模型:一种是通过软目标损失微调的黑盒大语言模型,实现了高准确度;另一种是可解释模型,能提供对难度因素的深入分析。这些模型参与了BEA 2026共享任务,并取得了强相关性。

0 人收藏 0 人点赞
#shared-task

RETUYT-INCO 在 BEA 2026 共享任务 2 中的表现:德语基于评分标准的元提示词方法

arXiv cs.CL · 2026-05-13 缓存

本文详细介绍了 RETUYT-INCO 团队参与 BEA 2026 共享任务 2 的情况,提出了一种用于德语简答题基于评分标准(rubric-based)评分的元提示词(meta-prompting)方法。

0 人收藏 0 人点赞
#shared-task

PSK@EEUCA 2026:利用合成数据增强微调大型语言模型以检测游戏聊天中的多类毒性

arXiv cs.CL · 2026-05-11 缓存

本文介绍了一个用于 EEUCA 2026 游戏聊天毒性检测共享任务的系统,该系统通过结合合成数据增强微调 Llama 3.1 8B 模型,获得了第四名。文章重点阐述了一种“验证陷阱”现象:由于数据分布偏移,较高的验证分数与测试集表现并不相关。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈