RETUYT-INCO 在 BEA 2026 共享任务 2 中的表现:德语基于评分标准的元提示词方法
摘要
本文详细介绍了 RETUYT-INCO 团队参与 BEA 2026 共享任务 2 的情况,提出了一种用于德语简答题基于评分标准(rubric-based)评分的元提示词(meta-prompting)方法。
arXiv:2605.11242v1 公告类型:新论文
摘要:在本文中,我们介绍了 RETUYT-INCO 团队参与 BEA 2026 共享任务“德语简答题基于评分标准的评分”的情况。我们的团队参加了赛道 1(未见过的答案,三分类)、赛道 3(未见过的答案,二分类)和赛道 4(未见过的问题,二分类)。由于这些赛道需要使用特定的评分标准对简短的学生答案进行评分,我们探索了应对任务动态变化的方法。我们创建了一种名为“元提示词”(Meta-prompting)的方法。该方法中,大型语言模型(LLM)根据训练集中的示例生成自定义提示词,随后使用该提示词对新提交的学生答案进行评分。除了该方法外,我们还描述了其他使用的技术,包括经典机器学习、微调开源 LLM 以及不同的提示词技巧。根据官方结果,我们的团队在赛道 1 中 8 支参赛队伍中排名第 6,Quadratic Weighted Kappa (QWK) 为 0.729。在赛道 3 中,我们以 0.674 的 QWK 在 9 支队伍中排名第 4;在赛道 4 中,我们以 0.49 的 QWK 在 8 支队伍中同样排名第 4。
查看缓存全文
缓存时间: 2026/05/13 06:09
# RETUYT-INCO 在 BEA 2026 共享任务 2 中的表现:德语基于评分标准的元提示(Meta-prompting)方法 来源: https://arxiv.org/abs/2605.11242 查看 PDF (https://arxiv.org/pdf/2605.11242) > 摘要:本文介绍了 RETUYT-INCO 团队在 BEA 2026 共享任务“德语基于评分标准的简答题评分”中的参与情况。我们的团队参加了赛道 1(未见答案三分制)、赛道 3(未见答案二分制)和赛道 4(未见问题二分制)。由于这些赛道需要使用特定评分标准对简短的学生答案进行评分,我们探索了应对任务变化性的方法。我们提出了一种称为“元提示(Meta-prompting)”的方法。在该方法中,大语言模型(LLM)根据训练集中的示例生成自定义提示,然后使用该提示对新的学生答案进行评分。除了这种方法外,我们还描述了我们使用的其他方法,如经典机器学习、对开源 LLM 的微调以及不同的提示技术。根据官方结果,我们的团队在赛道 1 中以 0.729 的 QWK 得分在 8 个参赛队伍中排名第 6 位。在赛道 3 中,我们以 0.674 的 QWK 得分在 9 个参赛队伍中排名第 4 位;在赛道 4 中,我们也以 0.49 的 QWK 得分在 8 个参赛队伍中排名第 4 位。 ## 提交历史 来自: Santiago Góngora [查看邮箱 (https://arxiv.org/show-email/3567939e/2605.11242)] **[v1]** 2026 年 5 月 11 日 星期一 21:01:05 UTC (61 KB)
相似文章
RECAP:面向提示持续适应性的回归评估基准
介绍了RECAP,一个用于在主动适应场景下评估提示持续学习能力的基准。结果表明,现有提示优化方法在该场景下表现不佳,亟需新方法。
单一提示不够:指令敏感性削弱嵌入模型评估
本文通过实证表明,对指令调优嵌入模型进行单一提示评估是不够的,因为性能随提示措辞显著变化,且排行榜排名可通过提示选择被操纵。
面向开放端后训练的提示级奖励规范
本文提出了一种提示级奖励规范框架,将奖励规范与计算分离,离线构建可重用的任务适应评分准则和可执行约束检查器,为开放端后训练生成混合奖励,无需人工标注或单独的奖励模型。
评分标准对齐的解耦人类同声传译评估
本文提出了一种基于评分标准对齐的方法,用于在段落级别评估人类同声传译,使用LoRA适配的COMET-KIWI模型来解耦意义传递和表达质量等维度,相比基线方法,提高了与人类评分的相关性。
IterCOMP:面向多跳问答的推理感知自适应提示压缩
IterCOMP 是一个无需训练的提示压缩框架,通过迭代整合关键证据来提高多跳问答的效率和准确性。