RETUYT-INCO 在 BEA 2026 共享任务 2 中的表现:德语基于评分标准的元提示词方法

arXiv cs.CL 论文

摘要

本文详细介绍了 RETUYT-INCO 团队参与 BEA 2026 共享任务 2 的情况,提出了一种用于德语简答题基于评分标准(rubric-based)评分的元提示词(meta-prompting)方法。

arXiv:2605.11242v1 公告类型:新论文 摘要:在本文中,我们介绍了 RETUYT-INCO 团队参与 BEA 2026 共享任务“德语简答题基于评分标准的评分”的情况。我们的团队参加了赛道 1(未见过的答案,三分类)、赛道 3(未见过的答案,二分类)和赛道 4(未见过的问题,二分类)。由于这些赛道需要使用特定的评分标准对简短的学生答案进行评分,我们探索了应对任务动态变化的方法。我们创建了一种名为“元提示词”(Meta-prompting)的方法。该方法中,大型语言模型(LLM)根据训练集中的示例生成自定义提示词,随后使用该提示词对新提交的学生答案进行评分。除了该方法外,我们还描述了其他使用的技术,包括经典机器学习、微调开源 LLM 以及不同的提示词技巧。根据官方结果,我们的团队在赛道 1 中 8 支参赛队伍中排名第 6,Quadratic Weighted Kappa (QWK) 为 0.729。在赛道 3 中,我们以 0.674 的 QWK 在 9 支队伍中排名第 4;在赛道 4 中,我们以 0.49 的 QWK 在 8 支队伍中同样排名第 4。
查看原文
查看缓存全文

缓存时间: 2026/05/13 06:09

# RETUYT-INCO 在 BEA 2026 共享任务 2 中的表现:德语基于评分标准的元提示(Meta-prompting)方法
来源: https://arxiv.org/abs/2605.11242
查看 PDF (https://arxiv.org/pdf/2605.11242)

> 摘要:本文介绍了 RETUYT-INCO 团队在 BEA 2026 共享任务“德语基于评分标准的简答题评分”中的参与情况。我们的团队参加了赛道 1(未见答案三分制)、赛道 3(未见答案二分制)和赛道 4(未见问题二分制)。由于这些赛道需要使用特定评分标准对简短的学生答案进行评分,我们探索了应对任务变化性的方法。我们提出了一种称为“元提示(Meta-prompting)”的方法。在该方法中,大语言模型(LLM)根据训练集中的示例生成自定义提示,然后使用该提示对新的学生答案进行评分。除了这种方法外,我们还描述了我们使用的其他方法,如经典机器学习、对开源 LLM 的微调以及不同的提示技术。根据官方结果,我们的团队在赛道 1 中以 0.729 的 QWK 得分在 8 个参赛队伍中排名第 6 位。在赛道 3 中,我们以 0.674 的 QWK 得分在 9 个参赛队伍中排名第 4 位;在赛道 4 中,我们也以 0.49 的 QWK 得分在 8 个参赛队伍中排名第 4 位。

## 提交历史

来自: Santiago Góngora [查看邮箱 (https://arxiv.org/show-email/3567939e/2605.11242)] **[v1]** 2026 年 5 月 11 日 星期一 21:01:05 UTC (61 KB)

相似文章

面向开放端后训练的提示级奖励规范

arXiv cs.CL

本文提出了一种提示级奖励规范框架,将奖励规范与计算分离,离线构建可重用的任务适应评分准则和可执行约束检查器,为开放端后训练生成混合奖励,无需人工标注或单独的奖励模型。

评分标准对齐的解耦人类同声传译评估

arXiv cs.CL

本文提出了一种基于评分标准对齐的方法,用于在段落级别评估人类同声传译,使用LoRA适配的COMET-KIWI模型来解耦意义传递和表达质量等维度,相比基线方法,提高了与人类评分的相关性。