标签
本文评估了基于检索的上下文内学习方法,用于检测德国社交媒体帖子中与犯罪相关的仇恨言论,发现少样本提示优于零样本,但检索方法仅提供边际增益,模型更适合用于分诊而非自主审核。
本文提出了一种使用错误独立LLM的九投票器集成系统,用于德语社交媒体中的有害内容检测,通过解决类别不平衡问题,在GermEval 2026共享任务的四个子任务中获得第一名。
本文比较了微调BERT(gbert-large)与少样本大语言模型提示(Llama 4 Maverick)在德语气候新闻句子中检测威胁与解决方案框架的效果。BERT获得了更高的F1分数(0.83 vs 0.78),消融研究表明提供前一句上下文可提升性能。
本文详细介绍了 RETUYT-INCO 团队参与 BEA 2026 共享任务 2 的情况,提出了一种用于德语简答题基于评分标准(rubric-based)评分的元提示词(meta-prompting)方法。