标签
本文提出了一个用于攻击性语言检测中跨域和跨语言泛化的诊断与优化框架,将性能下降分解为数据集效应和语言效应,并量化了多语言能力与源任务性能之间的权衡。
本文比较了层级攻击性语言检测中的级联模型与联合多任务模型,发现级联架构以增加参数和推理延迟为代价获得了更高的准确率,并且类别不平衡处理策略应通过消融实验进行验证。