标签
本文研究了通过指令微调通用大语言模型来实现健壮的有害内容缓解,特别是仇恨言论检测,使用了一个包含36个数据集的统一语料库,取得了最先进的性能,并增强了跨领域和跨语言的泛化能力。
本文提出了一个用于攻击性语言检测中跨域和跨语言泛化的诊断与优化框架,将性能下降分解为数据集效应和语言效应,并量化了多语言能力与源任务性能之间的权衡。
本文研究了用于工业物联网入侵检测的轻量级机器学习模型的跨域泛化失败,发现它们依赖于粗糙的端口特征,并且对抗鲁棒性与跨网络性能无关。