标签
Mizan 引入了一个国家级基准,用于评估大型语言模型在伊拉克阿拉伯语和公民语境下的表现,突出了以 MSA 为重点的评估中存在的差距,并揭示了安全加固模型中的过度拒绝问题。
介绍了一种可扩展的、仅需推理的数据估值管线,该管线通过近似Shapley值来审计LLM对齐数据集,将手动审计搜索空间减少了99.1%,并揭示了HelpSteer2和HH-RLHF中隐藏的标签错误。