benchmark-integrity

标签

Cards List
#benchmark-integrity

Mizan:用于评估大型语言模型在伊拉克阿拉伯语及伊拉克公民语境下的国家级基准

arXiv cs.CL · 5天前 缓存

Mizan 引入了一个国家级基准,用于评估大型语言模型在伊拉克阿拉伯语和公民语境下的表现,突出了以 MSA 为重点的评估中存在的差距,并揭示了安全加固模型中的过度拒绝问题。

0 人收藏 0 人点赞
#benchmark-integrity

超越Shapley:一种基于影响力的LLM对齐与评估数据审计管线

arXiv cs.LG · 2026-07-28 缓存

介绍了一种可扩展的、仅需推理的数据估值管线,该管线通过近似Shapley值来审计LLM对齐数据集,将手动审计搜索空间减少了99.1%,并揭示了HelpSteer2和HH-RLHF中隐藏的标签错误。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈