什么能使上传者运行的拒绝表独立可复现?

Reddit r/LocalLLaMA 新闻

摘要

文章讨论了使AI模型中的上传者运行的拒绝表独立可复现的要求,强调了需要详细的复制包,包括原始生成、解码设置、每个提示的标签和评分代码。

模型卡中的拒绝范围只有在其他人能够重建每个提示如何达到其标签时才是可复现的。OrcaRouter's Qwen3.8-27B FP8卡报告了abliterated检查点在思考关闭时的拒绝率为0–6%,而在八个列出的数据集上基础模型的拒绝率为63.6–99%。该卡还说明这是一个上传者运行的、基于开头短语的分类器,而不是独立评估。提供的材料不包括原始生成或独立复现。这使得每个聚合中隐藏了多个结果:解码设置、分类器版本、每个提示的标签,以及有条件合规的处理方式。在将拒绝表视为可重用结果之前,您需要的最小复制包是什么:原始生成、确切的解码设置、每个提示的标签、可执行的评分代码,还是全部四个?
查看原文

相似文章