标签
阿里Qwen3.8-27B模型的安全限制被完全移除,V2版本实现零拒绝,并且MMLU分数提升至86.3%,使用互补消融混合技术实现无审查且性能更强。
本文研究了提示语气如何影响大型语言模型的准确性和推理成本(输出令牌消耗),发现不同语气下输出令牌长度差异高达44.3%,而准确性变化较小,并确定了不同模型的最优语气。
本文报告了欧盟委员会翻译总局与欧洲翻译硕士网络合作,将MMLU数据集本地化为11种欧洲语言的项目。该项目不仅为LLM评估创建了更具包容性的基准,还为翻译专业学生提供了真实的项目式专业培训。
一个称为tinyrouter的微小的大约1万参数路由器学习在MMLU中每个问题应该使用哪个开源模型,通过优化分配超越单个模型。
一项关于不同提示格式下MMLU准确率变化的研究发现,“93%答案翻转”率部分是由解析伪影造成的。作者建议预先注册解析失败处理,并报告经过解析校正的指标,以区分真正的模型敏感性与解析器的脆弱性。
本文引入了一种受控协议,通过用合理的反论点挑战正确答案来评估大型语言模型的答案稳定性,揭示了不同模型之间翻转率的巨大差异,而仅凭准确率指标无法捕捉这些差异。作者发布了该协议、挑战记录以及精心策划的MaxFlip挑战集,以支持稳定性评估。
HRM-Text 引入了一种分层循环模型,将计算解耦为慢速和快速层级,使得仅使用400亿个token和1500美元预算即可从头开始高效预训练,实现了与更大模型竞争的性能。
TransformerLab 是一个开源平台,可在各云端编排 GPU,并提供预构建模板,用于 LoRA、DPO 和 MMLU 等 AI 训练与评估工作流。
介绍了能力条件化支架,一种用于大语言模型协作的框架,根据用户专业领域调整干预措施以防止专业领域漂移,并在MMLU子集上进行了试点评估。
本研究提出了一份涵盖33个模型的图谱,利用MMLU基准分析了前沿大语言模型中的领域级元认知监控,揭示了聚合指标所掩盖的不同知识领域中置信度校准的显著差异。