mmlu

标签

Cards List
#mmlu

@IndieDevHailey: 兄弟们,本地党可以无边界的玩了。 阿里Qwen3.8-27B被彻底OBLITERATED(彻底消融/移除安全限制)了,V2版直接0拒绝。 更好的是MMLU(大规模多任务语言理解测试,衡量模型知识与推理能力的标准分数)从85.3%干到86.…

X AI KOLs Timeline · 2026-08-21 缓存

阿里Qwen3.8-27B模型的安全限制被完全移除,V2版本实现零拒绝,并且MMLU分数提升至86.3%,使用互补消融混合技术实现无审查且性能更强。

0 人收藏 0 人点赞
#mmlu

理解大型语言模型中与语气相关的推理成本

arXiv cs.CL · 2026-07-28 缓存

本文研究了提示语气如何影响大型语言模型的准确性和推理成本(输出令牌消耗),发现不同语气下输出令牌长度差异高达44.3%,而准确性变化较小,并确定了不同模型的最优语气。

0 人收藏 0 人点赞
#mmlu

构建欧洲多语言评估数据集:EMT网络内的MMLU本地化项目

arXiv cs.CL · 2026-07-22 缓存

本文报告了欧盟委员会翻译总局与欧洲翻译硕士网络合作,将MMLU数据集本地化为11种欧洲语言的项目。该项目不仅为LLM评估创建了更具包容性的基准,还为翻译专业学生提供了真实的项目式专业培训。

0 人收藏 0 人点赞
#mmlu

量化LLM基准中的排名不确定性

arXiv cs.LG · 2026-07-21 缓存

本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。

0 人收藏 0 人点赞
#mmlu

@LiorOnAI: 一个大约1万参数的路由器可以通过学习哪个模型应该回答哪个问题来击败MMLU上的每个单独的开源模型……

X AI KOLs Following · 2026-07-05 缓存

一个称为tinyrouter的微小的大约1万参数路由器学习在MMLU中每个问题应该使用哪个开源模型,通过优化分配超越单个模型。

0 人收藏 0 人点赞
#mmlu

我们提示格式研究中“93%答案翻转”的标题主要是一个解析伪影。以下是修正,以及为什么我认为解析失败处理是一种未被充分报告的分析师自由度。

Reddit r/ArtificialInteligence · 2026-06-23

一项关于不同提示格式下MMLU准确率变化的研究发现,“93%答案翻转”率部分是由解析伪影造成的。作者建议预先注册解析失败处理,并报告经过解析校正的指标,以区分真正的模型敏感性与解析器的脆弱性。

0 人收藏 0 人点赞
#mmlu

谁在翻转?自模型与跨模型反论点揭示LLM答案的不稳定性

Hugging Face Daily Papers · 2026-06-14 缓存

本文引入了一种受控协议,通过用合理的反论点挑战正确答案来评估大型语言模型的答案稳定性,揭示了不同模型之间翻转率的巨大差异,而仅凭准确率指标无法捕捉这些差异。作者发布了该协议、挑战记录以及精心策划的MaxFlip挑战集,以支持稳定性评估。

0 人收藏 0 人点赞
#mmlu

HRM-Text: 超越规模的高效预训练

arXiv cs.CL · 2026-05-21 缓存

HRM-Text 引入了一种分层循环模型,将计算解耦为慢速和快速层级,使得仅使用400亿个token和1500美元预算即可从头开始高效预训练,实现了与更大模型竞争的性能。

0 人收藏 0 人点赞
#mmlu

@akshay_pachaar: 人工智能研究实验室的操作系统。TransformerLab 可在任何云端编排 GPU,并运行任何训练或评估流程…

X AI KOLs Following · 2026-05-20 缓存

TransformerLab 是一个开源平台,可在各云端编排 GPU,并提供预构建模板,用于 LoRA、DPO 和 MMLU 等 AI 训练与评估工作流。

0 人收藏 0 人点赞
#mmlu

面向专业人类与大语言模型协作的能力条件化支架

arXiv cs.CL · 2026-05-18 缓存

介绍了能力条件化支架,一种用于大语言模型协作的框架,根据用户专业领域调整干预措施以防止专业领域漂移,并在MMLU子集上进行了试点评估。

0 人收藏 0 人点赞
#mmlu

前沿大语言模型中的领域级元认知监控:一份33个模型图谱

arXiv cs.CL · 2026-05-11 缓存

本研究提出了一份涵盖33个模型的图谱,利用MMLU基准分析了前沿大语言模型中的领域级元认知监控,揭示了聚合指标所掩盖的不同知识领域中置信度校准的显著差异。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈