标签
本文质疑为什么AI基准测试在90%以上准确率时被视为饱和,并主张瞄准100%或开发新的基准。
智能成本以每季度50%的速度快速下降,超过了DNA测序、计算、锂电池和电力成本的下降速度,并预计每年将发生重大变化,同时AI的可访问性将得到改善。
本文提供了 Engram 模型的更新,详细介绍了其 2.6b 参数架构,包括一个大型 Engram 表和初步训练进度达到 1 亿 token,展示了通过上下文感知数据卸载实现的改进补全效果。
本文介绍了一种名为Modular Norm RandOpt的架构感知扰动方法,用于语言模型的高效集成。该方法在多任务和不同模型规模下,使用较少的候选模型即可实现性能提升。
本文使用复制重叠探测器研究神经网络中的Grokking转变,但报告了探测器有效性的挑战,并提供了事后统计分析。
本文研究在线自蒸馏中的特权上下文设计,表明中间抽象层次可以比完整解决方案更好地提升模型性能,同时使用更少的提示标记。
本文介绍了PermuFormer,一种针对代数组合学中置换相关任务,在多任务、多编码数据上进行预训练的自回归transformer。实验表明,与基线方法相比,该模型能有效进行下游任务的微调。
本文将顺序重现识别为Diffusion数据点遗忘过程中的失效模式,并提出一种锐度引导方法,以提升跨删除序列的遗忘持久性。
本文介绍了Differentiable Fuzzy Inference Layer (DFIL),这是一种用于大型语言模型的新颖预测头,能够实现单调和组合的序数推理,而无需组合训练数据。
本文提出了Informed Masking(IM),一种针对扩散大型语言模型中强化学习的结构感知扰动方法,该方法优先处理下游令牌,提高了在数学和规划基准测试中的性能。
BELXTR是一种用于生物医学实体链接的新型多向量嵌入模型,它通过利用词元级匹配,改进了最先进的方法,提升了在消歧任务中的性能。
Qwen3.8-Omni-Flash是一款原生多模态智能体模型,旨在提升真实世界生产力。它通过MoE架构和扩展上下文窗口增强了多模态理解与推理能力,并发布了多模态应用的开源框架。
ISA-Bench 引入了一个使用具有受限指令集的编程游戏的基准测试,以评估大型语言模型中的计算推理能力,并揭示了模型能力的洞察以及推理与执行之间的差距。
本文系统地评估了多模态文档问答的输入表示(图像、文本或两者),发现图像可以提高准确性但增加延迟,并提出了一种TF-IDF路由机制来优化性能。
本文研究了在数学推理的策略蒸馏中,提示广度与展开刷新之间的交互,揭示了提示效率取决于学生策略的刷新率和推理预算。
这项研究将人类审议范式应用于大语言模型,发现多样模型之间的审议能够降低集体错误并提高个人准确性,在多个现实世界领域中,多样性至关重要。
本文介绍了限制大规模MoE训练中四个关键内存峰值的方法,使得在1M上下文长度下使用固定GPU内存进行训练成为可能,并且相比基线,吞吐量提升高达10.4倍。
Perplexity的新研究提出了一种提示引导的自蒸馏方法,用于计算机模型的后训练,在一个实时A/B测试中将工具调用失败率降低了21.2%。