标签
QVAC Genesis III 是一个开源的合成 STEM 语料库,旨在提升语言模型预训练的效率,与先前的数据集相比,在基准测试中表现出显著改进。
Empero AI发布其首个MoE模型Qwen3.8-35B-A3B-Distill,该模型将Qwen3.8的推理能力蒸馏到一个更小、更高效的架构中,在ARC-Challenge基准测试上显示出改进。
LeVJEPA引入了一种更高效的自监督视频预训练方法,通过消除对目标网络和预测器的需求,使用带有SIGReg正则化器的单一共享编码器,并以更低的计算成本实现有竞争力的性能。
本文介绍BF1,一种因果二元稀疏注意力改造,旨在提升Transformer在长上下文处理中的效率。
GRNEdit是一个轻量级的两阶段框架,用于高效通用视频编辑,通过使用二进制语义决策和源证据,以比大型模型更少的参数实现高性能。
DistilVDR is a compact 524M visual document retriever distilled from an 8B teacher via cosine alignment, achieving near-teacher accuracy on ViDoRe with 15.6x smaller indexes and faster indexing.
Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。
AntLingAGI 发布 Ling 3.0 flash,一个原生混合线性推理模型,总参数 124B,激活参数 5.1B,采用 MIT 许可证,声称以更少的计算量和更快的响应速度媲美 1T 参数的旗舰模型。
Maple-Preview 是一个三值 20B MoE 模型,在 iPhone 上每秒可运行 120 个 token,展现了高效的端侧推理能力。
用户询问关于 Mach-1 Additive 的情况,据称该模型在体积小10倍的情况下,实现了 Qwen 3.6 35B 95% 的性能,并质疑为什么它没有得到更广泛的讨论。
据称 DeepSeek V4 Flash 仅有2840亿参数,激活参数仅130亿,对中美模型厂商构成效率冲击。
Thinking Machines发布了Inkling-Small,这是一个高效的开放权重混合专家模型,总参数量276B,激活参数12B。它的大小仅为更大版本Inkling的四分之一,但性能与之相当。该模型原生支持音频和图像推理,具备可变的思考深度,并拥有100万token的上下文窗口。
Liquid AI发布LFM2.5-编码器(230M和350M),这是为CPU上长上下文推理优化的高效编码器模型,在基准测试中匹配或超越更大编码器,相比ModernBERT-base实现3.7倍加速。
谷歌的 Gemma 4 26B A4B 模型可通过模型分页在 iPhone 17 Pro 上运行,实现强大的设备端 AI 功能。
Four Over Six(4/6)为NVFP4量化引入了自适应块缩放,以最小开销降低量化误差,同时改善了大语言模型的训练和训练后量化。
蚂蚁集团发布了LingBot-Vision,这是一个包含四种规模的DINO风格视觉骨干网络系列;其中0.3B ViT-L在NYUv2深度估计任务上,以约23倍更少的参数量达到了DINOv3-7B的性能,展现了显著的效率提升。
本文介绍了Google Research联合康奈尔和南加大提出的一种新方法,通过为RNN的记忆拍快照并缓存,使RNN能高效处理长文本,兼具Transformer的强记忆和RNN的低成本,为长上下文AI提供新方向。
HRM-Text发布了一个1B参数的基础模型,声称仅需约$1000即可从零完成预训练,计算量和数据量减少数百倍,采用层级递归架构、潜在空间推理和PrefixLM packing等高效技术,论文与代码均已开源。
PrismML 发布 Bonsai Image 4B,这是一系列紧凑型图像生成模型,使用 1-bit 和三进制权重,能够在笔记本电脑和 iPhone 等本地设备上实现高质量扩散推理,同时显著减少内存占用。
本文总结了关于长上下文LLM的高效AI讲座15,涵盖用于上下文扩展的RoPE位置插值、大海捞针评估,以及StreamingLLM的注意力汇聚现象和KV缓存驱逐策略。