标签
Pathway的150M参数BDH-CQ模型在ARC-AGI-1上达到29.5%的准确率,每个任务成本仅为0.0007美元,创下新低,采用循环记忆和潜在推理,而非长token链。该架构或许正是Andrew Curran预告的突破,OpenAI研究员Lukasz Kaiser担任投资者和顾问。
本文提出ZeroLock,一种无反向传播的并发内存高效LLM训练算法,将模型更新解耦为独立的分块更新,与基于BP的基线相比,内存使用减少26.5%,吞吐量提高4.9%。
1jehuang发布了Jcode,这是一个用Rust编写的开源终端编码代理,声称内存效率比Claude Code高20倍,可以并行运行数十个代理。
Multiverse Computing 发布了一篇论文,介绍如何通过离线 top-K logits 和融合的分块 KL 损失来降低 LLM 知识蒸馏的成本,从而减少大规模蒸馏时的显存占用。
本文介绍了MESH,一种用于混合专家(MoE)训练的内存高效Sinkhorn优化器,它在不存储完整优化器状态的情况下恢复时间动量,相比AdamW将内存减少62.5%,同时保持有竞争力的评估损失。
本文研究了TabPFN等表格基础模型的内存需求,并表明模型压缩(如INT4量化)可以将内存占用减少高达7.6倍,且精度损失极小,从而提升实际部署效率。
WASTE 是一个开源推理引擎,通过将专家权重存储在 NVMe 上,运行比主机可用内存大得多的模型。它展示了在配备 64GB 统一内存的 MacBook Pro 上运行 Kimi K3(一个 2.78T 参数的 MoE 模型)的能力。
SkewAdam是一种分层优化器,可将MoE状态内存使用量减少97%,从而使得6.7B MoE模型能够适配单个40GB GPU。
SALT 是一个开源工具,它使用关键词 trie 将长文档压缩成固定大小的纯文本提示,供 LLM 使用,以避免主题塌陷,并在令牌预算内高效选择信息丰富的句子。
Qbix Server是一个纯PHP Web服务器,通过加载类后分叉工作进程以利用写时复制共享内存,在同一硬件上比Nginx+PHP-fpm多处理10倍的并发PHP请求,将每个工作进程的内存从30-60MB减少到约5MB。
SkewAdam是一种针对混合专家模型的新型优化器,它分层分配优化器状态至骨干网络、专家和路由器,将内存占用降至AdamW的2.6%,同时在受控对比中实现了更优的验证困惑度。
Unlimited-OCR,一家中国公司新发布的开源OCR模型,解决了AI OCR工具中常见的内存增长问题——无论文档多长,内存使用都保持平稳,从而能够在32K上下文长度下一次性读取数十页。它采用MIT许可,拥有30亿参数,支持多语言,并且在GitHub上已经广受欢迎。
CARE-LoRA提出了一种压缩激活重建框架,通过利用低秩投影来减少LoRA微调过程中的内存消耗。该方法在降低内存占用的同时,实现了具有竞争力的性能。
StickyMoE提出了一种可微的路由一致性损失函数,鼓励相邻token在MoE模型中激活相同的专家,从而在边缘设备推理过程中将专家交换开销和缓存未命中率降低高达3.92倍,同时改善困惑度。
这条推文介绍了DeepSeek Unlimited OCR,这是一款AI模型,能一次读取整本书,内存占用保持平稳,在40+页面上达到93%基准分数和低于0.11的错误率。
本文通过实验证明,在GaLore等低秩训练方法中,梯度的前r维子空间除了一个小的可复现核心外是不可辨识的,估计器噪声主导了表观旋转。文章分析了这对优化器状态传输的影响,并引入了LDAdam,它在困惑度上优于GaLore。
FourTune提出了一个全4比特量化框架(W4A4G4),用于扩散模型的高效后训练,采用三分支混合流水线和自定义融合内核,在12B FLUX.1-dev上将内存减少2.25倍,吞吐量提升2.27倍,且无质量损失。
中国开源了Unlimited OCR,这是一款基于DeepSeek OCR的OCR模型,可以一次性转录整本书,内存使用恒定,在标准解析基准上达到93%的准确率。
介绍了MEET,一种用于全原子肽设计的内存高效E(3)等变变压器,与VAE和潜在扩散管道集成,实现了线性内存缩放和改善的生成质量。
GRASP提出一种多源迁移学习方法,顺序合并源模型到单个目标模型,内存占用恒定O(1),使用基于梯度的参数对齐避免负迁移。实验表明其性能优于集成方法且内存效率更高。