标签
World Model Optimizer 是一款开源CLI工具,能够从智能体轨迹中优化AI模型,并通过路由器提供服务,在降低成本的同时保持前沿模型的质量。
Hy3 295B模型的1位量化版本在推理速度上比云端API快2.2倍,且质量无损
DFlash 是一种方法,可将 Qwen3.6 27B 模型推理速度提升2.2倍,且质量无损失。
一个将融合操作拆分为两个矩阵乘法的修复方案,使 Gemma 4 能在使用了 13 年的双路 Xeon CPU 上以每秒 5.2 token 的速度运行,每次 token 仅使用 26B 权重中的 4B。
Unsloth 发布新版 Qwen3.6 27B NVFP4 量化方案,引入 FP8_E4M3 中间精度层并细化权重保护,在 24GB VRAM 上实现 2.5 倍速度提升,同时改进准确性和工具调用能力。
本文提出了一种面向延迟的神经网络学习方法,使用Zerorized Batch Normalization优化严格延迟约束下边缘系统的DNN架构。实验表明,在NVIDIA Jetson设备上,该方法在精度损失极小的情况下显著降低了延迟。
解释了KV缓存如何通过消除注意力键和值的冗余重计算来加速LLM推理,在速度与内存之间进行权衡,并介绍了生产级缓存管理挑战。
一种捕获和重用 AI 模型输出的工作流策略,包括设置质量门槛、策略路线图、知识笔记和推理记录,以减少对前沿模型的依赖。
LivePortrait 已被蒸馏成一个模型,可直接在浏览器中以每秒25帧的速度运行,由 slperez 在 Hugging Face Spaces 演示中展示。
本文系统性地研究了LLM的RL后训练中每层的贡献,发现仅训练单个中间Transformer层即可恢复甚至超越全参数RL的性能提升,且在不同模型和任务上呈现一致模式。
Nvidia优化后的Qwen 3.6 27B NVFP4模型在DGX Spark上相比Unsloth版本,单次推理速度快41%,并发推理速度快23-25%。
SkillOpt将AI智能体的技能编辑从手动修改转变为训练过程,在不改变模型权重的情况下提高智能体可靠性,并在多个基准测试中取得一致提升。
DeepSeek提出DSpark技术,通过在Final RMSNorm后插入微型Transformer实现推测性解码,将大模型输出速度提升60%-85%。
Whisper large-v3-turbo 已压缩至 368 MB,采用 Q3_K 匹配的量化感知训练,并报告了多语言词错误率结果。
本文解释了大语言模型中的超级权重源于SoftMax与注意力机制的相互作用,该作用创建了一个充当稳定参考点的‘Nothing Dump’标记;移除这些权重会严重损害模型性能。
一篇新论文研究了是剪枝更大的LLM还是从头训练小LLM更好,发现剪枝不仅提供了良好的初始化。
Prime Intellect发布了prime-rl v0.6.0,支持在万亿参数规模的大型Mixture-of-Experts模型上进行高效强化学习,实现低于5分钟的步骤时间,并对异步强化学习进行了优化。
讨论使用NVFP4 4位浮点权重以获得最大性能,通过使用NVIDIA ModelOpt从FP8进行内部量化实现,突出了该数据格式的双缩放因子以保持高动态范围。
GLM-5.2采用了MTP(Multi-Token Prediction)技术加速推理,并修复了GLM-5.1中MTP训练推理不一致导致的KV cache混用问题。