标签
本文研究了在单块GPU上部署EuroLLM和Hy-MT2等翻译模型时的量化权衡,表明将文档分块策略与W4A8/W8A8量化相结合能够改善延迟-吞吐量权衡,同时引入文档级评估来考察长上下文动态。
本文提出了针对LLM潜在对抗训练(LAT)的计算高效策略,利用低秩表示微调和电路引导代理模型,将每步FLOPs减少48.1%,同时仅需0.0118%的可训练参数。
据报道,有人仅用8.24 GB内存就在单个CPU上运行了拥有2.78万亿参数的开源Kimi k3模型,展现了极高的效率。
得益于 Nvidia 的 Nemo Relay 以及多种优化策略,Hermes Agent 的效率大幅提升,尤其是对于更小/更弱的本地模型。这些优化包括减少任务轮次、降低上下文加载量,以及通过 25 万次对话消除 token 浪费。
3DZip是一个面向3D视觉语言模型的三阶段令牌压缩框架,利用体素化、多样性引导的锚点选择和空间约束合并来减少令牌数量,同时保持空间推理能力。在3DQA基准上,仅使用128个令牌即可保留94.7%的原始性能,并实现1.92倍的推理加速。
作者推测,真正先进的AI模型将表现出一些迹象,例如在负载不断增加的情况下可靠性提高、效率突然提升、性能变快以及重置。
Prox是一个用于LLM中稀疏SwiGLU FFN的免训练框架,利用近似中间通道显著性来构建通道掩码,无需密集计算。在十个LLM上,Prox优于免训练基线,在70%稀疏度下实现了高达1.99倍的端到端解码加速。
本文介绍了LEEPS,一种用于大型语言模型中基于可验证奖励的高效强化学习(RLVR)的潜在引导探索-利用提示采样器。它自适应地平衡了对信息丰富提示的重复利用和对不确定提示的探索,在基线上将推理基准分数提高了2.6-3.7%,而每个训练步骤仅增加约2秒的开销。
本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。
本文介绍了SDO,一种用于LLM后训练的结构感知数据组织框架,利用暴露驱动的反馈来调整小批量组成和样本暴露,从而在SFT、DPO和GRPO中改善收敛性。
RLPF 是一种强化学习方法,它在正确性之外还训练代码模型优化运行时间,使用基于执行进度和相对效率的分阶段奖励。在 PerfCodeBench 上使用 RLPF 微调 Qwen3-32B,将正确且可运行的解决方案从 11.1% 提高到 54.6%,并将相对效率从 8.1% 提高到 38.6%。
本文讨论了按任务类型标准化后AI成本下降如何推动进一步采用,并引用Sam Altman宣布的GPT-5.6系列模型大幅降价:Luna降价80%,Terra降价20%,Sol推出Fast模式。
一条推文强调Luna是一款能力超强且低成本的AI模型,指出它目前是每美元token效率最高的模型,并且在OpenRouter上还可享受额外折扣。
LinkedIn计划通过提高GPU效率,在下一个财年保持其计算和存储规模不变,这与其它大型科技公司积极扩建数据中心的趋势背道而驰。
OpenAI 的博客文章描述了新一代前沿模型 GPT-5.6 Sol 如何通过自我优化来提高自身推理效率,同时保持高智能水平。
OpenAI 部署了 GPT-5.6 Sol,通过改进的 GPU 内核和推测解码,实现了 20% 的服务成本降低和 15% 以上的 token 生成效率提升。