标签
OpenAI将重新开放其Pro $200订阅,并采用新的用量计算方式,将有效的API支出减半,同时通过模型效率提升确保价值不断增加。
Tibo 宣布对 Pro $200 订阅进行更改,有效将 API 支出减半,并承诺随着时间的推移提供更高价值,包括新的模型定价和即将推出的功能。
文章建议在高强度模式下使用 Claude Sonnet 5.5 以节省成本,同时声称 Opus 5.5 是目前最高效的模型。
一份 Epoch AI 报告指出,达到特定 AI 性能水平的成本已急剧下降,OpenAI o3 和 GPT-5.6 Luna 在 GPQA Diamond 等基准测试上展示了推理成本降低 725 倍。
本文提出CS-MoE,一种创新的Transformer架构,通过跨层共享神经专家来提高参数利用率,仅激活55%的参数即可实现更低的困惑度。
作者质疑为什么参数少于50M的微小AI模型或一群专门化的微模型在生产环境中很少被部署,推测原因可能是工具偏差或通用模型的便利性。
来自初创公司Mostik的俄罗斯数学家开发了一种方法,使AI模型能够通过其权重进行通信,从而提高效率和性能,并在GLM-5.2和Qwen-3.5模型中得到演示。
文章阐释了人工智能模型中混合专家模型与N-gram技术的架构差异,重点介绍了Qwen新模型如何利用N-gram技术卸载参数,通过分离推理和回忆任务来提升效率。
This paper introduces a method to predict middle-layer attention in multimodal LLMs to prune visual tokens efficiently, using question-contrastive teacher selection and cross-modal attention distillation.
作者在Deepseek V4 Flash发布后分析了模型规模与性能的趋势,指出开源模型在体积缩小的同时性能不断提升,并预测一年内Opus 4.5级别的模型有望在消费级笔记本上运行。
DeepSeek V4 Flash 的体量比 GLM 5.2 小约 70%,但性能却更胜一筹,这意味着达到最先进水平的 AI 可能比预期更早地在 RTX 5090 等消费级硬件上运行。
一位Reddit用户询问DeepSeek如何让一个300B参数的模型比9B参数的模型更便宜,引发了关于效率和成本的讨论。
提出了CPU解码速度取决于每个token的活跃参数而非总参数的见解,并提出一个使用三元权重和细粒度MoE的10B参数模型,以在中等配置PC上实现高token速率。报告了沙箱测量结果,显示在8.3M模型上速度从176 tok/s提升到848 tok/s,且质量损失极小。
该文认为,AI模型效率提升如此之快,以至于维持固定智能水平所需的硬件成本大约每3个月减半,这使得租赁前沿智能或拥有落后硬件比购买新硬件更经济。
探讨一个35B参数模型是否能够通过在测试时扩展其搜索视界来超越1000B模型,使用结构化过程反馈而非蛮力参数扩展。
本文介绍了字节精确的KV缓存嫁接,一种通过将验证知识作为字节精确的状态工件存储并在推理过程中恢复,从而使冻结的小型语言模型既更强大又更廉价的技术,在不改变权重的情况下实现了显著的token和能耗降低。
本研究引入了针对推理轨迹的章节感知压缩,训练模型舍弃填充性叙述,同时保留计算和验证片段,在比原始推理少用2-3倍词元的情况下,达到或超越原始准确率。
本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。
一篇新帖子强调了扩散LLM的一个缺点:双向注意力机制导致键值跨步骤漂移,破坏了KV缓存。不过,生成质量对轻微的KV漂移具有鲁棒性,研究重点已放在最大化陈旧KV重用而不导致质量下降上。
本文系统研究了 Transformer 中 QKV 投影共享的各种变体,发现共享键和值投影(Q-K=V)可在仅造成 3.1% 困惑度下降的情况下实现 50% 的 KV 缓存压缩,结合 GQA/MQA 最高可达 96.9% 的缓存压缩率——以极小的质量损失实现实用的端侧推理。