@jinyuhou0: 在主流基准测试中,我们的30B模型与规模大20-30倍的系统(gpt-5.4-xhigh、DeepSeek-V3.2、Kimi-K2.5)匹敌,而……
摘要
一款新的30B模型在主流基准测试中与规模大20-30倍的系统匹敌,同时相比同类30/32B智能体大语言模型,使用的推理令牌减少高达95%。这是通过一个学习型配置器实现的,该配置器决定何时以及如何进行推理。模型和代码已开放。
查看缓存全文
缓存时间: 2026/05/24 10:27
在主流基准测试中,我们的30B模型在性能上与规模大20-30倍的系统(如gpt-5.4-xhigh、DeepSeek-V3.2、Kimi-K2.5)持平,同时比同类30/32B智能体LLM减少多达95%的推理令牌。
诀窍在于:不仅要减少推理,还要推理正确的事项。一个经过学习的配置器决定何时进行模拟、模拟多远的未来,以及何时完全跳过规划。
高效推理是一个分配问题,而非压缩问题。
模型和代码已公开可用。
Mingkai Deng (@mdeng34):
前沿大语言模型正在向高效、自适应推理收敛。Opus 4.7让模型自行决定推理深度。GPT-5.5用更少的推理令牌取得了强劲结果。我们研究了一个相关但更具结构性的问题:应该进行何种推理
相似文章
@mdeng34: 前沿LLM正汇聚于高效、自适应推理。Opus 4.7让模型自行决定推理深度。GPT…
新研究引入了SR²AM,这是一种自调节何时使用模拟推理的配置器,提升了LLM的效率和性能。
为什么微博的迷你VibeThinker-3B再次引发AI界关于基准测试的争论(15分钟阅读)
微博的VibeThinker-3B,一个3B参数模型,声称在数学和编程基准测试中匹配或超越DeepSeek V3.2和Gemini 3 Pro等更大模型的推理性能,引发了关于基准测试可靠性和扩展必要性的争论。
@TheAhmadOsman: 天哪!27B模型低于6GB和4GB,本地AI将成为默认。附注:我们将尽快在ODS上由@OsmanticAI优化此功能…
Ternary Bonsai 27B,一个大型语言模型,被演示在NVIDIA RTX 5090 GPU上本地运行,内存需求低于6GB,使消费级硬件上实现端到端的智能代理工作流成为可能。
@liquidai:推出LFM2.5-230M:这是我们最小的模型,专为快速运行而设计,可在任何地方(CPU、NPU和GPU)上运行,以实现代理型任务…
Liquid AI发布了LFM2.5-230M,这是一个拥有230M参数的小型模型,针对CPU、NPU和GPU上的快速推理进行了优化,适用于手机和机器人等设备上的代理型任务。
@LeonEnglaender: 我们核心代码团队只有8个人,我们的30B-A3B模型与Claude Haiku 4.5性能相当,并超越了NVIDIA…
一个8人团队发布了采用Apache 2.0许可的30B-A3B编码模型,其性能与Claude Haiku 4.5相当,并在Artificial Analysis Coding Index上击败了NVIDIA的120B-A12B Nemotron 3 Super。