@jinyuhou0: 在主流基准测试中,我们的30B模型与规模大20-30倍的系统(gpt-5.4-xhigh、DeepSeek-V3.2、Kimi-K2.5)匹敌,而……
摘要
一款新的30B模型在主流基准测试中与规模大20-30倍的系统匹敌,同时相比同类30/32B智能体大语言模型,使用的推理令牌减少高达95%。这是通过一个学习型配置器实现的,该配置器决定何时以及如何进行推理。模型和代码已开放。
查看缓存全文
缓存时间: 2026/05/24 10:27
在主流基准测试中,我们的30B模型在性能上与规模大20-30倍的系统(如gpt-5.4-xhigh、DeepSeek-V3.2、Kimi-K2.5)持平,同时比同类30/32B智能体LLM减少多达95%的推理令牌。
诀窍在于:不仅要减少推理,还要推理正确的事项。一个经过学习的配置器决定何时进行模拟、模拟多远的未来,以及何时完全跳过规划。
高效推理是一个分配问题,而非压缩问题。
模型和代码已公开可用。
Mingkai Deng (@mdeng34):
前沿大语言模型正在向高效、自适应推理收敛。Opus 4.7让模型自行决定推理深度。GPT-5.5用更少的推理令牌取得了强劲结果。我们研究了一个相关但更具结构性的问题:应该进行何种推理
相似文章
@akshay_pachaar: 中国研究人员又做到了!OpenBMB刚刚开源了MiniCPM5-2B,一个用于推理的密集2B参数模型……
OpenBMB已经开源了MiniCPM5-2B,一个2B参数的AI模型,针对资源受限硬件优化,用于推理、编码和工具使用,在其尺寸类别中达到最先进的性能,并展示了有效的本地部署能力。
@mdeng34: 前沿LLM正汇聚于高效、自适应推理。Opus 4.7让模型自行决定推理深度。GPT…
新研究引入了SR²AM,这是一种自调节何时使用模拟推理的配置器,提升了LLM的效率和性能。
2.6B 参数模型支持工具调用和 128K 上下文,现可在手机上以 30 tok/s 运行
Liquid AI 发布了 LFM2.5-2.6B,这是一个 2.69B 参数模型,支持 128K 上下文和工具调用,专为多步骤智能体工作流优化,可在手机上以 30 tok/s 运行,Q4_K_M GGUF 文件约 1.67GB。不过,与更大的模型相比,其在编码和知识密集型任务上仍然较弱。
为什么微博的迷你VibeThinker-3B再次引发AI界关于基准测试的争论(15分钟阅读)
微博的VibeThinker-3B,一个3B参数模型,声称在数学和编程基准测试中匹配或超越DeepSeek V3.2和Gemini 3 Pro等更大模型的推理性能,引发了关于基准测试可靠性和扩展必要性的争论。
每美元智能是新的扩展定律:一个小型推理模型在Arc-AGI 1上突破现有成本-精度帕累托前沿
Chart Pathway的BDH-CQ,一个150M参数的推理模型,在ARC-AGI-1上达到了29.5%的准确率,每任务成本远低于像GPT-5.6 Luna这样的大型模型,展示了成本-精度权衡的改进。