冻结的12B模型在已验证任务上超越前沿模型:100%准确率、零Token、精确比特、永久有效
摘要
一个冻结的120亿参数模型,结合了已验证解决方案的持久记忆,在九个问题家族超过180个实例上实现了100%准确率,使用零生成token,精确比特的确定性输出,在已解决任务上超越前沿模型,且计算消耗可忽略不计。
查看缓存全文
缓存时间: 2026/07/28 06:33
论文页面 - 一个冻结的12B模型在验证任务上击败了前沿模型:100%准确率,零推理token,比特精确,永久有效
来源: https://huggingface.co/papers/2607.23806
摘要
如今改善语言模型意味着重新训练它:海量的算力消耗,每个周期一个全新的黑箱模型,非确定性的输出。我们走了一条相反的道路:模型保持冻结,一个经过验证的解决方案的持久记忆库在它旁边不断增长。一旦一个问题族被解决并通过了独立验证步骤(该步骤从不查阅答案),该问题族的每一个新实例都可以在零生成token、比特精确、确定性的情况下回答。在跨越九个问题族的180个全新实例中,来自四个供应商的四种架构(稠密型和混合专家型)均取得了180/180的满分,每个回答的生成token数为零:执行能力与参数规模解耦。通过负对照实验证实,该能力完全归功于记忆库:清空记忆库后,系统无法解决任何问题。同样的“先验证后存储”契约也适用于开放式的推理:所有四个模型在88个一致性门控接受测试中均通过,机器检查形式化证明,以及77/80的推理方法迁移。记忆选择仅需1.4微秒;一次完整复用完成时间在6-23毫秒之间,功耗为36毫瓦时。近似相似性检索在包含4500个项目的验证存储库中,有94.3%的时间选错了条目,而精确寻址则零错误。该存储库还可作为工作上下文使用,其规模没有任何已发布的引擎能够匹配:在单个46GB GPU上可实现600万token的可移动窗口,且内存平坦化,而vLLM停在30,399 token,SGLang在超过32,000 token时静默截断。在已发布的基准测试中,前沿模型在12B模型的原始从头推理能力上仍然遥遥领先;但在本系统已经解决并验证的所有问题上,对比结果发生了逆转:每次前沿API调用都需要为每个查询从头进行生成,而经过验证的复用无需任何token,且每次返回相同的比特位。本报告附带一个公开测试平台,提供免费但有限额的访问:https://corbenic-galahad-bench.hf.space
查看arXiv页面 (https://arxiv.org/abs/2607.23806) 查看PDF (https://arxiv.org/pdf/2607.23806) 项目页面 (https://arxiv.org/abs/2607.23806) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.23806)
引用本论文的模型0
没有模型链接此论文
请在模型README.md中引用 arxiv.org/abs/2607.23806 以链接到此页面。
引用本论文的数据集0
没有数据集链接此论文
请在数据集README.md中引用 arxiv.org/abs/2607.23806 以链接到此页面。
引用本论文的Space0
没有Space链接此论文
请在Space README.md中引用 arxiv.org/abs/2607.23806 以链接到此页面。
包含本论文的收藏集0
没有收藏集包含此论文
请将本论文添加到一个收藏集 (https://huggingface.co/new-collection) 以链接到此页面。
相似文章
Show HN:单个46GB GPU上的600万token可移动窗口
本文介绍了一个冻结的12B模型,该模型利用已验证解决方案的持久内存,在已解决问题族上以零生成token实现100%准确率,并在单个46GB GPU上展示了600万token的可移动窗口。
测试了4个全新的前沿模型(2个中国模型、1个扩散模型、1个智能体模型),使用一个没有逻辑捷径的谜题。其中一个模型连续四次编造来源。
一项对四个全新前沿AI模型(MiMo-V2.5-Pro、MiniMax M3、Mercury 2、LongCat-2.0)的测试,采用需要真正推理而非模式匹配的谜题,结果显示大多数模型表现尚可,但LongCat-2.0反复生成虚假信息并表现出虚假的自信。
@xdotli: 我的朋友 @xeophon 认为编码问题已经解决了,这里有一个验证:一个3B模型接受了以算法效率为重点的训练……
Nanbeige 4.1,一个3B模型,在编码任务中专注于算法效率,超越了Qwen3-30b-A3b和Qwen 3.5 4b,实现了600多次工具调用的长时任务。
@f14bertolotti:一款3B模型的出色表现。这些成果主要通过对Qwen2.5进行训练后优化而实现……
本技术报告介绍了VibeThinker-3B,一个3B参数的模型,通过对Qwen2.5-Coder进行训练后优化(包括基于课程的有监督微调、多域强化学习和离线自蒸馏),实现了前沿水平的可验证推理性能,达到或超越了DeepSeek V3.2等更大的模型。
对2023年初的模型在两个指令遵循数据集上进行微调后效果变得很好
一个在550步内对两个指令遵循数据集进行微调的Pythia-6.9B模型,具备了13种语言的能力,相比基础模型有显著提升。