冻结的12B模型在已验证任务上超越前沿模型:100%准确率、零Token、精确比特、永久有效

Hugging Face Daily Papers 论文

摘要

一个冻结的120亿参数模型,结合了已验证解决方案的持久记忆,在九个问题家族超过180个实例上实现了100%准确率,使用零生成token,精确比特的确定性输出,在已解决任务上超越前沿模型,且计算消耗可忽略不计。

如今改进一个语言模型意味着重新训练:庞大的计算量、每轮一个不透明的新模型、非确定性输出。我们走相反的道路:模型保持冻结,旁边伴随一个持续增长的已验证解决方案的持久记忆。一旦某个问题家族被解决并通过了从不查阅答案的独立验证步骤,该家族的每个新实例都以零生成token、精确比特、确定性方式回答。跨越九个问题家族的180个全新实例,来自四个供应商的四种架构(密集型和专家混合型),每个都以零生成token每答案获得180/180分数:执行绑定的能力与参数规模脱钩。一个负面对照实验将能力完全归因于记忆:清空后,它什么也解决不了。相同的先验证后存储契约适用于开放式推理:所有四个模型上88/88的一致性门控接受,机器检验的形式化证明,以及77/80的推理方法迁移。记忆选择耗时1.4微秒;完整重用完成需6-23毫秒,功耗36毫瓦时。在包含4500个项目的已验证存储中,近似相似性检索选错项目的概率为94.3%,而精确寻址则零错误。该存储还能作为工作上下文,其规模没有已发布的引擎能匹敌:在单块46GB GPU上以平坦内存提供600万个token的可移动窗口,而vLLM在30,399个token处停止,SGLang在超过32,000个token时静默截断。在已发布的基准测试中,前沿模型在原始从头推理方面仍远胜于任何12B模型;但在本系统已解决并验证的所有任务上,比较结果完全反转:前沿API调用每次查询都要付出全新的生成过程,永远如此,而已验证的重用成本为零token,且每次返回完全相同的比特。本报告附有一个公共测试平台,提供免费但限速的访问权限:https://corbenic-galahad-bench.hf.space
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:33

论文页面 - 一个冻结的12B模型在验证任务上击败了前沿模型:100%准确率,零推理token,比特精确,永久有效

来源: https://huggingface.co/papers/2607.23806

摘要

如今改善语言模型意味着重新训练它:海量的算力消耗,每个周期一个全新的黑箱模型,非确定性的输出。我们走了一条相反的道路:模型保持冻结,一个经过验证的解决方案的持久记忆库在它旁边不断增长。一旦一个问题族被解决并通过了独立验证步骤(该步骤从不查阅答案),该问题族的每一个新实例都可以在零生成token、比特精确、确定性的情况下回答。在跨越九个问题族的180个全新实例中,来自四个供应商的四种架构(稠密型和混合专家型)均取得了180/180的满分,每个回答的生成token数为零:执行能力与参数规模解耦。通过负对照实验证实,该能力完全归功于记忆库:清空记忆库后,系统无法解决任何问题。同样的“先验证后存储”契约也适用于开放式的推理:所有四个模型在88个一致性门控接受测试中均通过,机器检查形式化证明,以及77/80的推理方法迁移。记忆选择仅需1.4微秒;一次完整复用完成时间在6-23毫秒之间,功耗为36毫瓦时。近似相似性检索在包含4500个项目的验证存储库中,有94.3%的时间选错了条目,而精确寻址则零错误。该存储库还可作为工作上下文使用,其规模没有任何已发布的引擎能够匹配:在单个46GB GPU上可实现600万token的可移动窗口,且内存平坦化,而vLLM停在30,399 token,SGLang在超过32,000 token时静默截断。在已发布的基准测试中,前沿模型在12B模型的原始从头推理能力上仍然遥遥领先;但在本系统已经解决并验证的所有问题上,对比结果发生了逆转:每次前沿API调用都需要为每个查询从头进行生成,而经过验证的复用无需任何token,且每次返回相同的比特位。本报告附带一个公开测试平台,提供免费但有限额的访问:https://corbenic-galahad-bench.hf.space

查看arXiv页面 (https://arxiv.org/abs/2607.23806) 查看PDF (https://arxiv.org/pdf/2607.23806) 项目页面 (https://arxiv.org/abs/2607.23806) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.23806)

引用本论文的模型0

没有模型链接此论文

请在模型README.md中引用 arxiv.org/abs/2607.23806 以链接到此页面。

引用本论文的数据集0

没有数据集链接此论文

请在数据集README.md中引用 arxiv.org/abs/2607.23806 以链接到此页面。

引用本论文的Space0

没有Space链接此论文

请在Space README.md中引用 arxiv.org/abs/2607.23806 以链接到此页面。

包含本论文的收藏集0

没有收藏集包含此论文

请将本论文添加到一个收藏集 (https://huggingface.co/new-collection) 以链接到此页面。

相似文章

Show HN:单个46GB GPU上的600万token可移动窗口

Hacker News Top

本文介绍了一个冻结的12B模型,该模型利用已验证解决方案的持久内存,在已解决问题族上以零生成token实现100%准确率,并在单个46GB GPU上展示了600万token的可移动窗口。