Jev 已有开放权重竞争者 - Deem 9b

Reddit r/singularity 模型

摘要

Deem 9b 是一个用于校准决策的开放权重 AI 模型,由 LibertAI Labs 发布,作为 TypeSafe 的 Jev 的竞争者,具有诚实的基准测试和开放资源。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/26 17:38

# Deem:开放机器反射,基于Tare的诚实测量 | LibertAI Labs 来源:https://labs.libertai.io/papers/deem-open-machine-reflexes/ *此为Deem论文的v1版本。已发布权重托管于Hugging Face(deem-9b-v1 (https://huggingface.co/LibertAIDAI/deem-9b-v1)和deem-0.8-v1 (https://huggingface.co/LibertAIDAI/deem-0.8-v1)),完整技术栈(含服务代码与基准测试工具集)则托管于GitHub (https://github.com/Libertai/deem)。以下所有数据均经过实测;论文中仍为草案的部分(Tare排行榜、校准目录、扩散通道)在本版本中被移除而非概括。每个数字均可追溯至研究仓库中带时间戳的账目条目。* ## 1. 背景:软件需要决策 大语言模型生成文本;软件需要决策。在状态表示与行动之间,大多数自动化代码需要微小的类型化判断,这些判断以每秒数千次的频率执行,且其概率必须能被周边代码信赖。聊天模型并不适用:它们缓慢、冗长、难以解析,并且在口头要求提供概率时系统性地过度自信。 一种新的模型类别应运而生以弥合这一鸿沟。TypeSafe的Jev(于2026年9月15日发布)自称**系统一模型**:一种通过强化学习训练的非生成式网络,用于校准决策,能在单次前向传播中将非结构化状态映射为类型化的概率决策。发布后的48小时内,至少出现了六个独立的开源克隆。该架构已成为一种常规技术。稀缺的是前沿质量的开放权重、诚实的基准测试,以及解决整个类别当前都在回避的系统一故障模式(计数、算术、多跳推理、跨问题一致性)。 Deem在同一个目标下解决了所有这三个问题:开放的机器反射,基于Tare的诚实测量。本版本中的外部比较使用的是JevBench公共版——该类别MIT许可的开发套件(231个项目);Tare排行榜数据将在下次发布版本中提供。 ## 2. 架构:字母槽跨编码器 Deem在非结构化状态上暴露了三个类型化原语:**Choice**(从2到255个给定选项中选择,返回每个选项的概率)、**Score**(针对2到10个有序等级进行评分,返回等级分布)和**Noul**(某个命题为真的概率)。其线格式与新兴的`/v1/systemone`API形态兼容,因此现有的系统一工具集可无需更改地进行互操作。 状态、问题、字母选项以及答案槽(`Answer k: (`)在单次前向传播中被编码。答案槽处的隐藏状态通过预训练语言模型头部的选项字母行进行投影,并对有效字母执行softmax。每一层都联合关注所有选项,这使得Deem成为决策本身的编码器,而非每个选项的编码器;晚期交互式读出在我们训练规模下因数据不足而被否决。 没有使用新型头部。Noul是一个基于状态条件的隐藏状态上的sigmoid函数。Score是一个独立的每等级softmax函数,并带有单调性正则化器。证据性和狄利克雷头部因其过度自信和正则化器脆弱性而被否决,一个单独的学习置信头部则在对抗性评审中因古德哈特(Goodhart)原则而被放弃:在相同数据上通过相同梯度进行训练时,它将成为第二个声称测量第一个校准度的漂移通道。 另外两项承诺构成了核心。**策略中立权重:** 未内置任何拒绝或对齐训练,因为决策模型是感知-行动循环中的传感器,策略应属于可审计的应用层。**以地面真值为先的数据:** 教师蒸馏仅作为增强手段,从不作为参考;可信来源是其标签通过构造方式计算的程序化生成器(第6节解释了诚实测量教师时发生的情况)。 ## 3. Tare:一个基于结果的基准 Tare是我们为校准机器决策而设计的评估套件,其名称取自使天平归零的配重。其核心论点是该类别的公共评估是循环的,因为它们评分的是与教师共识的一致性。诚实测量本身就是一种贡献,因此诚实的规则是明确的: 1. 不使用教师一致性评分。每个参考标准都是一个结果或一个人类标签。 2. 校准度在固定的温度缩放后严格测量,并且拟合的温度会随每次发布一起公布。 3. 评估集从不经过教师评分;教师不一致的行构成单独的诊断集。 4. 数据集有版本号且采用Apache-2.0许可证,因此分数在不同版本间具有可比性。 一致性探针(否定、释义、置换)以配对准确率评分,因为仅凭不变性可能通过一个始终错误的模型来满足。 ## 4. 字母槽SFT的五个阶段 论文的骨架是一个五阶段演进弧线,其中每个故障都被预设的门控捕获、因果诊断,并通过一行数据生成的改动修复。发布的配方正是这些失败后的残留物。 **阶段1:位置绑定的捷径。** 在41,420个字母槽行上对Qwen3.5-0.8B进行全参数微调,使八个锚定数据集上的留出集宏准确率从0.508提升至0.679,宏ECE从0.191降至0.053。准确率门控通过。一致性门控以约50倍的幅度失败:置换翻转率为0.92至0.99(预设阈值低于2%),经过选项打乱后,ag_news的准确率从0.84坍塌至随机水平,并在唯一一个行置换的锚定数据集(MMLU)上产生灾难性干扰(从0.405降至0.253,这是一个完美校准的均匀分布:模型诚实地处于无知状态)。根本原因是八个训练数据锚中有七个的选项顺序是固定的。模型学到了字母,而非答案。 **阶段2:修复暴露了否定盲区。** 训练时的选项顺序随机化在一次运行中消除了捷径灾难(ag_news翻转率从0.993降至0.0067,宏准确率0.768)。精炼的读出机制随后暴露了第二个失败:模型对一个命题及其否定赋予几乎相同的概率(相关性+0.93),因为否定模板从未出现在训练数据中。一个因果性的0.8B探针模型实验重现了这一盲区,并在完整重训前预测了修复方案。 **阶段3:否定对。** 为每个真值是/否项目生成两个极性行是零成本的,因为真值是已知的。它以零准确率成本解决了盲区问题:一致性误差从0.895降至0.0128,配对准确率从0.213提升至0.827,相关性从+0.93变为-0.99,宏准确率保持在0.766。 **阶段4:精确法则上的校准不确定性。** 在程序生成的卡牌抽取、硬币二项分布、计数和网格问题上进行训练,这些问题的目标是真正的概率分布,产生了第一个在封闭形式概率问题上具有校准不确定性的检查点:313个留出关键点上的宏布里尔得分(Brier)从0.328降至0.033,准确率从0.649提升至0.971,计数零答案行从0.909降至完美的55/55。 **阶段5:一个温度隐藏了五次校准偏差。** 一个事后的按类别校准器在诚实的开发/评估集拆分上关闭了最终的ECE门控(宏ECE为0.0433,目标为0.06,准确率提升0.74个百分点)。它所解决的“差一点”的问题是一个小型经典案例:一个单一标量温度(T=3.46)用于五级序数任务时,会将四个表现良好的等级压平至接近均匀分布。按类别向量读数为[1.24, 0.97, 0.93, 0.94, 0.92]。 核心的经验教训是,准确率门控本身不能证明任何事情。每一个失败的一致性探针都暴露出一个具有一行修复方案的训练数据缺陷,并且每个修复方案在完整重训之前,都在探针规模上通过了因果验证。 ## 5. 长状态、外部检查和有效的杠杆 4B策略通道在28,500个程序生成的策略包行上训练(多条款雇佣政策,附带附录和修正案,真值由构造方式确定),其在2,000至3,200令牌下的长状态重新渲染使长策略留出集达到0.975,陷阱问题达到0.951,表面跟随行为为0.043(越低越好):模型应用修正案,而非匹配关键词接近度。在外部JevBench公共套件(231个项目,严格用作开发门控,从未用于训练)上,相同的检查点呈现出一个更有纪律的故事: JevBench公共简单项原始项困难项noul基础4B零样本0.8750.5000.3690.4784B + 策略通道 (v8)0.9580.7500.4410.6899B 规模扩大 (v10)0.9580.7360.4860.689开放前沿 (reflex-4B)--0.632-Jev (封闭领先者)--0.741- *注意:原始JevBench运行器将每个评分项都计为是/否,导致231个项目中的18个(全部12个序数项,6个困难项)自动失败。修复后的运行器将v10的困难项读数修正为0.495,将冻结的9B基础模型读数修正为0.568,以下的微调/回归比较使用了这些修复运行器的数据。* 三个对照实验框定了发布的检查点。**领域假设在其首次测试中失败。** 添加一个完全验证的、同样有28,500行的工作时间领域(留出集0.963)使JevBench困难项表现变差(0.396),因此仅靠生成器多样性无法弥合外部差距。**零样本控制是最具决定性的。** 冻结的9B基础模型通过相同工具集在困难项上读数为0.568,这意味着我们自己112,841行的混合数据以7.3个百分点的困难推理能力为代价,换来了格式、校准和长状态方面的增益。**规模与组成是有效的。** 微调与基础模型在logit空间中的几何(几何平均)集成(0.5/0.5权重)在简单项1.00、困难项0.595上读数;权重空间插值读数为0.559;一个9,149行的针对性增量训练(时间/数字演练、法官验证领域、歧义对)单独也达到了0.559,在不进行集成的情况下弥合了与冻结基础模型的差距。 **思考槽与忠实轨迹。** 用采样的推理轨迹(k=4,每个后读一次字母槽)扩展读出机制,并在多步轨迹上训练,将困难项提升至0.604,但首次生成的轨迹是在合理化而非重新计算:一个法官是偏见在9/17的案例中存活。用忠实的轨迹替换(通过GenRM风格的重新计算进行验证),将是偏见从9/17改善至16/17,并将困难项提升至仅链式思考(CoT)0.689,在231项完整测试中为0.658(对于10/231项没有轨迹完成的项目,采用直接回退)。 分层路由复合服务(简单项直接通过,其他项扩展)读数为100.0 / 91.7 / 65.8,这是发布模型卡上的数字。两个零点基准框定了增益:一个基于基础模型的置信感知路由器得分为零,因为基础模型在法官项目上一致偏向否(它对所有问题都回答否,概率约0.005),因此不存在路由信号,修复必须通过训练实现;而链式思考的单次蒸馏转移为零,学生读数与教师的直接读数0.541完全一致。概率修复增量(v14)使概率基准变得更差。约23个项目的“不可能核心”持续存在。 ## 6. 教师,诚实测量 在投入计算资源进行蒸馏之前,我们对三个前沿教师进行了预设的“死亡门控”探针测试:一致性≥0.85且ECE≤0.10。三个教师在试点测试(50个手写项目)中均通过:一致性0.96至0.98,ECE 0.025至0.040。随后,我们在真实锚定数据(1,050个项目,5,600次API调用,耗资0.71美元,其中两名教师)上进行了大规模重复测量:一致性降至0.730和0.782,ECE升至0.133和0.198,两名教师均未通过预设门控,准确率领先优势反转至校准较差的教师,指定的校准锚点显示出40%的A位置偏差。仅在简单项目上的小型探针测量的是探针本身。 使教师分布可用的机制现已成为硬性要求,而非最佳实践:置换边际化(锚点教师自身的翻转率为14%)、拟合温度(T=3.26和T=7.40)、按领域的逆布里尔加权,以及标记16%的不一致行。原始教师分布绝不直接作用于学生模型。 ## 7. 愿景:自由生成器真值优于前沿蒸馏 一个具有构造真值的合成UI生成器隔离了前沿视觉教师的存在偏见失败:在零计数面板上,它们计算所有元素而非目标类别。该失败在三个探针中均复现(最差教师在零计数行上准确率22.7%)。一个2B开源视觉语言模型(Qwen3-VL-2B + LoRA)在一块GPU上仅通过生成器真值训练48分钟后,消除了此问题:在零计数行上达到100%(200/200),而教师上限仅为22.7%和59.1%,整体计数准确率86.2%优于两位教师(61.4% / 68.6%)。唯一的让步是针对小文本的成对相同读取,这是小模型的OCR限制。核心结论很清晰:在教师最差的失败模式上,生成器真值以一块GPU上48分钟的训练成本优于前沿蒸馏。 ## 8. 89秒的强化学习 首次从可校验密度进行的强化学习运行——REINFORCE算法,硬性KL锚定到SFT检查点,每个奖励基于封闭形式概率法则或广度优先搜索(BFS)结果计算——在准确率不变的情况下,将留出集精确法则宏布里尔得分从0.0332降至0.0291(相对提升12%),且无可观测漂移:置换翻转率和开发集宏准确率在前后完全一致。没有教师标签,没有人工评分器,循环中无解码过程; rollout是单次前向传播,读取答案槽对数值。它在单个工作站GPU上运行了89秒。强化学习循环端到端有效;在策略生成器上进行真正的强化学习阶段是中期的差异化因素。 ## 9. 发布 发布日当天发布了两个检查点,均为Apache-2.0许可。 **deem-9b-v1**(Qwen3.5-9B-Base + LoRA,合并)在其发布的置信门控模式下服务JevBench公共简单项1.00 / 原始项0.944 / 困难项0.613:始终直接通过,当直接读出的熵超过阈值tau时采用链式思考,每个项目约2.2秒,58%的项目在单次通过中解决。分层路由复合读数为1.00 / 0.917 / 0.658,对已完成轨迹的扩展推理读数为困难项0.689。单次通过困难项读数为0.541;模型卡将0.658标注为复合值。法官级验证为16/17。它在低功耗边缘GPU上提供短决策的P50延迟为103.2毫秒,3,222令牌长状态决策的P50延迟为787.8毫秒(仅预填充,无解码阶段);该类别领导者的远程HTTP中位数为252.8毫秒(含网络,因此不可直接比较)。 **deem-0.8-v1**(Qwen3.5-0.8B,在其自身的124.8k行真值验证混合数据上进行全参数微调)是CPU原生兄弟:长策略留出集96.3%(陷阱91.8%),精确法则计数0.976,网格0.984,零计数1.000,在争用桌面CPU上362毫秒短决策,通过我们Rust运行时中手写的AVX-512 int8内核实现0.9GB常驻内存,并与PyTorch在bf16噪声地板上进行了奇偶校验门控。其外部困难项拆分读数为0.333;其优势在于长策略领域。 ## 10. 局限性 教师研究仅大规模覆盖了两名教师、三个锚定数据集、一个种子和一个时间点;其拟合温度需要在每次发布时重新拟合。SFT弧线在每个规模上都是单种子的,事后校准关闭了ECE门控而非在训练中解决。JevBench公共版是一个231项目的开发门控,每个拆分大约带来3个百分点的二项噪声;其中没有任何项目用于训练或温度校准,且门控模式的tau是在公共套件上选择的,其值为...

相似文章

Jev

Product Hunt

Jev 是 TypeSafe AI 的前沿模型,用于快速、结构化的AI决策,返回带有校准概率的类型化输出,现已向所有人开放。

Jev / TypesafeAI 在 LLM 领域堪称革命性

Reddit r/ArtificialInteligence

Jev 是一种新型 AI 模型,它输出评分、选择或二元决策,因其在创意查询时的速度、经济性和准确性而备受赞誉,不同于传统的前沿模型。