@yibie: https://x.com/yibie/status/2102565806466912408

X AI KOLs Timeline 模型

摘要

Jev-Omni 是第一个将类型化决策扩展到多模态的开放权重模型,支持文本、图像、音频和视频,直接返回选项的概率分布而不生成解释。

https://t.co/cwEaaxzmQo
查看原文
查看缓存全文

缓存时间: 2026/09/23 02:02

把类型化决策做到多模态:Jev-Omni

作者:akhilaaa3(独立研究者;Apache-2.0,基于 google/gemma-4-12B-it)

Jev 那条线上又出了一件东西,而且是这几个月里最扎实的一件:第一个把类型化决策做到多模态的开放权重模型——文本、图像、音频、视频都能问,答案是每个选项一个概率,不生成解释。

地址:https://huggingface.co/akhilaaa3/Jev-Omni

一、它做了什么

给它一个 state 和一个问题加选项,它返回每个选项的概率。不是生成一段解释,也不是输出 JSON——是直接给出概率分布。

classifier = load_jev_omni()

result = classifier.predict(

state=“The meeting starts at 10 AM. It is now 9 AM.”,

question=“Has the meeting started?”,

options=[“Yes”, “No”],

)

加媒体就多传一个参数:media 指向文件,modality 填 image / audio / video。音频上限 30 秒,视频取 16 帧。

底座是 Gemma 4 12B IT,跑了一次三万个问题的微调。三种原语齐全:noul(是/否)、choice、score。

二、结果

DecisionBench Medium(80 场景 / 293 问) 87.57%

JevBench(195 组配对 / 231 决策) 86.15%

MMAU(1000 问) 63.10%

MVBench(14 任务 / 2786 问) 53.10%

校准是它最漂亮的地方:Medium 集上的 ECE 只有 0.0400。 这个数字比 Jev 本体还好(后面有对照)。

三、速度(H200,预热后中位数)

文本(约 2000 token) 83 ms

图像 26 ms

13 秒音频 31 ms

16 帧视频 504 ms

四、它自己贴的两条限制

第一,选项数最好不超过 20。 头部虽然接受 256 个选项,但「超过 20 个选项的质量未经确立」——这句话写得很诚实,没有假装 256 是可用上限。

第二,需要 CUDA GPU。 FP32 权重约 50GB,推理时用 BF16 autocast。这不是笔记本上的东西。

五、它公布的训练配方(这种透明度少见)

decision_config.json 里把整个训练配方摊开了:

底座 Gemma4UnifiedTextModel(hidden 3840)

输出类别 256

微调数据 24000 条(1 epoch)

LoRA rank 512,alpha 512

学习率 1e-5(头和 LoRA 同率)

effective batch 32(microbatch 8,grad_acc 1)

步数 750

warmup 0.1(75 步)

seed 3407

初始化 FP32 merged v1 + 训练好的头 + 新的 LoRA

checkpoint /out/hard4k-20260919/rank128

几个细节值得注意: LoRA rank 512 是相当高的(常见是 8-32);checkpoint 路径里的 hard4k 暗示它用了一批困难场景做训练;adapters_merged 显示它是在一个 rank-128 的 v1 之上再叠一次。

而且它还附了 verification.json 做数值验证:

merged 与 adapter 的 argmax 一致 true

FP32 merged 与 adapter 最大概率差 3.39e-05

保存后重新加载的概率精确一致 true

发布模型时公开「合并后的权重与适配器数值等价」这件事,做的人不多。

六、和它自己引用的基准对照

它对照了两个开放权重模型,都是真实存在的:

Jev-Omni 12B MMAU 63.10% MVBench 53.10% 文本/图/音/视

Inkling 975B(激活 41B) MMAU 77.20% — 文本/图/音

Qwen3.5-397B-A17B 397B(激活 17B) — MVBench 77.60% 文本/图/视

差得很远,而且它自己标注了「参照分数由各自开发者官方报告,评估协议可能不同」。三个模型的模态覆盖也不同(没有一个是四模态齐全的),所以这不是同条件对照,它的写法也没有暗示是。

七、DecisionBench:一个经过一次自我更正的数据集

这是我最欣赏这篇的部分。数据集页面上公开写着它更正过自己的一张图:

早先版本的图里,Jev 1.13 是按「每个 state 一次调用」跑的,而 Jev-Omni 已经是按「每个问题一次调用」跑。批量调用把 state 的一份开销摊到了它的每个问题上,于是在 medium 集平均 3.7 问/state 的情况下,这让 Jev 显得比实际便宜约三倍——而且它是那张成本图上唯一一个和旁边模型用了不同测量方式的点。

修正后的对照(medium 集):

Gemini 3.8 Flash 99.12% ECE 0.0067 $0.00412/state

Claude Sonnet 5 99.12% ECE 0.1116 $0.01645/state

GPT-5.6 Luna 98.76% ECE 0.0044 $0.00126/state

Jev 1.13 90.48% ECE 0.0324 $0.00048/state(每问一次调用)

hard 集:

Gemini 3.8 Flash 96.04% ECE 0.0093

Claude Sonnet 5 88.35% ECE 0.1365

GPT-5.6 Luna 85.92% ECE 0.0748

Jev 1.13 65.26% ECE 0.1204

这份数据很不利于 Jev:medium 上落后前沿模型约 9 个百分点,hard 上落后 Gemini 达 31 个百分点。

而且它把「这个差距有多大」也算清楚了:把一个 state 拆成逐问调用,input token 会乘以 2.82 倍(medium)/ 3.09 倍(hard)——所以如果三个聊天模型也按同样方式计价,它们在图上会整体右移同样的倍数。在对数轴上这是均匀平移,不改变排序,也补不上 Jev 和前沿模型之间大约一百倍的差距。

作者还补了一句:请把带星号那行的绝对成本当作下界。

八、校准图上有一个细节

可靠性图(confidence vs 实际准确率)那里,作者标注了 Luna 的行为:

Luna 在 medium 集上的置信度是自报的、保留两位小数——293 个答案里有 227 个说「99%」。它们全落进 80–100% 那个 bin,所以 Luna 在图上是一个点,不是一条曲线。

这条注释放得很好:它解释了图为什么长那样,而不是让人误以为模型完美。

九、为什么这篇值得单独写

因为它是 Jev 线上第一个把「我可能错了」写进发布物的东西。

对照我们之前写过的几件事:

  • TypeSafe 官方发布 Jev 时,没有任何技术论文

  • 那个「一年前就做过」的作者,最初的说法是「我做的就是 Jev 架构」(我们核对后认为夸大)

  • 而这一份:公开了完整训练配方、公开了数值验证、公开了选项数上限的真实边界、还公开更正了自己一张让自家模型看起来更好的图

它还明确划清界限:「Jev-Omni 是一个实现类型化决策接口的独立开放模型,与 TypeSafe AI 或其 Jev 模型无隶属、背书、赞助关系,也不是从其衍生,没有任何部分是用 Jev 的输出训练的。」

十、我的判断

技术上,它的价值在于证明了「类型化决策」可以扩展到模态: 图像 26ms、音频 31ms——不生成任何东西就直接给概率。这对需要「看图/看视频做判断」的流水线是条新路径。

它的 ECE 0.0400 也值得记一档——比 Jev 1.13 在 medium 上的 0.0324 略差,但比 Sonnet 5 的 0.1116 好得多。也就是说:在开源这一侧,校准水平已经可以打平甚至超过部分闭源前沿模型的输出。

但它没有改变基本格局。 12B 对上一百倍参数的模型,在 hard 集上差 30 个百分点——模型规模仍然是硬约束。它的意义是「这条路走得通,而且可以开源」,不是「开源追上了前沿」。

最后:这个模型 69 个赞,两天前发布,作者只有这一个模型。按我们之前那个「收藏数不等于质量」的判断标准——它的价值在方法透明度上,不在热度上。

链接

模型页:https://huggingface.co/akhilaaa3/Jev-Omni

基准数据集:https://huggingface.co/datasets/akhilaaa3/decision-bench

底座模型:https://huggingface.co/google/gemma-4-12B-it

#类型化决策 #多模态 #开源模型

相似文章