@airesearch12: 介绍 ImageJevBench Jev-Omni decider-2b-vision Reflex 4B 视频展示了 89 张公开的合成图像。运行中 …
摘要
ImageJevBench v0.1 被介绍为一个用于评估 AI 模型在图像决策任务上的基准,基于性能、成本和校准指标对系统如 Jev-Omni 和 decider-2b-vision 进行排名。
查看缓存全文
缓存时间: 2026/09/26 19:05
ImageJevBench 介绍
🥇Jev-Omni
🥈decider-2b-vision
🥉Reflex 4B
视频展示了 89 张公开的合成图像。
在这所有图像上运行前 5 名模型的成本为 $0.0217。
你明白这具有多大的颠覆性吗?
https://t.co/QUYHhvm8uw https://t.co/lS8o9EEIRO
Image JevBench v0.1 —— 图像决策基准测试
来源:https://benchmarkheaven.com/image-jev-bench
图像基准测试 · v0.1
对基于图像进行决策的系统进行留出比较,涵盖界面目标到日常场景。
冻结的基准测试包含 684 个评分项目:228 个公开项和 456 个密封项;另有 93 项已退役且不计分。本页仅显示密封项的汇总结果,不包含任何密封任务、图像、答案键或单项目预测。
注意: 333 项新的密封项是我们自己生成的合成图像和渲染图。对于前沿 API 模型而言,它们比早期的真实来源项目更容易,因此大多数托管系统的密封准确率高于早期分割的准确率。
综合得分
整体基准测试,684 个决策项。条形图包含全部 12 个系统。粉色条为托管 API;Gemma 使用 Autoloops,未做出提供者无数据保留声明。若系统在成本或校准轴上低于门槛,则得 0 分;行中说明了具体门槛。
- 1.Jev-Omni73.10
- 2.Mapika decider-2b-vision BF1666.77
- 3.Reflex 4B 发布的稳定配置65.38
- 4.djev-spark NVFP449.38
- 5.Autoloops – Gemma 4 31B ITAPI47.14
- 6.djev-dev BF1646.64
- 7.Bonsai-2-27B v2
PQ2\_0+Q8\_0MMProj19.26 - 8.GPT-6 Luna 低推理努力程度API16.06
- 9.GPT-5.6 LunaAPI11.05
- 10.Gemini 3.1 Flash LiteAPI9.58
- 11.Gemini 3.8 Flash0.0 · 受成本限制(每 1,000 决策 2.06 美元)API0.00
- 12.OpenJev 4B NLI v2 官方图像-前提路径0.0 · 受校准限制(未报告概率)0.00
完整排名
按综合得分排名:智力、校准、速度和成本轴权重相等,然后是不变的 Jev-class 门控。匹配差距是匹配系列内公开项与密封项准确率的有符号差值。目前没有系统超过 15 个百分点的允许偏差。托管系统标记为 API,因为它们的提供者收到了密封图像和问题;Gemma 4 端点在暴露说明中单独标识。
#系统综合智力校准速度成本差距(匹配)早期分割公开准确率密封准确率美元 / 1,000p50 / p951Jev-Omni73.1063.9389.9089.6859.52-1.0 pp#3 · 55.63153/228·67.1%368/456·80.7%0.02美元240.076 s/0.103 s2Mapika decider-2b-vision BF1666.7752.8481.4688.1757.59-4.4 pp#1 · 70.02151/228·66.2%319/456·70.0%0.02美元590.091 s/0.154 s3Reflex 4B 发布的稳定配置65.3863.3483.6886.1449.35-0.6 pp#2 · 68.10184/228·80.7%333/456·73.0%0.04美元880.154 s/0.191 s4djev-spark NVFP449.3849.1084.3083.5145.95+3.4 pp#5 · 41.56146/228·64.0%307/456·67.3%0.06美元330.173 s/0.374 s5Autoloops – Gemma 4 31B ITAPI47.1479.2782.3873.8942.65+0.7 pp#4 · 45.91193/228·84.6%397/456·87.1%0.08美元161.425 s/2.868 s6djev-dev BF1646.6449.6078.0283.0044.69+6.6 pp#6 · 38.76153/228·67.1%302/456·66.2%0.06美元980.193 s/0.392 s7Bonsai-2-27B v2PQ2\_0+Q8\_0MMProj19.2674.9190.7173.6229.43+1.9 pp#7 · 18.95191/228·83.8%379/456·83.1%0.22美元520.799 s/1.167 s8GPT-6 Luna 低推理努力程度 设置:OpenRouter reasoning.effort=low 成本收据覆盖91.8%的调用 API16.0681.1088.3165.7027.48+12.0 pp#8 · 16.51203/228·89.0%395/456·86.6%0.21美元662.905 s/9.256 s9GPT-5.6 Luna 成本收据覆盖99.6%的调用 API11.0591.8195.7862.5823.49-0.8 pp#9 · 12.57211/228·92.5%436/456·95.6%0.35美元242.878 s/19.176 s10Gemini 3.1 Flash LiteAPI9.5884.2891.4464.4922.31-0.2 pp#10 · 9.24194/228·85.1%419/456·91.9%0.38美元881.799 s/19.775 s11Gemini 3.8 Flash0.0 · 受成本限制(每 1,000 决策 2.06 美元)API0.0088.4772.9858.780.58+0.8 pp#11 · 0.00202/228·88.6%430/456·94.3%2.05美元994.832 s/27.423 s12OpenJev 4B NLI v2 官方图像-前提路径0.0 · 受校准限制(未报告概率)0.0063.580.0079.5440.89+3.9 pp#12 · 0.00187/228·82.0%331/456·72.6%0.09美元340.317 s/0.634 s
比较两个系统
搜索任意两个已测量的系统。雷达图使用与排名相同的四个 0–100 分数轴;越靠外越好。
- A: Jev-Omni · 综合得分73.10
- B: Mapika decider-2b-vision BF16 · 综合得分66.77
Image JevBench 四轴对比 Jev-Omni 对比 Mapika decider-2b-vision BF16。智力:63.9 对比 52.8;校准:89.9 对比 81.5;速度:89.7 对比 88.2;成本:59.5 对比 57.6。50100智力63.9·52.8校准89.9·81.5速度89.7·88.2成本59.5·57.6分数来自冻结的 Image JevBench v0.1 汇总;未显示单项目结果。数值表格如下 轴 Jev-Omni Mapika decider-2b-vision BF16 智力 63.9 52.8 校准 89.9 81.5 速度 89.7 88.2 成本 59.5 57.6
公开项目示例
这八个示例来自公开分割。每张卡片显示图像、问题、选项和正确答案;许可来源在图像下方注明。
传送带上一个纸板包裹,其一角明显撕裂。
日常照片
包裹状况
问题: 包裹是否有明显损坏?
- A.是 正确
- B.否
正确答案: A.是
来源:为 ImageJevBench 创建的合成图像 · 公开项 promo-parcel-01
一张打印的咖啡馆收据,可见商品名称、金额、税费和总计。
日常照片
收据可读性
问题: 收据是否可读?
- A.是 正确
- B.否
正确答案: A.是
来源:为 ImageJevBench 创建的合成图像 · 公开项 promo-receipt-00
一个电子表格,显示数字格式对话框和五个带标签的标记。
计算机使用 · 电子表格
更改单元格格式
问题: 目标:将选中的单元格更改为“文本”类型。应点击哪个带标签的标记?
- A.点击标记 A
- B.点击标记 B 正确
- C.点击标记 C
- D.点击标记 D
- E.点击标记 E
正确答案: B.点击标记 B
来源:ScreenSpot-Pro · excel_macos_0 (https://huggingface.co/datasets/likaixin/ScreenSpot-Pro/tree/210e78d3844251110bff86c95835ebd37a6930fa) · MIT · 210e78d38442 · 公开项 mm-195 · 许可证文本:MIT (https://opensource.org/license/mit) 改编:在原始截图上绘制了五个带标签的点击标记。
桌面浏览器显示体育页面、浏览器标签页和五个带标签的标记。
浏览器
打开新标签页
问题: 目标:打开新标签页。应点击哪个带标签的标记?
- A.点击标记 A
- B.点击标记 B
- C.点击标记 C
- D.点击标记 D
- E.点击标记 E 正确
正确答案: E.点击标记 E
来源:ScreenSpot · 项目 15 (https://huggingface.co/datasets/bevaya/ScreenSpot/tree/0be08781e2e188582f6131625ae1598d443b4d5d) · Apache-2.0 · 0be08781e2e1 · 公开项 mm-135 · 许可证文本:Apache-2.0 (https://www.apache.org/licenses/LICENSE-2.0) 改编:在原始截图上绘制了五个带标签的点击标记。
移动翻译界面,显示“Hello, world”和五个带标签的目标标记。
移动应用 · 翻译
使用翻译控件
问题: 目标:翻译。应点击哪个带标签的标记?
- A.点击标记 A
- B.点击标记 B
- C.点击标记 C
- D.点击标记 D 正确
- E.点击标记 E
正确答案: D.点击标记 D
来源:ScreenSpot · 项目 341 (https://huggingface.co/datasets/bevaya/ScreenSpot/tree/0be08781e2e188582f6131625ae1598d443b4d5d) · Apache-2.0 · 0be08781e2e1 · 公开项 mm-118 · 许可证文本:Apache-2.0 (https://www.apache.org/licenses/LICENSE-2.0) 改编:在原始截图上绘制了五个带标签的点击标记。
Windows 文件管理器上下文菜单,包含五个带标签的目标标记。
计算机使用 · 文件管理器
复制文件
问题: 目标:复制文件。应点击哪个带标签的标记?
- A.点击标记 A 正确
- B.点击标记 B
- C.点击标记 C
- D.点击标记 D
- E.点击标记 E
正确答案: A.点击标记 A
来源:ScreenSpot · 项目 19 (https://huggingface.co/datasets/bevaya/ScreenSpot/tree/0be08781e2e188582f6131625ae1598d443b4d5d) · Apache-2.0 · 0be08781e2e1 · 公开项 mm-139 · 许可证文本:Apache-2.0 (https://www.apache.org/licenses/LICENSE-2.0) 改编:在原始截图上绘制了五个带标签的点击标记。
一个标注的平行四边形图,底边为 23 英尺,斜边为 16 英尺。
一个紧凑的财务表格,包含 2014 和 2015 年净收入数据。
FinQA · 财务表格
计算收入变化
问题: Entergy 公司在 2015 年的净收入净变化是多少?
- A.103.4
- B.84.6
- C.94 正确
- D.112.8
正确答案: C.94
来源:FinQA · 表格项 (https://huggingface.co/datasets/bevaya/FinQA/blob/3d6a736bc67e06bc15fbf3618d88204a57c5b25e/README.md) · MIT 注释;CDLA-Permissive-1.0 表格数据 · 3d6a736bc67e · 公开项 mm-061 · 许可证文本:MIT (https://opensource.org/license/mit), CDLA-Permissive-1.0 (https://cdla.dev/permissive-1-0/) 表格数据:IBM FinTabNet (CDLA-Permissive-1.0)。表格由 ImageJevBench 重新渲染为图像;未显示原始申报页面。
截图图像改编自注明的已引用数据集(添加了带标签的标记);FinQA 表格由 ImageJevBench 重新渲染。许可证:Apache-2.0 (https://www.apache.org/licenses/LICENSE-2.0)(ScreenSpot)、MIT (https://opensource.org/license/mit)(ScreenSpot-Pro、Geometry3K、FinQA 注释)、CDLA-Permissive-1.0 (https://cdla.dev/permissive-1-0/)(FinTabNet 表格数据)。截图中显示的网站和应用内容属于其各自所有者。未显示 Mind2Web 或 Android-in-the-Wild 图像。
按赛道划分的结果
每个赛道按其自身的公开和密封项目进行排名。许可的核心项和合成的日常照片结果保持单独显示。
核心 · 500 项
139 个公开项 · 361 个密封项:62 个真实来源项和 299 个新的合成池项(文档、图表、库存、安全)。
#系统综合智力校准速度成本公开准确率密封准确率美元 / 1,0001Jev-Omni69.7155.9687.3289.6759.1771/139·51.1%276/361·76.5%0.02美元302Reflex 4B 发布的稳定配置65.7559.2282.5286.5049.90103/139·74.1%249/361·69.0%0.04美元683Mapika decider-2b-vision BF1654.8346.2978.5988.5759.0975/139·54.0%234/361·64.8%0.02美元314Autoloops – Gemma 4 31B ITAPI45.9975.1076.4975.0442.62107/139·77.0%305/361·84.5%0.08美元185djev-spark NVFP432.1641.1180.2683.5545.8167/139·48.2%224/361·62.0%0.06美元406djev-dev BF1629.9841.3672.4183.0444.5571/139·51.1%220/361·60.9%0.07美元057Bonsai-2-27B v2PQ2\_0+Q8\_0MMProj18.9568.8687.6774.1629.48103/139·74.1%286/361·79.2%0.22美元438GPT-6 Luna 低推理努力程度 设置:OpenRouter reasoning.effort=low 成本收据覆盖90.6%的调用 API17.1076.6284.8266.9228.33114/139·82.0%310/361·85.9%0.19美元559GPT-5.6 Luna 成本收据覆盖99.6%的调用 API10.9089.5894.0063.0823.40122/139·87.8%342/361·94.7%0.35美元5010Gemini 3.1 Flash LiteAPI9.0679.4185.5665.1721.96105/139·75.5%324/361·89.8%0.39美元9411Gemini 3.8 Flash0.0 · 受成本限制(每 1,000 决策 2.24 美元)API0.0085.1173.6759.410.00113/139·81.3%336/361·93.1%2.23美元5112OpenJev 4B NLI v2 官方图像-前提路径0.0 · 受校准限制(未报告概率)0.0060.060.0080.2041.25104/139·74.8%251/361·69.5%0.09美元09
日常照片决策 · 184 个合成项
89 张来自推广集的公开图像;95 个密封项:来自 v0.1 候选池审查的 61 个变体,涵盖 17 个匹配情境和 34 张新的池照片。经过视觉、双模型和金标准盲人检查后,丢弃了模糊标签。无品牌,无聚焦面孔。
#系统综合智力校准速度成本公开准确率密封准确率美元 / 1,0001Jev-Omni79.8690.7787.7489.7460.5082/89·92.1%92/95·96.8%0.02美元072Mapika decider-2b-vision BF1673.2377.1185.1587.2554.2076/89·85.4%85/95·89.5%0.03美元363Reflex 4B 发布的稳定配置64.1079.6180.7386.0647.9681/89·91.0%84/95·88.4%0.05美元434djev-spark NVFP459.7276.7991.3883.4746.3479/89·88.8%83/95·87.4%0.06美元155djev-dev BF1655.5277.7787.8682.9745.0582/89·92.1%82/95·86.3%0.06美元796Autoloops – Gemma 4 31B ITAPI49.4493.8287.9173.2742.7386/89·96.6%92/95·96.8%0.08美元117Bonsai-2-27B v2PQ2\_0+Q8\_0MMProj19.8996.6493.5272.3829.2988/89·98.9%93/95·97.9%0.22美元758GPT-6 Luna 低推理努力程度 设置:OpenRouter reasoning.effort=low 成本收据覆盖95.1%的调用 API13.6487.0092.7961.9525.6889/89·100.0%85/95·89.5%0.27美元129GPT-5.6 Luna 成本收据覆盖99.5%的调用 API11.4398.7096.5461.7623.7389/89·100.0%94/95·98.9%0.34美元5110Gemini 3.1 Flash LiteAPI10.89100.0092.9361.7923.3189/89·100.0%95/95·100.0%0.36美元0111Gemini 3.8 Flash0.0 · 受成本限制(每 1,000 决策 1.58 美元)API0.0998.7070.4157.604.0189/89·100.0%94/95·98.9%1.58美元3912OpenJev 4B NLI v2 官方图像-前提路径0.0 · 受校准限制(未报告概率)0.0075.930.0079.5339.9883/89·93.3%80/95·84.2%0.10美元02
djev-spark 密封照片结果: 83/95 个密封决策项 · 87.4%。它在早期仅推理的视频运行中看到过公开的推广图像,没有经过训练;此密封分数是针对它的独立测量。
分割
分割为 228 个公开项 / 456 个密封项(33.3% / 66.7%)。公开部分保持不变。密封部分包含 123 个从未暴露的 v0.1 项加上我们私有合成轮换池中的 333 个新项,所有 12 个系统都使用其原始设置在新项上重新运行。93 个遗留项已退役且不计分。分割计数和哈希值在任何系统看到新项之前就已冻结并发布。
公开 / 密封分割
228/456
33.3% 公开 · 66.7% 密封 · 原为 228/216
许可的真实来源项
201 项
139 个公开项 · 62 个密封项 · 93 个退役项
新的密封项
333 项
我们自己的合成渲染图和照片 · 299 项核心项 · 34 项日常照片
合成项占比
70.6%
483/684 个评分项是我们自己的合成内容
公开 意味着一个项目已经在任何地方暴露过。这包括所有 79 个 Mind2Web 衍生项,因为 Kev 的训练数据与 Mind2Web 重叠;视频中展示的 89 张推广照片;本页和状态视频中的 8 个示例卡片;以及自 9 月 21 日预览以来公共网站仓库中的 61 个源行。分割还计算了该仓库中已存在的 1 个图像资产。每个从未暴露过的评分项均为密封项。
密封 包含 123 个从未暴露的 v0.1 项加上从我们私有合成轮换池中抽取的 333 个新项(文档、图表、库存和安全场景,以及日常照片)。抽取按系列和难度分层进行,并使用种子抽样,分割计数和哈希值在任何系统看到新项之前就已冻结。计算机使用和浏览器使用池项被排除,因为这些赛道保持独立。现有的单项目输出在公开和保留密封项时被重用;每个系统都使用与原始运行相同的代码、固定修订版、提示和设置在新项上运行。
退役。 93 项(ScreenSpot 45 项、ScreenSpot-Pro 31 项、Android-in-the-Wild 17 项)在 9 月 24 日从公开移至密封,当时它们的输入和每个系统的预测都位于密封存储之外,因此不能计为未见过的留出项。它们不计分且不重新标注。
系列公开项密封项退役项Android-in-the-Wild (AITW_Single 镜像)01117日常照片89950FinQA2000Geometry3K1900Multimodal-Mind2Web7900池:图表0790池:文档01020池:库存0610池:安全检查0570ScreenSpot202945ScreenSpot-Pro12231总计22845693
计算机使用和浏览器使用赛道(预览)
两个计划中的赛道扩展
相似文章
@rohanpaul_ai: 一个名为JevBench的新基准刚刚发布。针对输出为有界软件决策而非开放式文本…
JevBench是一个新基准,通过结合智能、校准、速度和成本来评估AI模型在有界软件决策上的表现,由@rohanpaul_ai宣布。
Show HN: JevBench,一个用于类型化决策模型的可复现基准测试
JevBench v1.3.0 是一个用于Jev类决策模型的可复现基准测试,基于智能性、校准度、速度和成本对52个系统进行评估和排名。
从文本决策到像素:Jev-Style视觉选择模型研究
PixelJev被介绍为一种原生图像决策接口,使用小型开放多模态模型将图像、指令和候选集映射到结构化选择。该研究表明,在Pets等基准测试中,自适应提高了准确性,并突出了校准和泛化方面的挑战。
akhilaaa3/Jev-Omni
Jev-Omni 是一个基于 Gemma 4 12B IT 构建的多模态决策分类器,经过微调以处理文本、图像、音频和视频,根据问题为选项提供概率分数。
OpenJev
OpenJev是一款基于浏览器的工具,允许用户在本地运行AI模型,并比较不同的推理方法,例如直接读取logits与在JSON格式中生成tokens的对比。