@Zefan_Cai: 在点击确认前,找出错误的目标。试试 Open-Jev-27B-v1.1 演示:点击两个示例之间,看看模型如何选择操作。
摘要
Open-Jev-27B-v1.1 是一个开源 AI 模型,配备 LoRA 适配器,在 JevBench 上达到 85.28% 的准确率,并具有各种任务的交互式演示。
查看缓存全文
缓存时间: 2026/09/23 18:11
在点击确认之前,请先看清目标。试用 Open-Jev-27B-v1.1 演示:在两个示例之间切换,观察模型如何选择操作。无需编码,无需设置。这是真实模型输出的交互式回放。立即试用 ↓
https://zefan-cai.github.io/open-jev/v1-1/
Open-Jev-27B-v1.1 · 同样预览,不同目标
来源:https://zefan-cai.github.io/open-jev/v1-1/
Open-Jev-27B-v1.1 / 全新模型 + 全新演示
预览指向 record_A,而候选操作现指向 record_B。请检视两个已保存的 27B v1.1 预测如何在提供的选项中进行选择。
采用 Rank-8 LoRA 适配器与 FP32 决策头,基于固定的 Qwen3.8-27B 基础模型。基础模型权重需单独获取。
界面示意图基于合成文本状态记录。未执行浏览器操作。播放内容经过编辑,不反映推理延迟。
公开 JevBench / 231 项任务
在困难任务中取得 111 项中的 80 项,仅比 Jev 少一个答案。
Open-Jev-27B-v1.1 总体得分 197/231(85.28%),困难任务得分 80/111(72.07%)。Jev 总体得分 200/231,困难任务得分 81/111。
这是 534 项基准测试的公开 231 项子集。不同版本的 Open‑Jev 在模型规模、数据和先前训练方面存在差异。共享多 GPU 评估时间不等同于单 GPU 或 HTTP/API 延迟。
公开 JevBench 困难任务对比:Open-Jev-2B 46/111,Open-Jev-9B 66/111,Open-Jev-27B-v1.1 80/111,Jev 81/111。总体得分:27B 197/231,Jev 200/231。(https://zefan-cai.github.io/open-jev/v1-1/benchmark-poster.png)
127,787 行完整内部测试/分布外数据已审核
96.65% 扩展测试集 · 41,357 / 42,789 硬标签
96.44% 扩展分布外集 · 80,934 / 83,924 硬标签
全部 43,301 行测试数据和 84,486 行分布外数据均经过评估;准确率基于硬标签计算。公开数据集为可再分发的 326,619 行投影,不含 2,053 条 Wiki 记录。这并非完整的内部语料库。查看全部四个旧/扩展测试/分布外列(https://zefan-cai.github.io/open-jev/benchmarks/)·审核与协议(https://github.com/Zefan-Cai/Open-Jev/blob/main/reports/new27b-internal-full-20260923/README.md)。
新增 / 四个交互式游戏演示
你来操作,然后由模型接招。
试玩贪吃蛇、井字棋、方块跑酷和平台瓦片游戏。选择一个操作,然后检视 Open-Jev-27B-v1.1 在 16 个独立记录的游戏状态中的真实概率分布,包括三个模型/参考答案存在分歧的场景。
交互式快照基于已保存的决策;无实时模型推理或新游戏进程生成。
进入游戏厅 ↗(https://zefan-cai.github.io/open-jev/games/)
在浏览器中进行文本分类
自定义你的分类类别。
交互式工作台运行 Open-Jev-2B(CPU 版)。粘贴文本或导入 CSV 文件,定义标签,然后下载结果。
打开 Open-Jev-2B 工作台 ↗(https://zefan-cai.github.io/open-jev/workbench/)
检视决策,构建你自己的模型。
Open-Jev-27B-v1.1 是一个 LoRA 适配器与决策头。所选示例不构成通用任务成功率或安全性保证。
27B v1.1 模型 ↗(https://huggingface.co/ZefanCai/Open-Jev-27B-v1.1)代码 ↗(https://github.com/Zefan-Cai/Open-Jev)数据 ↗(https://huggingface.co/datasets/ZefanCai/Open-Jev-v1.1)项目网站 ↗(https://zefan-cai.github.io/open-jev/)
相似文章
我将 Qwen3.8-27B Q2_64 + llama.cpp 转换为一个完全 TypeSafe AI 兼容的 Jev 风格系统。OpenAI API 仍然完整!全球首个支持视觉的 Jev 风格模型!显存占用低于 10 GB,在 RTX 3090 上延迟 170 毫秒,聊天速度约 140 tok/s。在包含 22,000 个请求的多样化类型决策基准测试中,准确率为 76%,而 Jev-1.13 为 88%。
Bonsai-Llama-Jev 是一个开源的、支持视觉的类型决策推理系统,可在本地运行,具有低显存占用和高准确率,在多样化基准测试中超越其他系统。
OpenJev
OpenJev是一款基于浏览器的工具,允许用户在本地运行AI模型,并比较不同的推理方法,例如直接读取logits与在JSON格式中生成tokens的对比。
@0xMovez 的推文:https://x.com/0xMovez/status/2101007482919227841
本文提供了一个十步指南,教你如何使用TypeSafe AI的System One模型Jev来构建最快的AI代理大脑,与LLMs相比,它能提供更快且更便宜的决策。
@Saccc_c:我强烈推荐大家亲自尝试 Jev——它能将您的 Codex 操作速度提升10倍,并节省大量……
TypeSafe AI 推出 Jev,这是一款针对自动化优化的 System One Model,决策速度比传统 LLMs 快193.6倍,成本低444.6倍,并提供类型化输出和置信度估计。
@noisyb0y1: https://x.com/noisyb0y1/status/2102309802072272956
Jev 是 TypeSafe AI 推出的一款新型 AI 模型,专为快速、低成本的决策而优化,在速度和成本方面相比传统 AI 模型有显著提升。