@Zefan_Cai: 在点击确认前,找出错误的目标。试试 Open-Jev-27B-v1.1 演示:点击两个示例之间,看看模型如何选择操作。

X AI KOLs Following 模型

摘要

Open-Jev-27B-v1.1 是一个开源 AI 模型,配备 LoRA 适配器,在 JevBench 上达到 85.28% 的准确率,并具有各种任务的交互式演示。

在点击确认前,找出错误的目标。试试 Open-Jev-27B-v1.1 演示:点击两个示例之间,看看模型如何选择操作。无需代码。无需设置。真实模型输出的交互式重放。试试它 ↓ https://zefan-cai.github.io/open-jev/v1-1/
查看原文
查看缓存全文

缓存时间: 2026/09/23 18:11

在点击确认之前,请先看清目标。试用 Open-Jev-27B-v1.1 演示:在两个示例之间切换,观察模型如何选择操作。无需编码,无需设置。这是真实模型输出的交互式回放。立即试用 ↓
https://zefan-cai.github.io/open-jev/v1-1/


Open-Jev-27B-v1.1 · 同样预览,不同目标

来源:https://zefan-cai.github.io/open-jev/v1-1/
Open-Jev-27B-v1.1 / 全新模型 + 全新演示

预览指向 record_A,而候选操作现指向 record_B。请检视两个已保存的 27B v1.1 预测如何在提供的选项中进行选择。

采用 Rank-8 LoRA 适配器与 FP32 决策头,基于固定的 Qwen3.8-27B 基础模型。基础模型权重需单独获取。

界面示意图基于合成文本状态记录。未执行浏览器操作。播放内容经过编辑,不反映推理延迟。

公开 JevBench / 231 项任务

在困难任务中取得 111 项中的 80 项,仅比 Jev 少一个答案。

Open-Jev-27B-v1.1 总体得分 197/231(85.28%),困难任务得分 80/111(72.07%)。Jev 总体得分 200/231,困难任务得分 81/111。

这是 534 项基准测试的公开 231 项子集。不同版本的 Open‑Jev 在模型规模、数据和先前训练方面存在差异。共享多 GPU 评估时间不等同于单 GPU 或 HTTP/API 延迟。

公开 JevBench 困难任务对比:Open-Jev-2B 46/111,Open-Jev-9B 66/111,Open-Jev-27B-v1.1 80/111,Jev 81/111。总体得分:27B 197/231,Jev 200/231。(https://zefan-cai.github.io/open-jev/v1-1/benchmark-poster.png)

127,787 行完整内部测试/分布外数据已审核

96.65% 扩展测试集 · 41,357 / 42,789 硬标签

96.44% 扩展分布外集 · 80,934 / 83,924 硬标签

全部 43,301 行测试数据和 84,486 行分布外数据均经过评估;准确率基于硬标签计算。公开数据集为可再分发的 326,619 行投影,不含 2,053 条 Wiki 记录。这并非完整的内部语料库。查看全部四个旧/扩展测试/分布外列(https://zefan-cai.github.io/open-jev/benchmarks/)·审核与协议(https://github.com/Zefan-Cai/Open-Jev/blob/main/reports/new27b-internal-full-20260923/README.md)。

新增 / 四个交互式游戏演示

你来操作,然后由模型接招。

试玩贪吃蛇、井字棋、方块跑酷和平台瓦片游戏。选择一个操作,然后检视 Open-Jev-27B-v1.1 在 16 个独立记录的游戏状态中的真实概率分布,包括三个模型/参考答案存在分歧的场景。

交互式快照基于已保存的决策;无实时模型推理或新游戏进程生成。

进入游戏厅 ↗(https://zefan-cai.github.io/open-jev/games/)

在浏览器中进行文本分类

自定义你的分类类别。

交互式工作台运行 Open-Jev-2B(CPU 版)。粘贴文本或导入 CSV 文件,定义标签,然后下载结果。

打开 Open-Jev-2B 工作台 ↗(https://zefan-cai.github.io/open-jev/workbench/)

检视决策,构建你自己的模型。

Open-Jev-27B-v1.1 是一个 LoRA 适配器与决策头。所选示例不构成通用任务成功率或安全性保证。

27B v1.1 模型 ↗(https://huggingface.co/ZefanCai/Open-Jev-27B-v1.1)代码 ↗(https://github.com/Zefan-Cai/Open-Jev)数据 ↗(https://huggingface.co/datasets/ZefanCai/Open-Jev-v1.1)项目网站 ↗(https://zefan-cai.github.io/open-jev/)

相似文章

我将 Qwen3.8-27B Q2_64 + llama.cpp 转换为一个完全 TypeSafe AI 兼容的 Jev 风格系统。OpenAI API 仍然完整!全球首个支持视觉的 Jev 风格模型!显存占用低于 10 GB,在 RTX 3090 上延迟 170 毫秒,聊天速度约 140 tok/s。在包含 22,000 个请求的多样化类型决策基准测试中,准确率为 76%,而 Jev-1.13 为 88%。

Reddit r/LocalLLaMA

Bonsai-Llama-Jev 是一个开源的、支持视觉的类型决策推理系统,可在本地运行,具有低显存占用和高准确率,在多样化基准测试中超越其他系统。

OpenJev

Hacker News Top

OpenJev是一款基于浏览器的工具,允许用户在本地运行AI模型,并比较不同的推理方法,例如直接读取logits与在JSON格式中生成tokens的对比。