AlexWortega/openjev
摘要
openjev 是一个基于 Qwen3.5 的模型,为蕴含任务而训练,使其能够在重排序、评分和实时游戏等应用中使用,v2 版本增加了多模态能力和改进的零样本性能。
查看缓存全文
缓存时间: 2026/09/19 08:46
AlexWortega/openjev · Hugging Face 来源:https://huggingface.co/AlexWortega/openjev
https://huggingface.co/AlexWortega/openjev#openjev–qwen35-trained-as-jev-model
openjev — 将 Qwen3.5 训练为 JEV 模型
openjev 是将 Qwen3.5 改造为 JEV 模型的结果:一个单一的交叉编码器,读取前提与假设,并回答蕴含、矛盾或中性。这一基本能力足以用于重排序答案、根据参考标准评分、内容审核,以及实时游戏:只需输入游戏状态和关于它的若干陈述,最大蕴含概率对应的动作即为最优选择。无需针对特定任务进行训练。
https://huggingface.co/AlexWortega/openjev#openjev-4b-v2-text-images-and-agents
openjev-4B v2:支持文本、图像与智能体
新版 4B 检查点(qwen3.5-4b-nli-v2/)可同时处理文本与图像,并在规模更大、更具挑战性的混合数据上训练。其在以下展示的所有任务上均为严格零样本。
- 直接从像素玩《毁灭战士》(首个视频):平均每局 10.4 次击杀,是 v1 模型(5.2 次)的两倍;随机操作仅为 1 次。
- 在《我的世界》中从零开始实时制作铁镐(第二个视频):约 22 步决策中完成 11 个里程碑,采用反向链接框架驱动,JEV 模型仅检查关于物品栏和世界的陈述。
- 在对抗性 NLI(ANLI r3 0.42 → 0.63,WANLI 0.63 → 0.77)和图像断言(0.52 → 0.84)上显著增强,重排序能力提升(ARC-Challenge 0.59 → 0.72,MMLU 0.47 → 0.53),MNLI 保持不变(0.91)。
- 从文本状态玩《毁灭战士》(v2,平均每局 11 次击杀;完美信息机器人平均为 18.8): radar
更大的 JEV:以 Qwen3.5-35B-A3B(MoE)为主干(qwen3.5-35b-a3b-nli/)。零样本,主干冻结,最后隐层标记上附加小型 MLP 头(mlp_heads_35b/,每个任务一个头,可通过 LatentMLPHead.load 加载):
radar 35B
https://huggingface.co/AlexWortega/openjev#whats-inside
内容概览
qwen3.5-4b-nli-v2/— 推荐使用:4B v2 JEV 检查点,支持文本 + 图像。qwen3.5-4b-nli/— 原版 4B JEV 检查点(仅文本)。qwen3.5-35b-a3b-nli/— 35B-A3B MoE JEV 检查点(通过modeling_qwen35_moe_seqcls.py加载)。- 所有检查点:
Qwen3_5ForSequenceClassification,3 个标签contradiction、entailment、neutral,最后标记池化,使用三分类交叉熵训练。 modeling_openjev.py—OpenJevCrossEncoder:predict、rerank、grade、latents;LatentMLPHead用于任务特定头部。modeling_qwen35_moe_seqcls.py—Qwen3_5MoeForSequenceClassification,用于 35B-A3B 主干。mlp_heads_35b/—head.pt+norm.npz+meta.json,35B 隐层 + 第二个雷达图背后的 MLP 头。code/— 此处使用的所有代码:训练器与数据混合构建器、评估工具链、《飞扬的小鸟》、《毁灭战士》(文本与像素版)、《我的世界》框架与机器人、雷达图生成。videos/— 《飞扬的小鸟》、《毁灭战士》与《我的世界》回放;results/— 每次运行的原始 JSON 与完整报告。
https://huggingface.co/AlexWortega/openjev#use-it
使用方式
from modeling_openjev import OpenJevCrossEncoder
jev = OpenJevCrossEncoder("AlexWortega/openjev", subfolder="qwen3.5-4b-nli-v2")
jev.predict([("The bird is 0.05 below the centre of the gap.", "The bird is below the centre of the gap.")])
# -> [[contradiction, entailment, neutral]] 概率值
jev.rerank("Which gas do plants absorb during photosynthesis?", ["oxygen", "carbon dioxide", "nitrogen"])
# -> 蕴含概率最高的选项索引
或使用原生 transformers:
from transformers import AutoModelForSequenceClassification, AutoTokenizer
tok = AutoTokenizer.from_pretrained("AlexWortega/openjev", subfolder="qwen3.5-4b-nli-v2")
model = AutoModelForSequenceClassification.from_pretrained("AlexWortega/openjev", subfolder="qwen3.5-4b-nli-v2")
text = model.config.nli_template.format(premise="...", hypothesis="...")
图像通过 <|vision_start|><|image_pad|>...<|vision_end|> 格式嵌入前提,需配合 Qwen3.5 图像处理器的 pixel_values/image_grid_thw;详见 code/doom_vision.py 和 code/eval_image_nli.py。
参考:dleemiller 的 NLI 交叉编码器 (链接)。
许可协议:MIT。
相似文章
Openjev
Openjev 是一个开源AI模型,被训练为交叉编码器,可以玩游戏并执行与另一个名为 jev 的模型类似的任務。
@julien_c: 开源,wen?
Julien C 询问阿里巴巴的 Qwen3.7-Plus 是否开源发布,这是一个统一视觉与语言的多模态智能体模型。
OpenJev
OpenJev是一款基于浏览器的工具,允许用户在本地运行AI模型,并比较不同的推理方法,例如直接读取logits与在JSON格式中生成tokens的对比。
一个基于Qwen3.5 4B微调的Jev风格模型
作者使用LoRA对Qwen3.5 4B进行了微调,结合公开数据和合成数据创建了一个Jev风格模型,实现了性能提升,并开源了模型和数据集。
prefeitura-rio/Rio-3.5-Open-397B
Rio 3.5 Open 397B 是一个开源的前沿AI模型,基于 Qwen 3.5 397B 进行后训练,采用 SwiReasoning 实现动态显式/隐式推理切换,在智能体编程、推理和多语言基准测试中取得了最先进的性能。