@TeksEdge: 有人让普通Qwen的行为非常接近Jev,而无需训练新模型。顶级Jev克隆(根据HF…

X AI KOLs Timeline 工具

摘要

一种名为JEVfire的新技术使现有的大型语言模型如Qwen在无需重训的情况下,通过修改决策过程来更像Jev,从而实现显著更快的JSON生成,并使本地AI代理能在消费级硬件上高效运行。

有人让普通Qwen的行为非常接近Jev,而无需训练新模型。 🏆 顶级Jev克隆(根据HF排行榜) 🎯JEVfire采用现有的开源大型语言模型,并改变其决策方式。 而不是提示 → 生成 { → 键 → : → 值 → 逗号 → … 它为Qwen提供一个固定菜单的合法答案,读取模型的分数,选择胜出者,并在代码中构建JSON。 无需重训。无需第二个模型。无需自回归JSON序列化。 在Qwen3.8-27B-FP8 + vLLM上... 4个决策 🐌 JSON生成:878毫秒 ⚡ JEVfire:110毫秒 🚀 快8倍 28个决策: 🐌 JSON:5.11秒 ⚡ JEVfire:497毫秒 快10.3倍 使用缓存前缀... 🚀 346毫秒 👉 快14.8倍 他们将Qwen3.5-0.8B放入带有WebLLM/WebGPU的浏览器中,并让其在本地进行实时游戏决策。 🍄 马里奥风格的演示 🧠 约450MB模型 💾 约2GB空闲GPU/统一内存 ⚡ 在M4 Max上每个模型决策71毫秒 ☁️ 无需推理服务器 🔑 无需API密钥 这不是TypeSafe的Jev,也没有复制Jev的RLCD训练。 但这个想法令人着迷!也许让本地AI代理快速运行不仅仅依赖于更小的模型。 🔗 链接在ALT中
查看原文
查看缓存全文

缓存时间: 2026/09/23 16:14

有人让普通版千问模型在未重新训练的情况下,表现出极强的“Jev”行为特征。

🏆 根据HF排行榜,这成为目前最接近Jev的开源实现方案

🎯JEVfire技术方案的核心在于:通过修改现有开源大模型的决策流程,而非训练新模型。

传统流程是:提示词 → 生成过程(逐步预测 → 键名 → 冒号 → 值 → 逗号 → …)

而该方案为千问模型提供预定义合法答案菜单,读取模型输出的置信分数,选取最优解,并在代码层构建结构化JSON。

无需重训模型、无需辅助模型、无需自回归式JSON序列化。

在千问3.8B-27B-FP8+ vLLM部署环境下: 4次决策对比: 🐌 传统JSON生成:878毫秒 ⚡ JEVfire:110毫秒 🚀 速度提升8倍

28次决策对比: 🐌 传统方式:5.11秒 ⚡ JEVfire:497毫秒 🚀 速度提升10.3倍

启用前缀缓存后: 🚀 346毫秒 → 速度提升14.8倍

该方案在浏览器环境中使用WebLLM/WebGPU运行千问3.5-0.8B模型,实现了本地实时游戏决策: 🍄 类似超级马里奥的游戏演示 🧠 模型体积约450MB 💾 需2GB可用GPU/统一内存 ⚡ 在M4 Max芯片上单次决策耗时71毫秒 ☁️ 无需推理服务器 🔑 无需API密钥

需要说明的是:这与TypeSafe公司开发的Jev不同,也未复现其RLCD训练方法。

但这个思路极具启发性!本地AI智能体的高效化或许不仅依赖更小的模型。

🔗 详情链接见ALT文本

相似文章

我将 Qwen3.8-27B Q2_64 + llama.cpp 转换为一个完全 TypeSafe AI 兼容的 Jev 风格系统。OpenAI API 仍然完整!全球首个支持视觉的 Jev 风格模型!显存占用低于 10 GB,在 RTX 3090 上延迟 170 毫秒,聊天速度约 140 tok/s。在包含 22,000 个请求的多样化类型决策基准测试中,准确率为 76%,而 Jev-1.13 为 88%。

Reddit r/LocalLLaMA

Bonsai-Llama-Jev 是一个开源的、支持视觉的类型决策推理系统,可在本地运行,具有低显存占用和高准确率,在多样化基准测试中超越其他系统。

一个基于Qwen3.5 4B微调的Jev风格模型

Reddit r/LocalLLaMA

作者使用LoRA对Qwen3.5 4B进行了微调,结合公开数据和合成数据创建了一个Jev风格模型,实现了性能提升,并开源了模型和数据集。

体验Jev——一种有趣的AI代理方法

Reddit r/ArtificialInteligence

作者讨论了尝试使用Jev,这是一种专注于决策的AI代理工具,与使用大型语言模型处理所有任务相比,它声称在速度和成本上有显著优势。