@TeksEdge: 有人让普通Qwen的行为非常接近Jev,而无需训练新模型。顶级Jev克隆(根据HF…
摘要
一种名为JEVfire的新技术使现有的大型语言模型如Qwen在无需重训的情况下,通过修改决策过程来更像Jev,从而实现显著更快的JSON生成,并使本地AI代理能在消费级硬件上高效运行。
查看缓存全文
缓存时间: 2026/09/23 16:14
有人让普通版千问模型在未重新训练的情况下,表现出极强的“Jev”行为特征。
🏆 根据HF排行榜,这成为目前最接近Jev的开源实现方案
🎯JEVfire技术方案的核心在于:通过修改现有开源大模型的决策流程,而非训练新模型。
传统流程是:提示词 → 生成过程(逐步预测 → 键名 → 冒号 → 值 → 逗号 → …)
而该方案为千问模型提供预定义合法答案菜单,读取模型输出的置信分数,选取最优解,并在代码层构建结构化JSON。
无需重训模型、无需辅助模型、无需自回归式JSON序列化。
在千问3.8B-27B-FP8+ vLLM部署环境下: 4次决策对比: 🐌 传统JSON生成:878毫秒 ⚡ JEVfire:110毫秒 🚀 速度提升8倍
28次决策对比: 🐌 传统方式:5.11秒 ⚡ JEVfire:497毫秒 🚀 速度提升10.3倍
启用前缀缓存后: 🚀 346毫秒 → 速度提升14.8倍
该方案在浏览器环境中使用WebLLM/WebGPU运行千问3.5-0.8B模型,实现了本地实时游戏决策: 🍄 类似超级马里奥的游戏演示 🧠 模型体积约450MB 💾 需2GB可用GPU/统一内存 ⚡ 在M4 Max芯片上单次决策耗时71毫秒 ☁️ 无需推理服务器 🔑 无需API密钥
需要说明的是:这与TypeSafe公司开发的Jev不同,也未复现其RLCD训练方法。
但这个思路极具启发性!本地AI智能体的高效化或许不仅依赖更小的模型。
🔗 详情链接见ALT文本
相似文章
我将 Qwen3.8-27B Q2_64 + llama.cpp 转换为一个完全 TypeSafe AI 兼容的 Jev 风格系统。OpenAI API 仍然完整!全球首个支持视觉的 Jev 风格模型!显存占用低于 10 GB,在 RTX 3090 上延迟 170 毫秒,聊天速度约 140 tok/s。在包含 22,000 个请求的多样化类型决策基准测试中,准确率为 76%,而 Jev-1.13 为 88%。
Bonsai-Llama-Jev 是一个开源的、支持视觉的类型决策推理系统,可在本地运行,具有低显存占用和高准确率,在多样化基准测试中超越其他系统。
一个基于Qwen3.5 4B微调的Jev风格模型
作者使用LoRA对Qwen3.5 4B进行了微调,结合公开数据和合成数据创建了一个Jev风格模型,实现了性能提升,并开源了模型和数据集。
@NathanFlurry:无炒作的JEV解释:JEV并不取代GPT/Claude,JEV只是一个*非常*智能的switch语句,比如如果2…
Diogo Almeida发布了JEV,这是一个新的AI模型,它作为智能switch语句处理分类和路由等任务,声称在速度和效率上显著优于现有模型。
体验Jev——一种有趣的AI代理方法
作者讨论了尝试使用Jev,这是一种专注于决策的AI代理工具,与使用大型语言模型处理所有任务相比,它声称在速度和成本上有显著优势。
Qwen3.5 4B + 抓取 logits 几乎接近 "Jev"?甚至只是 Qwen Reranker?
一位开发者分享了一项实验,使用 Qwen 3.5 4B 模拟 Jev 的概率输出,通过抓取 logits 概率,结果和代码在 GitHub 和演示网站上可用。