Mica v0.1 4B:开源 Jev 风格决策模型(是/否、选择、评分),支持 8 GB GPU 运行——训练 GPU 时间成本不足 30 美元
摘要
Mica v0.1 4B 是一款开源决策模型,专为 AI 代理循环设计,训练 GPU 时间成本低于 30 美元,旨在本地 8GB GPU 上运行,具有良好的校准性能,在提示注入抵抗等特定任务中表现优异。
我一直在构建一个用于代理循环的小型决策模型:门控、路由器、'是否应询问用户或直接执行'检查。现在它作为 Mica v0.1 4B(Apache-2.0 协议)发布。
功能:提供状态、问题及允许的答案,它返回每个答案的校准概率:是/否、从2到255个选项中选择,或2到10个等级的评分。它不生成文本。它运行一次预填充,并在答案位置读取选项标签的逻辑值。它支持 TypeSafe /v1/systemone 格式,因此任何为 Jev 编写的代码都可以兼容。
构建方式:基于 Qwen3.5-4B,在所有32层(注意力和 Gated DeltaNet)上应用秩为16的 LoRA,并进行合并。没有新增头部,因此它是一个标准的 Qwen3.5-4B 结构检查点。约34k个源决策,扩展为77,732个训练行(约34.7M令牌)。大致英语和韩语各半,涵盖12个领域:编码代理、代码审查、计算机使用、用户请求、文档、政策规则、日期和数量、路由、状态跟踪、游戏和通用知识。对验证答案使用普通交叉熵,一个周期,一个全局温度进行校准。所有实验加最终运行成本低于30美元的租用 GPU 时间(RTX 3090)。
结果:预留集7,328个决策,在训练数据冻结后编写,训练完成前未公开。英语子集,每个模型均可回答:
- Jev 1.13(闭源API):74.1
- Mica 4B:67.0
- JevK5 4B:61.0
- Kev 4B:57.0
- Qwen3.5-4B 基础模型相同读取方式:55.0
公开集,每个模型使用相同提示和读取方式(Mica / Jev 1.13 / JevK5 / Kev 4B):
- JevBench 困难,公开111项:69.5 / 74.3 / 76.2 / 52.4
- SemIf:94.4 / 98.4 / 86.1 / 89.3
- Kev 迁移 v9:69.2 / 82.0 / 70.5 / 73.5
- MMLU-Pro,10k项:53.0 / 82.3 / 53.5 / 49.7
通过 JevBench 的官方运行器和 llama.cpp 服务器,公开困难层级得分为64.9而非69.5。我已提交进行密封运行。
实际有用之处:
- 数据内提示注入。在状态中放置笔记告知评判者选择错误选项,Mica 仍正确69%(无笔记时81%)。Jev 降至18%,Kev 降至31%。
- 校准。当它说0.9或更高时,在预留集上错误率为2.5%(ECE 5.4%)。
- 本地且小巧。Q5_K_M 文件3.5 GB,在校准集上与 BF16 相比无准确度损失。
速度(RTX 3090,单次请求,231个公开 JevBench 项的中位数)
- Mica Q4_K_M:47 ms
- Mica BF16:54 ms
- Kev 4B:76 ms
- JevK5 4B:99 ms
- Nimble 9B:132 ms
公平地说:三个4B模型共享相同架构,因此大部分差距来自服务路径,而非模型本身。Mica 以 GGUF 形式分发,在 llama.cpp 上运行,直接读取逻辑值,而其他模型通过自己的 PyTorch 代码测量。在长输入(约3.7k令牌)上,Mica 比 JevK5 稍慢。
局限性:
- 知识密集型问题:MMLU-Pro 53 对比 Jev 的82。它是一个4B评判者,而非百科全书。
- 长英语政策文档是其最弱的公开集。
- 状态中的笔记仍会影响它。指向正确答案的笔记将准确率提升至89%。
- 它尚不能很好地区分可逆和不可逆操作。'删除这些文件'和'将这些文件移到回收站'在'先确认'上均得约0.8。
- 在较难推理项上,它正确但不如 Jev 确定(例如0.55对比0.96在一个小排序谜题上),因此相应设置置信度阈值。
试用:
权重(BF16 safetensors 和 GGUF 从 Q4_0 到 Q8_0):https://huggingface.co/sky7350/Mica-v0.1-4B
代码、TypeSafe 兼容服务器和 Docker 设置:https://github.com/akivet/Mica-v0.1-4B
README 包含一行 Docker 命令和 curl 示例。很高兴听到它在哪些地方出问题。模糊的'行动或询问'案例是我下一步最想改进的地方。
相似文章
@MiaAI_lab: 运行更高效的 Gemma 4 31B IT NVFP4,轻松获得更强的智能体推理与工具调用能力 • 256k 上下文 • MTP • …
MiaAI Lab 发布了一份指南,用于通过 vLLM 以 NVFP4 量化方式运行 Google 的 Gemma 4 31B IT,支持 256k 上下文、MTP 推测解码、智能体推理、原生工具调用以及图像/视频支持。
@shao__meng:17美元,25分钟:微调你自己的Jev决策模型 来自@togethercompute团队成员@nutlope的实战教程
TogetherCompute团队成员@nutlope的实战教程,介绍如何在25分钟内以17美元将Qwen3.5 4B模型微调为Jev决策分类器,模型权重和代码已在GitHub上开源。
@0xMovez 的推文:https://x.com/0xMovez/status/2101007482919227841
本文提供了一个十步指南,教你如何使用TypeSafe AI的System One模型Jev来构建最快的AI代理大脑,与LLMs相比,它能提供更快且更便宜的决策。
@analogalok:我的8GB显存游戏本肯定会恨我这么做,但我还是做了。跑了一个31B稠密模型(Gemma 4…
用户在8GB显存的游戏本上,使用llama.cpp配合MTP推测解码,以约3 tokens/s的速度运行了Gemma 4 31B稠密模型,展示了在消费级硬件上运行31B稠密模型的可行性,并提出了智能体工作流程:快速MoE模型将困难任务路由给这个较慢的稠密模型。
@mvanhorn 的推文:https://x.com/mvanhorn/status/2100784142850097482
Jev 是一个新的AI模型,专注于快速决策,提供比前沿大语言模型快20-200倍、便宜40-400倍的性能,由 Diogo Almeida 发布。