Mica v0.1 4B:开源 Jev 风格决策模型(是/否、选择、评分),支持 8 GB GPU 运行——训练 GPU 时间成本不足 30 美元

Reddit r/LocalLLaMA 模型

摘要

Mica v0.1 4B 是一款开源决策模型,专为 AI 代理循环设计,训练 GPU 时间成本低于 30 美元,旨在本地 8GB GPU 上运行,具有良好的校准性能,在提示注入抵抗等特定任务中表现优异。

我一直在构建一个用于代理循环的小型决策模型:门控、路由器、'是否应询问用户或直接执行'检查。现在它作为 Mica v0.1 4B(Apache-2.0 协议)发布。 功能:提供状态、问题及允许的答案,它返回每个答案的校准概率:是/否、从2到255个选项中选择,或2到10个等级的评分。它不生成文本。它运行一次预填充,并在答案位置读取选项标签的逻辑值。它支持 TypeSafe /v1/systemone 格式,因此任何为 Jev 编写的代码都可以兼容。 构建方式:基于 Qwen3.5-4B,在所有32层(注意力和 Gated DeltaNet)上应用秩为16的 LoRA,并进行合并。没有新增头部,因此它是一个标准的 Qwen3.5-4B 结构检查点。约34k个源决策,扩展为77,732个训练行(约34.7M令牌)。大致英语和韩语各半,涵盖12个领域:编码代理、代码审查、计算机使用、用户请求、文档、政策规则、日期和数量、路由、状态跟踪、游戏和通用知识。对验证答案使用普通交叉熵,一个周期,一个全局温度进行校准。所有实验加最终运行成本低于30美元的租用 GPU 时间(RTX 3090)。 结果:预留集7,328个决策,在训练数据冻结后编写,训练完成前未公开。英语子集,每个模型均可回答: - Jev 1.13(闭源API):74.1 - Mica 4B:67.0 - JevK5 4B:61.0 - Kev 4B:57.0 - Qwen3.5-4B 基础模型相同读取方式:55.0 公开集,每个模型使用相同提示和读取方式(Mica / Jev 1.13 / JevK5 / Kev 4B): - JevBench 困难,公开111项:69.5 / 74.3 / 76.2 / 52.4 - SemIf:94.4 / 98.4 / 86.1 / 89.3 - Kev 迁移 v9:69.2 / 82.0 / 70.5 / 73.5 - MMLU-Pro,10k项:53.0 / 82.3 / 53.5 / 49.7 通过 JevBench 的官方运行器和 llama.cpp 服务器,公开困难层级得分为64.9而非69.5。我已提交进行密封运行。 实际有用之处: - 数据内提示注入。在状态中放置笔记告知评判者选择错误选项,Mica 仍正确69%(无笔记时81%)。Jev 降至18%,Kev 降至31%。 - 校准。当它说0.9或更高时,在预留集上错误率为2.5%(ECE 5.4%)。 - 本地且小巧。Q5_K_M 文件3.5 GB,在校准集上与 BF16 相比无准确度损失。 速度(RTX 3090,单次请求,231个公开 JevBench 项的中位数) - Mica Q4_K_M:47 ms - Mica BF16:54 ms - Kev 4B:76 ms - JevK5 4B:99 ms - Nimble 9B:132 ms 公平地说:三个4B模型共享相同架构,因此大部分差距来自服务路径,而非模型本身。Mica 以 GGUF 形式分发,在 llama.cpp 上运行,直接读取逻辑值,而其他模型通过自己的 PyTorch 代码测量。在长输入(约3.7k令牌)上,Mica 比 JevK5 稍慢。 局限性: - 知识密集型问题:MMLU-Pro 53 对比 Jev 的82。它是一个4B评判者,而非百科全书。 - 长英语政策文档是其最弱的公开集。 - 状态中的笔记仍会影响它。指向正确答案的笔记将准确率提升至89%。 - 它尚不能很好地区分可逆和不可逆操作。'删除这些文件'和'将这些文件移到回收站'在'先确认'上均得约0.8。 - 在较难推理项上,它正确但不如 Jev 确定(例如0.55对比0.96在一个小排序谜题上),因此相应设置置信度阈值。 试用: 权重(BF16 safetensors 和 GGUF 从 Q4_0 到 Q8_0):https://huggingface.co/sky7350/Mica-v0.1-4B 代码、TypeSafe 兼容服务器和 Docker 设置:https://github.com/akivet/Mica-v0.1-4B README 包含一行 Docker 命令和 curl 示例。很高兴听到它在哪些地方出问题。模糊的'行动或询问'案例是我下一步最想改进的地方。
查看原文

相似文章