dppo

标签

Cards List
#dppo

Tmax-27b —— 一款面向小显存GPU的Qwen3.6-27b终端Agent,采用DPPO(强化学习)训练

Reddit r/LocalLLaMA · 2026-06-23

Ai2发布了Tmax-27B,一个基于Qwen3.6-27B并使用DPPO(RL)训练的终端Agent大语言模型。作者提供了经重要性矩阵校准的GGUF量化版本,即使在极低的比特宽度下也能在Agent基准测试中取得有竞争力的性能,并且移植了MTP草案头用于推测解码。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈