Bad Theory Labs 推出的 BTL-3 27B 智能编码与工具使用模型(适配 8.39GB)
摘要
Bad Theory Labs 发布了 BTL-3,一款 27B 参数的开源权重智能编码与工具使用模型,通过自定义量化仅需 8.39GB,性能保留率达 92.2%,在包括 HumanEval 95.12% pass@1 等多个基准测试中表现优异。
https://x.com/Badtheorylabs/status/2079306502897074249 一款 27B 开源权重智能体模型,专为智能编码和结构化工具使用而构建。完整模型仅需一个 8.39GB 文件即可容纳,每参数低于 2.5 比特,比 fp16 格式的 8B 模型还小,同时保留了 27B 模型 92.2% 的智能。BTL-3 针对真实智能体所处的循环进行训练:推理、行动、检查结果、恢复、继续。它支持单个、顺序和并行工具调用,并且知道何时正确的操作是不进行任何工具调用。HumanEval: 95.12% pass@1,BFCL v4 AST: 88.5%(完整 1,240 个案例集),多工具调用: 95.5%,工具调用弃权: 91.2%。262K 上下文架构。今日发布两个版本。BTL-3 是最高质量检查点,适用于 Transformers 和 vLLM。BTL-3 Compact 是完整模型,作为一个独立的 8.39GB GGUF 文件。无需基础下载,无需重建。一个文件,一条命令,一个运行中的智能体。将 27B 模型压缩至此程度通常会破坏模型。标准量化无法做到,因此我们自行构建了堆栈:打包 AVQ2 解码张量、仿射 INT4、测量精度孤岛、打包词汇矩阵、秩 32 输出校正、行为修复。导出时对 2,416 个张量进行了字节验证。然后我们测试了智能体是否幸存。在一个全新的封闭 100 轮工具合约门控上,Compact 保留了 92.2% 的教师校正行为——在单次、并行、顺序和弃权调用上均为 100%。在 RTX PRO 6000 上生成速度达 43 tok/s。完全本地运行。没有任何数据离开你的机器。BTL-3: https://huggingface.co/badtheorylabs/ BTL-3 Compact: https://huggingface.co/badtheorylabs/ BTL-3-Compact 运行时和源代码: https://github.com/Badtheorylabs/ BTL-3 采用 Apache-2.0 模型协议。MIT 运行时协议。
相似文章
@LottoLabs: 这里有一个有趣的模型,35b a3b 专为智能体使用而训练。它在 Terminal Bench2 上获得 60.7 分,而 qwen 3.6 27b 得分为 59.3。关键……
Nex-AGI 发布了 Nex-N2,一个开源的智能体模型系列 (Nex-N2-Pro 和 Nex-N2-mini),采用 Agentic Thinking 框架,统一了推理、工具使用和环境执行,在智能体和编码基准测试中达到顶级性能。
@rasbt: 疯狂模型!它实际上使用了旧的Qwen2.5-Coder-3B栈,并通过后训练取得了非常出色的性能……
一个使用Qwen2.5-Coder-3B栈的3B参数模型,在编程基准测试中取得了与Claude Opus 4.5相媲美的分数,采用了详细的后训练技术,包括合成数据、过滤、两阶段SFT,以及一种新颖的RL方法(MGPO)。
@xdotli: 我的朋友 @xeophon 认为编码问题已经解决了,这里有一个验证:一个3B模型接受了以算法效率为重点的训练……
Nanbeige 4.1,一个3B模型,在编码任务中专注于算法效率,超越了Qwen3-30b-A3b和Qwen 3.5 4b,实现了600多次工具调用的长时任务。
@0x0SojalSec: 最终观点:腾讯最近发布了一个295B参数的模型,每个token仅激活21B参数。而大多数实验室仍在……
腾讯发布了Hy3,一个295B参数的MoE模型,每个token激活21B参数,在代理编程和工具使用任务上与更大的模型相竞争,并提供了Apache 2.0权重。
Kwaipilot/KAT-Coder-V2.5-Dev
KAT-Coder-V2.5-Dev 是一个开放权重的 MoE 编码模型,总参数为 35B(3B 激活),通过 SFT 和 RL 训练在代理编码基准测试上取得了最先进的结果。