@rohanpaul_ai: 阿里巴巴发布了Qwen3.8-Max,一个2.4万亿参数模型,每个token仅激活约950亿参数。一个……
摘要
阿里巴巴发布了Qwen3.8-Max,这是一个2.4万亿参数的稀疏MoE模型,每个token激活950亿参数,支持100万token的上下文,并具有强大的智能体能力和基准测试结果,包括自主编码数天、电路设计,以及在Terminal Bench和PaperBench上超越竞争对手。
查看缓存全文
缓存时间: 2026/08/08 11:03
阿里巴巴发布了Qwen3.8-Max,这是一个拥有2.4万亿参数的模型,每个token仅激活约950亿参数。一条帖子串
-
从空白文件夹到可上线应用。没有逐步手把手的指导。完整的GitHub轨迹。
-
稀疏混合专家(Sparse MoE)架构,即一个小型路由网络为每个token挑选少量专家,因此你只需为950亿参数的计算量付费,而模型本身存储着2.4万亿参数的知识。
-
上下文窗口为100万个token,单次回复最长可达131,072个token,在最终敲定答案之前,私有思考预算可延伸至262,000个token。
-
定价为每百万输入token 2.00美元、每百万输出token 6.00美元,缓存读取低至每百万0.17美元,因此复用稳定的提示词前缀而非重新发送,成本大约降低8倍。
-
在Terminal Bench 2.1上(该基准测试检验模型能否端到端地通过真实命令行完成任务),它得分86.6,相比之下Opus 4.8为84.6,GPT-5.6 Sol为88.8。
-
它在PaperBench上还取得了93.0的成绩(该测试要求用可运行的代码重建研究论文中的实验),以及GPQA Diamond上的92.6(一组连搜索引擎都无法帮助作答的科学问题)。
官方技术报告中透露了一些重磅发现。
-
仅给出一篇研究论文和一些GPU,它在5天内编写了约7,600行代码,并运行了33轮训练,复现了论文的全部6项发现。
-
它被交给一个空白文件夹和一个待构建的命令行工具,然后被独自留下。经过大约16天的无人值守运行,代码仓库累计了265次提交和127个拉取请求,模型在每次更改后都会自行触发构建、单元测试和端到端检查。
-
在密码芯片设计任务中,它运行了约500轮编辑、仿真和布局,且没有参考设计可供复制。它首个能工作的电路使用了8,298个逻辑门,随后将其压缩至678个,物理芯片面积缩减81%,同时仍满足500 MHz的时序要求。
-
模拟经营线上商店一整年:600家供应商、7,000种产品和隐藏其中的152个欺诈商家。它以10万元启动资金,年末结余416,252元,比表现第二好的模型高出约38%。
相似文章
Qwen 3.8
阿里巴巴发布Qwen3.8,这是一款拥有2.4万亿参数的模型,并计划很快进行开放权重发布。预览版Qwen3.8-Max-Preview现已在阿里巴巴的Token Plan平台、Qoder和QoderWork上可用。
@rohanpaul_ai: 阿里巴巴发布了Qwen3.8-27B的权重,这是一个为本地部署构建的27B开放权重多模态模型。 - Apache …
阿里巴巴发布了Qwen3.8-27B,这是一个用于本地部署的27B开放权重多模态模型,在SWE-bench Pro和OSWorld等编程基准测试中表现出前沿级别的性能,超越了一些更大的模型。
@0x0SojalSec: 最终观点:腾讯最近发布了一个295B参数的模型,每个token仅激活21B参数。而大多数实验室仍在……
腾讯发布了Hy3,一个295B参数的MoE模型,每个token激活21B参数,在代理编程和工具使用任务上与更大的模型相竞争,并提供了Apache 2.0权重。
@cline:Qwen3.8-Max 是阿里巴巴迄今最大的模型,参数达 2.4T,在 Terminal-Bench 上的基准测试成绩比 Fable 5 高出 2%……
阿里巴巴发布了其最大的模型 Qwen3.8-Max,参数规模达 2.4T,在 Terminal-Bench 上的成绩比 Fable 5 高出 2%,开放权重将于下周发布。
@nathanhabib1011: SWE-bench_pro 上参数低于 128B 的最佳模型… @Alibaba_Qwen 3.6 27b 依然疯狂,紧随其后的是 @ornith_ 35B
推文突出了 SWE-bench_pro 基准测试中参数低于 128B 的顶级 AI 模型,指出阿里 Qwen 3.6 27B 和 ornith 35B 是领先的竞争者。