Qwen 开发者在近期 Twitter/X AMA 中的回应

Reddit r/LocalLLaMA 事件

摘要

Qwen 开发者在 Twitter 上举行了一场 AMA,确认了即将推出的 27B 模型,分享了 Qwen 3.8 的 2.4T 参数和 95B 激活参数的细节,并提到社区对发布的影响。

以下是问题与回复(回复以粗体显示)。最喜欢的问答已移至帖子末尾,并合并了回复(去除了重复内容)。大家乐观一点。我相信除了 27B,我们还会得到其他模型。而且 27B 发布时一定会引起巨大轰动。(根据他们的回复)推文串:https://xcancel.com/QwenDevs/status/2084102417885585597#m 你们上次跳过了 27b 和 122b,这次我们能期待这些吗?另外,我好像在卡片里找不到 Crit Pit 分数。当然!我们确实很快就会发布一个 27B 模型。敬请期待。至于 Crit Pit 分数,请等待官方的人工智能评分。这个 27B 只是重新训练的 3.6 27B 吗?还是基于 3.8 的大哥版本?我们保证这款 27B 将带来全新的能力水平!100 小时的视频理解能力,是一个并行解析视频片段并编排某种语义表示图的智能体集群吗?从广义上讲,是的,但不完全是。它更接近一个分层视频记忆系统,而不是传统的智能体集群。视频片段被编码成一个结构化的文本图,包含场景、实体、事件及其时间关系,从而能够对超过 100 小时的内容进行检索和推理。嘿!与其他实验室的模型相比,预训练数据分布有什么特别之处吗?我们希望我们的数据建立在更坚实的基础之上!你认为要多久才能超越 Anthropic 级别的架构?嗯,我们正在努力,我们保证😇 你们会专门为 Qwen Code 发布一个 harness 吗?有计划推出类似 Codex 的应用吗?关于 Qoder 和 QwenWork 的更多更新即将到来。Qwen 3.8 的激活参数?2.4T 参数(95B 激活)与之前的模型相比,后训练中做了多少强化学习?计算量真的达到了不合理的地步。他们是有意跳过了之前的 Qwen3.7 27B 和 35B A3B 吗?Qwen3.8 27B 的复活是反映了社区的声音,还是早有计划?当然!这是认真听取社区声音的结果。既然这是一个相当重要的发布,我们会有包含完整细节的技术报告吗?这个暂时还没有技术报告。不过我们会努力保持接近每月一次的发布节奏,而且更强大的模型已经在开发中。敬请期待!为什么模型要思考这么多,Qwen 先生,我的 AI 大脑很好奇。不过,这么棒的模型的 token 效率在哪里呢?我们支持不同级别的推理努力。你们展示了用 Qwen-Scope 进行 SAE 引导的微调来修复代码切换。这种可解释性驱动的干预现在是后训练流程的一部分,还是仍然只是一种研究技术?目前它仍然主要是一种面向研究的技术,不过其中的一些见解可能会为未来的训练和后训练改进提供参考。注意力机制?混合架构?模型架构与 3.5 类似,但规模要大得多!我们什么时候能获得 CLI 编码界面?你可能想看看 @qoder_ai_ide。你们自己把 Qwen 作为主要的内部工具吗?这个模型是否表现出与某些 OpenAI 模型(比如“GPT 5.5 帮助创建了 5.6”)相同的智能迹象?当然!Qwen3.8-27B 与 GPT 5.4 有多接近?🤔 嗯,你很快就能亲眼看到了。什么 harness 与 Qwen 配合最好?Qwen 致力于在所有 harness 上提供最佳体验。是什么让你们想要开源最大权重?我们听到了社区的诉求。我想知道什么时候我能超越 Fable5。继续努力。干得好,伙计们🥂 你们希望看到人们用新模型及其能力构建什么东西?我真的很想探索用智能体集群技术来构建应用,对于新模型有什么最佳实践或技巧吗?1. 我们希望它能给不同行业的人们带来实际的生产力价值。2. 我们建议将它用于涉及更多并行化工作流或并行执行需求的任务。我想知道你们在前端评估中使用了什么评分标准。我们既使用功能性和美观性的绝对指标,也使用基于胜/平/负比较的相对指标。很高兴听到你认为 Qwen 在代理工作负载方面最强的地方:长上下文规划、工具使用可靠性、编码,还是大规模成本?以上所有方面的结合——最终为用户提供最实用、最可靠的输出。Qwen 在多大程度上帮助了 Qwen 的研究?它已经成为模型迭代过程中的重要组成部分,几乎在每个阶段都有模型参与。大多数前沿实验室都创建了专门的代码模型(例如 Qwen3-Coder 和 GPT-5.3-Codex),但从未对它们进行后续跟进。专用模型有什么问题吗?还是通用模型最终已经足够高效,以至于不需要再单独创建一个模型?我们希望构建一个一体化模型。Qwen 3.8 会有稳定、有文档记录的工具调用和结构化输出契约吗?这样本地代理 harness 就可以在无需针对特定提示调整的情况下更换模型。我们为各种协议提供了原生支持接口。你可以查看 Qwen 博客了解更多详情。1: 在将 Qwen 27B 量化用于本地部署时(例如 4 位 GGUF、NVFP4 或 MXFP4),哪些 Transformer 层或视觉注意力块对性能下降最敏感?你有什么推荐的策略来同时保持视觉推理和高 SWE-bench 通过率吗?2: Qwen3.6-27B 在 SWE-bench 和 Terminal-Bench 等代理编码基准测试上超越了更大的 MoE 前辈(如 Qwen3.5-397B)。除了原始数据量之外,实现这种密集效率的单一最高杠杆因素是什么?感谢你们的出色工作。Qwen3.6-27B 几个月来一直是我主要的编码助手。1. 使用 QAT,或者只将 FFN 量化为 4 位,同时将注意力层的 QKV 线性投影和输出投影保持在 16 位。2. 更高质量的数据工程 伙计们,我们什么时候能拿到一个像 DeepSeek 那样小巧便宜但性能最佳的模型?DeepSeek V4 Flash 似乎非常划算。我认为我们需要放慢扩展速度,开始提升现有模型的效率。扩展和成本效益并不互斥——我们将继续同时追求两者。Qwen3.8-27B 是密集模型吗?大约比 3.6-27B 聪明多少?一个相当大的飞跃!好。有用的问题不仅仅是 Qwen 有多强大。我想知道它仍然在哪些地方失败,团队如何评估这些失败,以及“开放”在实践中对权重、工具和可复现性意味着什么。开放模型最重要的意义在于,人们可以检查其局限性,并在无需征得许可的情况下基于这些工作进行构建。我们的自动化和人工评估系统与真实用户体验之间仍然存在差距。这也是为什么我们致力于先发布预览版——这样我们可以迭代,并最终为用户提供最佳体验。新的 27B 模型与之前的相比如何?一个相当大的飞跃!你如何看待循环 Transformer?有趣的研究想法。为什么是 Qwen?是什么让你创造了 Qwen,尤其是如此轻量快速的模型?当其他人都在追求蛮力算力时,为什么专注于效率?另外,你认为推理引擎在优化方面已经达到极限,还是仍有改进空间?扩展和成本效益并不互斥——我们将继续同时追求两者。我们注意到,在思考模式下,模型通常会耗尽整个推理预算而不停止,这增加了延迟。这是已知问题吗?Qwen3.8 有计划改进吗?你可以试试 3.8!而且 3.8 支持不同的思考强度!................................................................................................................... 70B 模型永远消失了吗?有没有可能推出一个 40-50B 的模型(大约能装进 30-32GB 显存/内存的),在提高性能的同时仍能在许多电脑上使用?感谢你们的...
查看原文

相似文章

等不及要看 Qwen3.8-27B

Reddit r/LocalLLaMA

Qwen 发布了 Qwen3.8,其中包括一个全新的 27B 模型,令人对本地部署充满期待。