标签
对 Qwen 3.5 的 BigBang-v1 微调版本持怀疑态度,指出尽管有 Bartowski 的 GGUF 转换,其基准测试声明可疑且可能存在测试集污染。
一位用户分享了一个观察:Qwen 和 Gemma 对代码的分词方式非常不同,对于相同的 HTML/JS 输入,Qwen 使用的 token 数量远少于 Gemma,这可能解释了它们在编程和语言任务上的表现差异。他们还提到了 LiquidAI 的一个可能使用更高效分词器重新训练模型的项目。
作者使用 Parakeet STT、Qwen 2.5 7B 和 Qwen3-TTS 构建了一个本地实时语音栈,并与 Ollama 集成。
苹果官方文档确认国行 Apple 智能将采用千问(Qwen)模型,率先在 macOS 26.6+ 系统上使用,标志着 Apple AI 在中国市场落地的重要进展。
作者表达了对即将推出的 Qwen 3.8 模型的期待,分享了他们使用 Qwen 3.6 27B 进行本地 LLM 的体验,并讨论了自托管 AI 取代基于订阅的前沿模型的潜力。
一项本地实验,在代码维护任务上比较 Qwen 35B-A3B MoE 和 Qwen 27B dense,发现 MoE 模型速度快约 3.9 倍,且质量差距比预期更小。
阿里巴巴发布了Qwen3.8-Max,这是一个2.4万亿参数的稀疏MoE模型,每个token激活950亿参数,支持100万token的上下文,并具有强大的智能体能力和基准测试结果,包括自主编码数天、电路设计,以及在Terminal Bench和PaperBench上超越竞争对手。
一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。
推荐将 DeepSeek v4 flash 与 qwen3.7-flash 组合使用,以低成本为 DeepSeek 增加多模态图片理解能力,并提供了通过阿里云百炼和 Codex 的简单配置步骤。
这是一场讨论,质疑在 Kimi K3、Qwen 3.8 Max 和 DeepSeek V4 Pro 等新模型陆续推出后,GLM 5.2 和 Kimi 2.7 等旧 AI 模型是否仍对编程具有重要意义。
这篇文章批评了 Artificial Analysis 的智能指数,声称突然的 v4.1.1 更新重新调整了指标权重,使开源模型 Qwen 3.8 Max 的排名降至 Anthropic 的 Claude Opus 之下,暗示存在偏见或赞助商影响。
使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。
Qwen3.8 Max 目前在 Artificial Analysis 的智能体指数中排名第一,在独立评估中超越了其他领先的AI模型。
A developer benchmarks Qwen3.6-35B-A3B Q6 on an RTX 3090, showing that offloading eight MoE expert layers to CPU and increasing batch sizes improves prompt processing by 2.36× (564→1330 tok/s) with no decode speed regression, using evolutionary search to find the tuning config.
宣布下周三开放发布 Qwen3.8-2.4T-A95B(又名 Qwen3.8-Max),并提供 ModelScope 链接。
bootai 是一个开源 UEFI 应用,可直接启动进入 AI 聊天/代码 REPL,在无操作系统的裸机上运行 Qwen2.5 和 SmolLM 模型推理,并配有手写网络驱动和 TCP/IP 协议栈。
HuggingModels 宣布发布 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF,这是 Qwen 模型的微调和量化版本。
QwenCloud 发布了 Qwen-Image-3.0-Pro,一款强大的图像生成模型,支持密集布局、微小文字渲染和原生多语言输出,将其定位为可部署的生产力工具。
Qwen 开发者在 Twitter 上举行了一场 AMA,确认了即将推出的 27B 模型,分享了 Qwen 3.8 的 2.4T 参数和 95B 激活参数的细节,并提到社区对发布的影响。
本文研究了在单块GPU上将Qwen3-0.6B-Base的注意力层转换为KDA线性注意力的失败模式,识别出一种“接口损伤”——模型预测选项标签而非内容,并提出了一个针对格式的KL阶段来修复该问题。