标签
Cloudflare 发布了 Clef,这是一个开放权重的 27B 多模态决策模型。它以一个状态和一组带类型的结构化问题作为输入,通过一次前向传播直接输出每个选项的概率,无需自由文本生成,也无需解析输出。该模型在 Qwen3.8-27B 基础上进行后训练,已发布于 Hugging Face,并提供更小的 Clef-Flash 变体,同时兼容 Jev/SystemOne API。
BAAI 发布了 AREX-2,这是一个基于 Qwen3.8 的 27B 长周期自我改进 Agent 模型。它能够在多轮测试时(test-time)迭代中学习提出方案、测量结果、进行反思并不断修正,在代码、机器学习工程与深度研究等基准测试上仅用 27B 参数就取得了优异表现。
本文重点介绍了Strata推理引擎,它在配备12GB显存和64GB内存的笔记本电脑上运行Qwen3.8模型时,性能显著超越llama.cpp,文本生成速度最高可达50 tokens/秒,提示处理速度可达1500 tokens/秒。
本文介绍了ActFirst-OPD,一个通过将动作执行与完整推理解耦来加速多轮语言代理在线策略蒸馏的框架,在保持性能的同时实现了显著的训练加速。
用户使用五块退役挖矿BC-250板卡搭建了一个低成本设置,运行Qwen3-Coder-Next AI模型,在30k上下文中达到约40令牌/秒的速度,并计划扩展。
论文提出了一种通用的异步 LLM 框架,允许用户定义具有重叠记忆状态的推理协程,并展示 Qwen3.x 模型无需针对特定任务进行训练,即可异步处理流式视频、电子游戏和监控任务。
HuatuoGPT-3-27B 是一个基于 Qwen3.8-27B 构建的医疗语言模型,采用单阶段策略优化 (OnePO),这是一种无需监督微调的强化学习领域适应方法。
用户已在异构 GPU 环境中为 Qwen3.8 模型实现了 nvfp4 KV 缓存支持,使用自定义 CUDA 内核和量化来优化性能。
优化了在单张 AMD Radeon R9700 GPU 上运行 Qwen3.8 27b NVFP4 模型的性能,解码速度高达每秒 153 个令牌,预填充速度达每秒 3,619 个令牌,并提升了并发性能。
这项对照研究比较了监督微调和强化学习方法在不同数据集和模型规模下训练工具调用代理的表现,发现SFT结合LoRA在分布内表现最强,而RL在跨数据集迁移中略有优势。
一位用户构建了一个游戏,使用超频的 RTX 3090 来测试 Qwen3.8 27b AI 模型的性能极限,并计划在 GitHub 上开源发布,以供社区贡献。
用户描述了在使用pi.dev插件管理本地AI模型的上下文、压缩和内存时遇到的困难,并寻求能够处理不同模型上下文窗口和VRAM限制的解决方案建议。
用户描述了一个硬件配置,包括双RTX 3090显卡和AMD EPYC CPU,用于运行Qwen3-Flash-Next模型(使用llama.cpp),单流推理速度达到38令牌/秒。用户寻求建议,是否应该添加第三块GPU或升级CPU以提高性能,特别是对于运行多个并行代理。
本文介绍了微调Qwen3-TTS以添加情感控制标签的方法,解决了训练中的编解码器前缀不一致和生成并发等问题,并发现可以通过说话人嵌入的仿射变换来操控情感。
一位作者改进了 M3 Ultra Studio 上的 MLX 性能,使 4 位量化的 Qwen3.8-Flash-Next 模型达到 73 tok/s,其智能评分与 GPT-5.6 Sol 相当,凸显了本地 AI 日益增长的潜力。
Swift-Qwen3.8-27B 是 UkisAI 基于 Qwen3.8-27B 开发的推理高效版本,可将思考令牌减少 58.3%,同时保持几乎相同的性能。
FlowBalance 介绍了一种基于验证器的自改进技术,该技术在 Qwen3-8B 模型上相比 GRPO 平均提升了数学推理性能 2.12 分,提供了更快的训练速度、更强的稳定性和更高的解决方案多样性。
本文提出了反馈丰富环境(FEEs),通过丰富强化学习的反馈来引导长期任务中的自我进化智能体,并在使用Qwen3模型和RL算法的基准测试中显示了稳定性和性能的提升。
本研究报告评估了Qwen3-4B模型的训练后三值化处理,实现了1.641位的有效权重表示与显著的存储压缩,同时指出了性能折衷及尚未解决的部署加速问题。
该帖子宣布了Qwen3.8 Flash模型的新量化版本,通过改进的KLD测量和优化的预填充性能,超越了其他高质量量化版本。