qwen3

标签

Cards List
#qwen3

Clef:Cloudflare 发布的开放权重决策模型

Reddit r/LocalLLaMA ↗ · 20小时前 缓存

Cloudflare 发布了 Clef,这是一个开放权重的 27B 多模态决策模型。它以一个状态和一组带类型的结构化问题作为输入,通过一次前向传播直接输出每个选项的概率,无需自由文本生成,也无需解析输出。该模型在 Qwen3.8-27B 基础上进行后训练,已发布于 Hugging Face,并提供更小的 Clef-Flash 变体,同时兼容 Jev/SystemOne API。

0 人收藏 0 人点赞
#qwen3

BAAI/AREX-2 - 27B - 基于 Qwen3.8 27B 的 Agent 模型

Reddit r/LocalLLaMA ↗ · 2天前 缓存

BAAI 发布了 AREX-2,这是一个基于 Qwen3.8 的 27B 长周期自我改进 Agent 模型。它能够在多轮测试时(test-time)迭代中学习提出方案、测量结果、进行反思并不断修正,在代码、机器学习工程与深度研究等基准测试上仅用 27B 参数就取得了优异表现。

0 人收藏 0 人点赞
#qwen3

Qwen3.8 Flash Next ISTA-DASLab GGUF 在'Strata'引擎上实现50t/s文本生成和1500t/s提示处理,配备12GB显存和64GB内存的笔记本电脑

Reddit r/LocalLLaMA ↗ · 2天前

本文重点介绍了Strata推理引擎,它在配备12GB显存和64GB内存的笔记本电脑上运行Qwen3.8模型时,性能显著超越llama.cpp,文本生成速度最高可达50 tokens/秒,提示处理速度可达1500 tokens/秒。

0 人收藏 0 人点赞
#qwen3

先行动后推理:通过参考条件反向动力学加速多轮代理的在线策略蒸馏

Hugging Face Daily Papers ↗ · 3天前 缓存

本文介绍了ActFirst-OPD,一个通过将动作执行与完整推理解耦来加速多轮语言代理在线策略蒸馏的框架,在保持性能的同时实现了显著的训练加速。

0 人收藏 0 人点赞
#qwen3

我称这个为Monstrosity。5块退役挖矿BC-250板卡运行Qwen3-Coder-Next Q4,速度达40 tok/s

Reddit r/LocalLLaMA ↗ · 4天前

用户使用五块退役挖矿BC-250板卡搭建了一个低成本设置,运行Qwen3-Coder-Next AI模型,在30k上下文中达到约40令牌/秒的速度,并计划扩展。

0 人收藏 0 人点赞
#qwen3

LLM 即通用异步智能体

Hugging Face Daily Papers ↗ · 4天前 缓存

论文提出了一种通用的异步 LLM 框架,允许用户定义具有重叠记忆状态的推理协程,并展示 Qwen3.x 模型无需针对特定任务进行训练,即可异步处理流式视频、电子游戏和监控任务。

0 人收藏 0 人点赞
#qwen3

FreedomIntelligence/HuatuoGPT-3-27B · Hugging Face

Reddit r/LocalLLaMA ↗ · 2026-09-24 缓存

HuatuoGPT-3-27B 是一个基于 Qwen3.8-27B 构建的医疗语言模型,采用单阶段策略优化 (OnePO),这是一种无需监督微调的强化学习领域适应方法。

0 人收藏 0 人点赞
#qwen3

这效果如何? 262k Qwen3.8:27B-Q4_K_M

Reddit r/LocalLLaMA ↗ · 2026-09-19

用户已在异构 GPU 环境中为 Qwen3.8 模型实现了 nvfp4 KV 缓存支持,使用自定义 CUDA 内核和量化来优化性能。

0 人收藏 0 人点赞
#qwen3

在单张 AMD Radeon R9700 上运行 Qwen3.8 27b NVFP4 达 153 tok/s,8 并发请求下 470 tok/s,预填充速度 3,619 tok/s

Reddit r/LocalLLaMA ↗ · 2026-09-17

优化了在单张 AMD Radeon R9700 GPU 上运行 Qwen3.8 27b NVFP4 模型的性能,解码速度高达每秒 153 个令牌,预填充速度达每秒 3,619 个令牌,并提升了并发性能。

0 人收藏 0 人点赞
#qwen3

SFT 还是 RL 用于工具调用代理?一项跨数据、方法和规模的对照研究

arXiv cs.CL ↗ · 2026-09-17 缓存

这项对照研究比较了监督微调和强化学习方法在不同数据集和模型规模下训练工具调用代理的表现,发现SFT结合LoRA在分布内表现最强,而RL在跨数据集迁移中略有优势。

0 人收藏 0 人点赞
#qwen3

决定构建一个游戏,并测试 Qwen3.8 27b 的性能极限

Reddit r/LocalLLaMA ↗ · 2026-09-14

一位用户构建了一个游戏,使用超频的 RTX 3090 来测试 Qwen3.8 27b AI 模型的性能极限,并计划在 GitHub 上开源发布,以供社区贡献。

0 人收藏 0 人点赞
#qwen3

对于本地模型的上下文、压缩和内存管理,你推荐使用哪个pi.dev插件?

Reddit r/LocalLLaMA ↗ · 2026-09-12

用户描述了在使用pi.dev插件管理本地AI模型的上下文、压缩和内存时遇到的困难,并寻求能够处理不同模型上下文窗口和VRAM限制的解决方案建议。

0 人收藏 0 人点赞
#qwen3

双RTX 3090 + EPYC主机运行qwen3.8-flash-next,速度约38令牌/秒

Reddit r/LocalLLaMA ↗ · 2026-09-12

用户描述了一个硬件配置,包括双RTX 3090显卡和AMD EPYC CPU,用于运行Qwen3-Flash-Next模型(使用llama.cpp),单流推理速度达到38令牌/秒。用户寻求建议,是否应该添加第三块GPU或升级CPU以提高性能,特别是对于运行多个并行代理。

0 人收藏 0 人点赞
#qwen3

为Qwen3-TTS添加情感控制标签

Reddit r/LocalLLaMA ↗ · 2026-09-09

本文介绍了微调Qwen3-TTS以添加情感控制标签的方法,解决了训练中的编解码器前缀不一致和生成并发等问题,并发现可以通过说话人嵌入的仿射变换来操控情感。

0 人收藏 0 人点赞
#qwen3

@ashxhart: 一直在给我的 M3 Ultra Studio 精心调校,并摆弄 MLX。下午开始时速度为 42 tok/s。现在:73 tok/s,而且…

X AI KOLs Timeline ↗ · 2026-09-08 缓存

一位作者改进了 M3 Ultra Studio 上的 MLX 性能,使 4 位量化的 Qwen3.8-Flash-Next 模型达到 73 tok/s,其智能评分与 GPT-5.6 Sol 相当,凸显了本地 AI 日益增长的潜力。

0 人收藏 0 人点赞
#qwen3

ukisai/Swift-Qwen3.8-27b

Hugging Face Models Trending ↗ · 2026-09-08 缓存

Swift-Qwen3.8-27B 是 UkisAI 基于 Qwen3.8-27B 开发的推理高效版本,可将思考令牌减少 58.3%,同时保持几乎相同的性能。

0 人收藏 0 人点赞
#qwen3

@HuggingPapers: FlowBalance: 基于验证器的推理模型自改进技术 在GRPO上平均提升数学推理能力 +2.12 …

X AI KOLs Following ↗ · 2026-09-08 缓存

FlowBalance 介绍了一种基于验证器的自改进技术,该技术在 Qwen3-8B 模型上相比 GRPO 平均提升了数学推理性能 2.12 分,提供了更快的训练速度、更强的稳定性和更高的解决方案多样性。

0 人收藏 0 人点赞
#qwen3

环境作为支架:丰富反馈以引导长期任务中的自我进化智能体

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

本文提出了反馈丰富环境(FEEs),通过丰富强化学习的反馈来引导长期任务中的自我进化智能体,并在使用Qwen3模型和RL算法的基准测试中显示了稳定性和性能的提升。

0 人收藏 0 人点赞
#qwen3

Qwen3-4B模型训练后三值化:能力、有效位表示、存储压缩与部署

arXiv cs.AI ↗ · 2026-09-03 缓存

本研究报告评估了Qwen3-4B模型的训练后三值化处理,实现了1.641位的有效权重表示与显著的存储压缩,同时指出了性能折衷及尚未解决的部署加速问题。

0 人收藏 0 人点赞
#qwen3

Qwen3.8 Flash AP Quants

Reddit r/LocalLLaMA ↗ · 2026-09-02

该帖子宣布了Qwen3.8 Flash模型的新量化版本,通过改进的KLD测量和优化的预填充性能,超越了其他高质量量化版本。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈