qwen3

标签

Cards List
#qwen3

NInfer 对 Qwen3.8-27B 的 Day-0 支持:约200 tok/s 生成速度,以及大量引擎改进

Reddit r/LocalLLaMA · 2天前

NInfer 新增对 Qwen3.8-27B 模型的 Day-0 支持,在单张 RTX 5090 上使用推测解码可实现约 200 tok/s 的生成速度,并包含并发请求和内核优化等引擎改进。

0 人收藏 0 人点赞
#qwen3

@rohanpaul_ai: 阿里巴巴发布了Qwen3.8-27B的权重,这是一个为本地部署构建的27B开放权重多模态模型。 - Apache …

X AI KOLs Timeline · 2天前 缓存

阿里巴巴发布了Qwen3.8-27B,这是一个用于本地部署的27B开放权重多模态模型,在SWE-bench Pro和OSWorld等编程基准测试中表现出前沿级别的性能,超越了一些更大的模型。

0 人收藏 0 人点赞
#qwen3

qwen3.8-27b 我的天

Reddit r/LocalLLaMA · 2天前

用户对Qwen3 8B和27B模型的出色表现感到兴奋,并分享了结果图片。

0 人收藏 0 人点赞
#qwen3

unsloth/Qwen3.8-27B-NVFP4

Hugging Face Models Trending · 3天前 缓存

Unsloth 发布了 Qwen3.8-27B AI 模型的 NVFP4 量化版本,该模型在编码、专业工作、智能体任务和原生视觉语言理解方面提供了增强的能力。

0 人收藏 0 人点赞
#qwen3

面向多语言数学推理的同策略Delta蒸馏

Hugging Face Daily Papers · 2026-08-06 缓存

本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。

0 人收藏 0 人点赞
#qwen3

@rohanpaul_ai:来自 @markopolo_ai 新发布的 4B 参数模型 Athena 刚刚在预测购物者……方面击败了 GPT-5.6 和 Claude Opus 4.8

X AI KOLs Timeline · 2026-08-03 缓存

Athena 是 markopolo_ai 对 Qwen3-4B 进行 LoRA 微调得到的 4B 参数模型,在 OPeRA 购物行为预测基准上击败了 GPT-5.6 和 Claude Opus 4.8,为预测购物者行为提供了一款可自行托管的专用模型。

0 人收藏 0 人点赞
#qwen3

如今,模型正在训练模型。

Reddit r/singularity · 2026-08-03

Intology 的 Locus 系统遵循 PostTrainBench 设置,对 Qwen3 基础模型进行了后训练,超越了 Qwen3 instruct 检查点。

0 人收藏 0 人点赞
#qwen3

@intology:模型正在改进模型。Locus,我们的自动化AI研究系统,在PostTrainBench上达到SOTA,并能后训练……

X AI KOLs Following · 2026-08-03 缓存

Locus,一个自动化AI研究系统,在PostTrainBench上达到SOTA,并能后训练Qwen3基础模型,使其超越人类后训练的模型。它还在Kaggle竞赛中表现出色。

0 人收藏 0 人点赞
#qwen3

BLADE:面向高效LLM推理的边界扩展与层自适应动态退出

arXiv cs.CL · 2026-08-03 缓存

BLADE是一个轻量级框架,通过将探测检查点扩展到句子边界、自我怀疑边界和段落边界,并自适应地选择信息量大的隐藏层,来动态终止LLM推理。在Qwen3模型上的实验表明,BLADE在保持接近基线的准确率的同时,在Qwen3-8B上减少了24.8%的词元,在Qwen3-4B上减少了15.8%。

0 人收藏 0 人点赞
#qwen3

可检测性边缘的后训练:一种博弈论驱动的微调方法

arXiv cs.LG · 2026-07-30 缓存

本文介绍了一种博弈论的微调语言模型方法,该方法优化了奖励与偏离参考策略之间的权衡,并提供了一种设置KL正则化系数的原则性方法。

0 人收藏 0 人点赞
#qwen3

PEARL:从自然语言出发的求解器在环交互式优化建模

arXiv cs.AI · 2026-07-22 缓存

介绍了PEARL,一个用于交互式优化建模的系统,采用求解器在环方法,从自然语言出发迭代改进问题表述,其性能超越了DeepSeek-V3.2-685B等更大规模的模型。

0 人收藏 0 人点赞
#qwen3

先承诺后推理:开放权重LLM中回答预承诺的行为复现与初步激活级证据

arXiv cs.CL · 2026-07-21 缓存

本文使用一个极简的洗车问题,在开放权重大型语言模型(Qwen3-8B)中复现了回答预承诺现象,并提供了初步激活级证据,表明承诺在答案文本生成之前就已编码在隐藏状态中。

0 人收藏 0 人点赞
#qwen3

为Qwen3 30B模型(Q8量化)搭建本地AI服务器:这个硬件合适吗?

Reddit r/AI_Agents · 2026-07-20

讨论搭建用于Qwen3 30B模型(Q8量化)的本地AI服务器,质疑所选硬件是否合适。

0 人收藏 0 人点赞
#qwen3

@ADarmouni:https://arxiv.org/pdf/2607.13988 微软研究院的一篇优秀的强化学习工作,成功提升了Qwen3小型MoE模型的性能……

X AI KOLs Timeline · 2026-07-19 缓存

本文介绍了TRACE,一种用于长周期智能体强化学习的密集信用分配方法,该方法在不使用额外评论模型的情况下,显著提升了Qwen3小型MoE模型在智能体基准测试上的表现。

0 人收藏 0 人点赞
#qwen3

基于 Qwen3 235B A22B Instruct 2507 构建的内存管道在 LongMemEval-S 上获得第一名(470/500),同时其令牌效率比次优系统高出约 10 倍

Reddit r/LocalLLaMA · 2026-07-14

基于 Qwen3 235B A22B Instruct 2507 构建的内存管道在 LongMemEval-S 上获得最高分(470/500),同时其令牌效率比次优系统高出约 10 倍。

0 人收藏 0 人点赞
#qwen3

评估J-space熵在Qwen3-4B上的7个数据集中作为错误预测器的效果 [R]

Reddit r/MachineLearning · 2026-07-13

本研究评估了灵感来自Anthropic的Jacobian Lens的J-space熵能否在Qwen3-4B上的七个数据集中作为错误预测器。结果显示,它可以补充事实检索中的输出置信度,但它并非通用的幻觉检测器,且具有很强的任务依赖性。

0 人收藏 0 人点赞
#qwen3

CPU设置的首次尝试 - MS-02 Intel 285hx,尝试Qwen3、Qwen3.6和Gemma4

Reddit r/LocalLLaMA · 2026-07-12

在基于Intel 285hx处理器(MS-02)的CPU配置上测试AI模型Qwen3、Qwen3.6和Gemma4。

0 人收藏 0 人点赞
#qwen3

一个本地的、100%私有的语言模型,就在你的手机上!!

Reddit r/ArtificialInteligence · 2026-07-05

一个本地且私有的语言模型(Qwen 3 的 1.5B 和 4B 量化版本)可以在智能手机上离线运行,附带从 32B 模型蒸馏而来的微调与 LoRA。

0 人收藏 0 人点赞
#qwen3

基于领域特定知识图谱的面向旅游的推理大语言模型

arXiv cs.CL · 2026-06-30 缓存

本文提出一个模块化流水线,使用领域特定知识图谱生成多跳问答对,并微调一个面向旅游领域的推理大语言模型 (Qwen3-4B),实现了82.4%的精确匹配准确率,显著优于基线模型。

0 人收藏 0 人点赞
#qwen3

面向农业应用的通用大语言模型微调:基于Qwen3-8B的可复现框架与评估协议

arXiv cs.CL · 2026-06-30 缓存

本文提出AgriTune-R,一个用于农业任务微调Qwen3-8B的可复现框架,整合了数据治理、LoRA/QLoRA微调、RAG、专家评估和安全控制。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈