阿里巴巴XuanTie C950 RISC-V处理器以30 tps运行Qwen-3.8 27B
摘要
由TSMC制造的阿里巴巴XuanTie C950 RISC-V芯片,现能以30 tps原生运行Qwen-3.8 27B AI模型,体现了垂直整合能力,并支持高效的边缘AI部署。
暂无内容
查看缓存全文
缓存时间: 2026/08/18 20:38
# 阿里巴巴台积电代工5nm RISC-V芯片玄铁C950现可原生运行通义千问-3.8 27B模型,解锁巨大垂直整合动能
来源:https://wccftech.com/alibabas-tsmc-built-5nm-risc-v-chip-xuantie-c950-now-runs-qwen-3-8-27b-model-natively-unlocking-massive-vertical-integration-tailwinds/
阿里巴巴似乎正在效仿英伟达成熟的垂直整合战略,为其强大的通义千问-3.8 27B AI模型(仅需32GB显存即可运行 https://x.com/tphuang/status/2089551401084944622)提供首日支持,该模型现已适配其定制RISC-V芯片——玄铁C950。
## 阿里巴巴现可在自研芯片上运行通义千问系列AI模型,于全球竞争最激烈的AI市场构建深厚护城河
'C950核心#0 RVA23配置'框图显示了包含RISC-V调试/Nexus追踪、AIA、向量处理单元、浮点单元、指令缓存、数据缓存、内存管理单元、物理内存保护、安全数据加速器、L3缓存、一致性控制单元和总线接口在内的组件。 (https://cdn.wccftech.com/wp-content/uploads/2026/08/XuanTie-C950-Architecture-1.jpg)
来源 (https://circuitdigest.com/news/alibaba-unveiled-xuantie-c950-high-performance-risc-v-core-for-edge-ai)
阿里巴巴于2026年3月发布玄铁C950,将其定位为基于RISC-V的边缘AI解决方案。与传统专用集成电路不同,玄铁C950不依赖GPU处理AI负载。实质上,这是一款服务器级64位RISC-V处理器,单芯片集成64个计算核心,时钟频率可扩展至3.20GHz,多个核心簇(每簇8核)通过高速AMBA CHI总线原生互连。为应对高要求AI工作负载,芯片直接集成了矩阵与向量加速引擎(https://circuitdigest.com/news/alibaba-unveiled-xuantie-c950-high-performance-risc-v-core-for-edge-ai),从而消除了对GPU的依赖。
玄铁C950配备标准L1缓存、灵活且高度可配置的L2缓存,并支持可选的共享L3缓存以防止核间通信瓶颈。芯片还采用硬件级智能数据预取算法,在执行引擎发出请求前将内存数据串预加载至缓存层级。其他重要特性包括:
1. 芯片基于开源RISC-V指令集架构,使阿里巴巴得以规避x86架构或ARM设计相关的授权费用,同时实现更深度定制化。
2. 采用8指令解码宽度,使核心能同时读取并处理大量指令。
3. 采用16级流水线设计,通过将每条指令分解为16个处理阶段,在维持高时钟频率与高效执行复杂服务器及AI负载间取得平衡。
4. 与GPU不同,玄铁C950每插槽运行单推理线程,更适合边缘部署与私有推理场景,而非高并发公共API。
5. 定制化流水线与集成加速引擎的结合,使玄铁C950成为首款设计用于原生运行十亿参数级大语言模型的RISC-V处理器,无需仿真或转译层——硬件单元与指令集扩展专为直接执行中小型AI模型核心运算而设计。
6. 至关重要的是,据信玄铁C950由台积电采用5nm制程代工(https://www.trendforce.com/news/2026/03/25/news-alibaba-unveils-risc-v-xuantie-c950-cpu-for-ai-agents-5nm-chip-reportedly-made-by-tsmc/),但阿里巴巴尚未正式确认。
> 阿里巴巴平头哥玄铁RISC-V团队宣布对通义千问-3.8模型提供首日支持,特别是27B版本。其64核C950处理器(支持RVV指令集)可实现30 tokens/秒解码速度,首token延迟仅1.9秒。玄铁系列提供适用于不同边缘场景的广泛RISC-V芯片产品线。阿里现可销售...https://t.co/yF731bykS1pic.twitter.com/qmHfiZBxpa (https://t.co/qmHfiZBxpa) — tphuang \(@tphuang\)2026年8月18日 (https://x.com/tphuang/status/2089695207692312788?ref_src=twsrc%5Etfw)
这引出今日讨论的核心。阿里巴巴现已为玄铁C950芯片带来通义千问-3.8 27B模型的首日支持,提供30 tokens/秒的解码速度,首token延迟仅1.9秒。
需要说明的是,通义千问-3.8 27B(https://wccftech.com/deepseeks-peak-hour-pricing-betrays-where-its-users-really-live-calming-us-fears-of-a-china-ai-takeover-even-as-alibabas-qwen-models-bury-meta-on-hugging-face/)是拥有270亿参数的开放权重AI模型,编程能力媲美Opus 4.5,却能在单台MacBook上运行。
通过为该模型提供玄铁C950的首日支持,阿里巴巴不仅试图将客户锁定在自身生态系统内,更大幅扩展了其算力基础的可选性。毕竟,阿里巴巴可轻松将C950与数据中心内其他AI加速器配对,高效处理推理相关工作负载。
罗海尔·萨利姆 摄影 (https://wccftech.com/author/rohail/)
**关于作者 (https://wccftech.com/author/rohail/):**写作是我无可争议的热情所在。过去六年间,他撰写了2,200余篇涵盖金融与科技领域的独立文章,文字总量近百万。自2025年起,他成为Wccftech移动端(https://wccftech.com/topic/gadgets/)团队成员。作为多伦多大学罗特曼商学院项目校友,我为所探讨的每个话题带来细腻视角、深度知识与独特见解。非写作时,我周游世界,以美食探索者身份寻访隐秘甜品店与餐厅。
在谷歌关注Wccftech(https://profile.google.com/cp/Cg0vZy8xMWM3NDB2MmIyGgA)以获取更多新闻推送。
相似文章
我在不到20美元的CPU芯片上,以不足512MiB的内存运行了Qwen3.5-0.8B
作者在10-20美元的Amlogic A113X CPU芯片上,使用自定义C运行时运行了Qwen3.5-0.8B,实现了1.82 tok/s的解码速度和低于490 MiB的峰值RSS,证明了小型LLM推理可以在没有GPU的已部署边缘硬件上运行。
@DeepTechTR: Qwen 3.6 27B 在16 GB VRAM下速度极快!Pure Quant技术带来的影响——27B模型流畅运行的时代已来临……
Qwen 3.6 27B 在16 GB VRAM上运行快速,得益于'Pure Quant'技术,通过MTP达到40 tokens/s,并支持64k上下文,使得本地AI能在RTX 4060 Ti等消费级GPU上运行。
阿里Qwen3.7-Max在陌生硬件上自主运行35小时,持续自我优化
阿里Qwen3.7-Max模型在陌生T-Head PPU硬件上,无需人工引导,自主优化生产内核长达35小时,进行1158次工具调用,实现10倍速度提升,展示了持续的自主智能体行为。
Qwen 3.8 27b 发布:本地AI的重大新闻
Qwen 3.8 27b,一个参数小于300亿的AI模型,已经发布,适合在消费级硬件如RTX 3090或M4 Pro上进行本地推理,有可能取代基于云的AI订阅,并将工作流程转移到本地。
@ItsmeAjayKV: 成就解锁:得益于RTX 3090,现在我可以运行Qwen3.6-27b密集模型。正在运行 @Alibaba_Qwen Qwen 3…
用户使用llama.cpp在RTX 3090上对Qwen3.6-27B进行基准测试,实现了35 tok/s的生成速度和1247 tok/s的提示处理速度。