27b-model

标签

Cards List
#27b-model

Qwen3.8-27B在24GB RTX PRO 4000 SFF上以256K上下文运行(432 GB/s带宽):通过MTP实现每秒50个token

Hacker News Top · 3小时前 缓存

本文详细描述了一项实验,该实验在24GB GPU上使用多token预测和自定义优化,实现了Qwen3.8-27B在256K上下文下每秒50个token的推理速度。

0 人收藏 0 人点赞
#27b-model

试试这个针对 27B 的“high”推理模式(已在 VLLM 上测试)

Reddit r/LocalLLaMA · 2天前

作者在 VLLM 上对 27B 模型进行了实验,通过混合 low 和 xhigh 模式的提示,创建了一个“high”推理模式,从而获得了更高效、更愉快的推理输出。

0 人收藏 0 人点赞
#27b-model

在Jetson Orin NX 16GB上本地运行了一个27B模型(1-bit),仍然有点惊讶它能工作

Reddit r/LocalLLaMA · 2026-07-25

用户报告在Jetson Orin NX 16GB边缘设备上成功运行了量化到1-bit的27B参数模型,对可行性表示惊讶。

0 人收藏 0 人点赞
#27b-model

@TheAhmadOsman: 天哪!27B模型低于6GB和4GB,本地AI将成为默认。附注:我们将尽快在ODS上由@OsmanticAI优化此功能…

X AI KOLs Timeline · 2026-07-14 缓存

Ternary Bonsai 27B,一个大型语言模型,被演示在NVIDIA RTX 5090 GPU上本地运行,内存需求低于6GB,使消费级硬件上实现端到端的智能代理工作流成为可能。

0 人收藏 0 人点赞
#27b-model

@populartourist: 我可以在我的经济型笔记本上运行27B而不是9B。这简直令人难以置信。

X AI KOLs Timeline · 2026-07-14 缓存

PrismML宣布推出Bonsai 27B,这是一个基于Qwen3.6 27B的多模态模型,可以在手机上运行,支持本地多步推理、工具使用和长上下文工作流。

0 人收藏 0 人点赞
#27b-model

我构建了一个自主开发流水线,并对同一个项目进行了对比测试:在改装版RTX 4090上运行的27B本地模型,与廉价云端大语言模型

Reddit r/LocalLLaMA · 2026-06-30

作者构建了一个自主开发流水线,并通过在改装版RTX 4090上运行27B本地模型与使用廉价云端大语言模型API对同一个项目进行基准测试。

0 人收藏 0 人点赞
#27b-model

@DJLougen: 自豪地介绍一个全新的27B后训练模型 在同时被Fable和Kimi 2.7 Coder所打动之后,我想看看…

X AI KOLs Timeline · 2026-06-20 缓存

介绍了一个新的27B后训练模型,该模型从Fable和Kimi 2.7 Coder中提炼优点,并附有下载链接。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈