gpu-efficiency

标签

Cards List
#gpu-efficiency

Qwen3.6 35b Q2_XXS:在2026年,GPU 贫困也没那么糟糕

Reddit r/LocalLLaMA ↗ · 2026-09-03

展示了在2026年,即使在显卡性能不足的情况下,也能通过量化版Qwen3.6-35B模型在低端笔记本电脑上用24分钟构建类塞尔达RPG游戏。

0 人收藏 0 人点赞
#gpu-efficiency

@PyTorch: TRANSIT(TRANsparent Scale-In for multi-node Training)是一种使统一虚拟内存对大规模训练实用的运行时

X AI KOLs Following ↗ · 2026-08-26 缓存

TRANSIT是一种运行时,使统一虚拟内存对大规模LLM训练实用,无需更改代码即可将GPU使用率降低高达50%,并将在PyTorch Conference North America上展示。

0 人收藏 0 人点赞
#gpu-efficiency

@0xMortyx: 几乎每个人都在谈论NVIDIA的供应问题,但几乎没有人讨论这些GPU在实际部署后的使用效率如何…

X AI KOLs Timeline ↗ · 2026-08-20 缓存

一条推文讨论了部署后GPU效率被忽视的问题,并提到一家初创公司通过虚拟化筹集了1300万美元来解决GPU闲置时间的问题。

0 人收藏 0 人点赞
#gpu-efficiency

ModeSwitch-LLM:一种轻量级阶段感知控制器,用于单GPU上的跨模式大语言模型推理

arXiv cs.LG ↗ · 2026-05-25 缓存

ModeSwitch-LLM 是一种轻量级控制器,将大语言模型推理请求路由到单GPU上合适的固定模式(例如FP16、量化、推测解码),在无需重新训练模型的情况下,实现高达2.10倍的延迟加速和51.7%的能耗降低。

0 人收藏 0 人点赞
#gpu-efficiency

@jun_song: 如果我们能弄清楚如何将 MoE 模型中仅激活的参数加载到 GPU 中,而不是加载全部权重,那将是颠覆性的……

X AI KOLs Following ↗ · 2026-05-10

作者推测,如果仅将 MoE 模型的激活参数加载到 GPU 上,将能极大提高运行效率,并允许在本地运行 Kimi 这样的大型模型,尽管作者承认目前这尚不切实际。

0 人收藏 0 人点赞
#gpu-efficiency

@AI_jacksaku: GitHub本周黑马:Unsloth AI模型训练速度提升2-5倍, 显存占用减少80%。 这意味着什么? 以前微调一个大模型, 需要A100集群+几万美金。 现在一张4090, 几小时就能搞定。 Unsloth做了什么? 优化了注意力机…

X AI KOLs Timeline ↗ · 2026-04-23 缓存

Unsloth开源工具将大模型微调速度提升2-5倍、显存降低80%,使单张RTX 4090几小时完成原本需A100集群的任务。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈