low-vram

标签

Cards List
#low-vram

@0x0SojalSec: 想象一下,在Kaggle上免费微调一个31B参数的多模态模型。现在你可以训练这个庞大的31B密集型多模态模型……

X AI KOLs Timeline · 2026-06-20 缓存

Unsloth 使得在Kaggle上免费微调31B参数的多模态模型成为可能,采用4位量化,本地运行仅需22-24GB VRAM。

0 人收藏 0 人点赞
#low-vram

Alpie Core 32B, 4位:任何真实智能体工作流测试或仅供应商基准测试?

Reddit r/AI_Agents · 2026-06-11

文章质疑了Alpie Core 32B(一个针对低显存和智能体工作流优化的4位推理编码模型)的供应商基准测试的有效性,指出缺乏独立的基准测试复现。

0 人收藏 0 人点赞
#low-vram

@XAMTO_AI: ControlNet作者敏神又搞出新东西了! 新开源的FramePack直接把视频生成的门槛打了下来——6GB显存就能跑,13B模型生成1分钟30帧视频,在RTX 4090上只要1.5秒出一帧,这配置要求放以前根本不敢想。 核心思路是逐帧…

X AI KOLs Timeline · 2026-06-08 缓存

ControlNet作者敏神开源了FramePack视频生成模型,仅需6GB显存即可运行13B模型,生成1分钟30帧视频,RTX 4090上每帧1.5秒,并提供Windows一键包。

0 人收藏 0 人点赞
#low-vram

@NFTCPS: 4GB显存跑70B大模型?这事儿真成了! AirLLM玩了个骚操作——分层推理,不一次性把模型怼进显存,而是一层层加载、算完就扔,硬生生把巨无霸塞进小破卡。 最骚的是:100%开源,白嫖警告 https://github.com/0xSo…

X AI KOLs Timeline · 2026-06-03 缓存

AirLLM 是一个完全开源的工具,通过分层推理技术(逐层加载并立即释放显存),使得 70B 大语言模型可在仅 4GB 显存的 GPU 上运行,无需量化、蒸馏或剪枝,并已支持 Llama3.1 405B 在 8GB 显存上运行。

0 人收藏 0 人点赞
#low-vram

Qwen3.6-35B-A3B Q4 262k上下文,8GB 3070 Ti上可达+30tps

Reddit r/LocalLLaMA · 2026-05-22

作者分享了在8GB RTX 3070 Ti上使用llama.cpp运行Qwen3.6-35B-A3B MoE模型,实现高达262k上下文、30+tps的详细调优技巧,并指出从Windows切换到Ubuntu Server后速度提升了25%。

0 人收藏 0 人点赞
#low-vram

从零开始开发开源大语言模型:从预训练到RLHF(PPO/GRPO)

Reddit r/LocalLLaMA · 2026-05-14

一位开发者分享了从零开始训练一个70亿参数开源大语言模型的进展,该模型基于DeepSeek架构并针对低显存进行了优化,目标是推动AI开发的民主化,并最终超越大型专有模型。

0 人收藏 0 人点赞
#low-vram

8GB 显存跑 Qwen3.6 35B MoE 的 llama-server 配置 + 我踩的 max_tokens / thinking 陷阱

Reddit r/LocalLLaMA · 2026-04-21

作者分享了一套在 8GB RTX 4060 上跑 35B-MoE Qwen3.6 的可用 llama-server 配置,重点提示因内部推理无限制而耗尽 max_tokens 的陷阱,并给出用 per-request thinking_budget_tokens 的解决方案。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈