local-inference

标签

Cards List
#local-inference

更新基准测试:DeepSeek V4 Flash 在 SlopCodeBench(本地)上的表现

Reddit r/LocalLLaMA · 7小时前

用户分享了使用本地量化(antirez imatrix 量化)和 pi 工具在 SlopCodeBench 上对 DeepSeek V4 Flash 的最新基准测试结果,显示性能较之前运行有所提升,但仍比托管 API 慢。

0 人收藏 0 人点赞
#local-inference

我不知怎么就在 4070 Ti + 32GB 内存上本地跑起了 GPT-OSS 120B,速度 21 tok/s lol🏗😤🤣

Reddit r/ArtificialInteligence · 20小时前

一位开发者通过在 4070 Ti + 32GB 内存上利用 GPT-OSS 120B 的 MoE 架构,将冷专家从 NVMe 流式加载、热专家缓存在 GPU 上,并采用 top-1 近似,最终达到了 21 tok/s 的本地运行速度。

0 人收藏 0 人点赞
#local-inference

Qwen 35B-A3B MoE 与 27B dense 本地编码测试对比:速度快约 4 倍,质量差距远小于预期

Reddit r/LocalLLaMA · 昨天

一项本地实验,在代码维护任务上比较 Qwen 35B-A3B MoE 和 Qwen 27B dense,发现 MoE 模型速度快约 3.9 倍,且质量差距比预期更小。

0 人收藏 0 人点赞
#local-inference

2 x 5070ti Qwen 27B 完整配置/统计

Reddit r/LocalLLaMA · 2天前

技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。

0 人收藏 0 人点赞
#local-inference

@NousResearch:Actual 是一个本地推理栈,旨在让你充分利用个人计算资源。其低 CPU 占用率在推理时……

X AI KOLs Following · 3天前 缓存

Actual,一个低 CPU 影响的本地推理栈,现已原生支持 NousResearch 的 Hermes Agent,让用户可以从任何地方利用个人推理能力。

0 人收藏 0 人点赞
#local-inference

Ling-3.0-flash MXFP4 发布,并在单个 DGX Spark 上本地运行。

Reddit r/LocalLLaMA · 3天前

Ling-3.0-flash MXFP4 是一款量化模型,已发布并可在单个 DGX Spark 上本地运行,实现约 80 tok/s 的解码速度和 2,500–3,500 tok/s 的长输入预填充速度,从而为编码、智能体和离线批处理任务提供私有的设备端推理。

0 人收藏 0 人点赞
#local-inference

Qwen3-TTS 语音克隆现已进入 llama.cpp 主线——旧演示终于成为真正的支持

Reddit r/LocalLLaMA · 4天前

Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。

0 人收藏 0 人点赞
#local-inference

VibeVoice 1.5B 本地运行……就在 iPhone 上!仅需约 2.2 GB 内存,速度最高可达实时速度的 1.28 倍

Reddit r/LocalLLaMA · 4天前

VibeVoice 1.5B 可在 iPhone 上本地运行,占用约 2.2 GB 内存,速度最高可达实时速度的 1.28 倍;作者计划发布 audio.cpp 的 xcframework 和代码。

0 人收藏 0 人点赞
#local-inference

LFM2.5-2.6B:随处部署智能体(8分钟阅读)

TLDR AI · 4天前 缓存

Liquid AI 发布了 LFM2.5-2.6B,这是一款紧凑的智能体模型,设计为完全在设备端运行,从而实现免费推理、低延迟和隐私保护。文章详细介绍了其训练流程,包括 SFT、教师特化、蒸馏和智能体强化学习。

0 人收藏 0 人点赞
#local-inference

@eternityspring: https://x.com/eternityspring/status/2084666970558074971

X AI KOLs Timeline · 4天前 缓存

详解如何在 RTX 4080 16GB 上通过 ComfyUI 原生工作流本地运行 MiniMax H3 视频生成模型,包含模型下载、目录配置、参数调优及常见坑点。

0 人收藏 0 人点赞
#local-inference

带更新模板的 DeepSeek V4 Flash 0731 GGUF(支持推理级别)

Reddit r/LocalLLaMA · 5天前 缓存

DeepSeek-V4-Flash-0731-GGUF 的 Hugging Face 页面,这是 DeepSeek V4 Flash 的 GGUF 量化版本,带有支持推理级别的更新模板,可直接用于 llama.cpp、vLLM、Ollama 及其他本地推理工具。

0 人收藏 0 人点赞
#local-inference

DeepSeek v4 Flash 0731 4bit 在 M5 Air 32gb 上:prefill 约50tps,decode 约1tps

Reddit r/LocalLLaMA · 5天前

一位用户分享了在32GB M5 MacBook Air上运行4比特量化DeepSeek v4 Flash的实验,通过流式专家等技巧实现了约50 tokens/s的prefill和1 tokens/s的decode。

0 人收藏 0 人点赞
#local-inference

@rohanpaul_ai:atomic[.]chat 刚刚发布了 DeepSeek V4 Flash 0731 的 14 个压缩量化构建版本。从无损 BF16 到 1 位,GGUF……

X AI KOLs Timeline · 5天前 缓存

atomic.chat 发布了 DeepSeek V4 Flash 0731 的 14 个量化 GGUF 构建版本,从无损 BF16 到 1 位。他们推荐在 128GB 硬件上使用 AD-IQ2_M,该版本在 83.6% 的情况下与原始模型的 token 选择一致。

0 人收藏 0 人点赞
#local-inference

@aisearchio: Minimax H3 GGUFs 来了!Q2 仅有 8.49 GB,因此你可以在较低端的 GPU 上运行它。 https://huggingface.co/realrebela…

X AI KOLs Timeline · 5天前 缓存

宣布 MiniMax H3 的 GGUF 量化版本现已可用,其中 Q2 版本仅有 8.49 GB,适合较低端的 GPU。

0 人收藏 0 人点赞
#local-inference

@victormustar: 玩MinMax-H3玩得太开心了。真不敢相信我们现在能100%本地实现这样的视频质量

X AI KOLs Following · 5天前 缓存

一位用户表达了对MinMax-H3的兴奋,强调现在可以100%本地实现这种视频质量。

0 人收藏 0 人点赞
#local-inference

@no_stp_on_snek:延迟了,但终于来了。DeepSeek-V4-Flash-0731 的 GGUF 格式,每权重 2.88 比特,95 GiB,可在单台 128 GB 机器上运行……

X AI KOLs Following · 6天前 缓存

DeepSeek-V4-Flash-0731 以 GGUF 格式发布,每权重 2.88 比特(95 GiB),使 284B 参数的 MoE 模型可在 128 GB 机器上运行。附带详细的操作指南,以及所需的 TurboQuant llama.cpp 分支。

0 人收藏 0 人点赞
#local-inference

Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot

Hugging Face Models Trending · 6天前 缓存

该 Hugging Face 仓库提供了社区编译的 MiniMax H3(Hailuo 3.0)量化与剪枝权重,使得在拥有 16-24GB 显存的消费级 GPU 上能够进行本地文本/图像/音频到视频的生成。包含 INT4、INT8 和 NVFP4 变体,并附有硬件特定指南。

0 人收藏 0 人点赞
#local-inference

Unsloth的Daniel Han验证Qwen3.8-27B仅需17GB显存即可运行

Reddit r/LocalLLaMA · 6天前

Unsloth的Daniel Han验证了Qwen3.8-27B仅需17GB显存即可运行,使其能够用于本地推理。

0 人收藏 0 人点赞
#local-inference

等不及要看 Qwen3.8-27B

Reddit r/LocalLLaMA · 6天前

Qwen 发布了 Qwen3.8,其中包括一个全新的 27B 模型,令人对本地部署充满期待。

0 人收藏 0 人点赞
#local-inference

DeepSeek V4 @ IQ3XXS 在 M1 Ultra 128GB 上的 LM Studio 中经补丁后可达 16 tok/s

Reddit r/LocalLLaMA · 6天前 缓存

一个 GitHub 补丁通过侧载 antirez 的 llama.cpp 分支,解决了结构布局漂移、解码拆分和代码签名问题,从而允许在 128GB Mac 上的 LM Studio 中运行 DeepSeek V4 Flash。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈