local-llm

标签

Cards List
#local-llm

@MikeBradleyAI:关于 @deepseek_ai 0731 V4 Flash 的 TLDR。对于190GB显存或统一内存系统,它妥妥是目前的最优(SOTA)。……

X AI KOLs Following · 6天前 缓存

Mike Bradley 分享了基准测试结果,声称 DeepSeek V4 Flash 0731 是当前190GB显存系统的最佳(SOTA)选择,在质量上匹敌甚至超过 Unsloth 3-bit Qwen3.5-397B,而运行速度大约快3倍。

0 人收藏 0 人点赞
#local-llm

Deepseek v4 flash - prefill/pp中每秒处理速度提升100-150 t/s

Reddit r/LocalLLaMA · 2026-08-02

这篇文章分享了提升DeepSeek v4 Flash预填充/PP速度的修复方法:将CUDA从13.3降级到13.1,或使用自定义fork,最高可实现1.3K的提示处理token/秒。

0 人收藏 0 人点赞
#local-llm

DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行

Reddit r/LocalLLaMA · 2026-08-02

一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。

0 人收藏 0 人点赞
#local-llm

@no_stp_on_snek: https://huggingface.co/thetom-ai/DeepSeek-V4-Flash-ConfigI-MLX… Fyi. Fits on 128GB of ram for metal. GGUF is coming jus…

X AI KOLs Following · 2026-08-01 缓存

TheTom releases an MLX quantized version of DeepSeek V4 Flash (284B MoE, 21B active) at 3.05 bpw, fitting in 101 GiB to run on 128GB Apple Silicon, with GGUF sibling also available.

0 人收藏 0 人点赞
#local-llm

@no_stp_on_snek: 哦,不错。这个会很有趣

X AI KOLs Timeline · 2026-07-31 缓存

对 Unsloth AI 的回复,表达了对传闻中的 DeepSeek-V4-Flash 模型的兴奋,以及通过量化版本在本地运行它的可能性。

0 人收藏 0 人点赞
#local-llm

第二个本地LLM真的是一个安全边界,还是仅仅另一个概率性意见?

Reddit r/LocalLLaMA · 2026-07-30

一篇批判性分析,质疑作为守护的第二个本地LLM是否为代理系统创建了可靠的安全边界,主张采用确定性策略执行而非概率性护栏。

0 人收藏 0 人点赞
#local-llm

4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s

Reddit r/LocalLLaMA · 2026-07-30

一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。

0 人收藏 0 人点赞
#local-llm

你们不害怕我们正走向何方吗?一年前,GPT-5 还被认为是世界上最好的模型之一。今天,我们已经有了像 Qwen3.6-27B 这样的开放权重模型,其性能足以在高端消费级硬件上本地运行。进步的速度绝对残酷。

Reddit r/LocalLLaMA · 2026-07-29

对 AI 进步迅速步伐的评论,指出像 Qwen3.6-27B 这样的开放权重模型现在已足够有竞争力,可以在消费级硬件上本地运行,而一年前 GPT-5 还是最好的之一。

0 人收藏 0 人点赞
#local-llm

我在小型本地模型上测试了成熟的编排技术:90%失败,幸存下来的10%让任务完成率翻了约一倍。

Reddit r/LocalLLaMA · 2026-07-29

一位Reddit用户分享了在小型本地LLM上测试成熟编排技术的结果,发现90%失败了,但幸存下来的10%在LFM 1.2B和Gemma 4 26B-A4B等模型上将任务完成率大约翻了一倍。

0 人收藏 0 人点赞
#local-llm

@Hacksterio:在Raspberry Pi裸机上运行本地LLM——无需Linux。

X AI KOLs Timeline · 2026-07-29 缓存

Hackster.io分享了一种在Raspberry Pi上无需Linux即可运行本地LLM的方法,实现裸机执行。

0 人收藏 0 人点赞
#local-llm

在一个SDLC流水线中混合本地LLM、Claude Code、Codex、Gemini等(开源)[P]

Reddit r/MachineLearning · 2026-07-28

AutoDev Studio 是一款开源工具,允许在软件开发生命周期的不同阶段混合使用不同的AI模型,例如用本地LLM进行规划、用Claude Code进行实现、用不同的模型进行审查,同时以无头模式驱动工具。

0 人收藏 0 人点赞
#local-llm

我的Ollama盒子现在负责选歌:一个运行在9B模型上的智能DJ

Reddit r/LocalLLaMA · 2026-07-27

描述了一个个人项目,其中由Ollama驱动的9B模型作为AI代理,充当DJ来挑选音乐。

0 人收藏 0 人点赞
#local-llm

本地 LLM 的意外应用

Reddit r/LocalLLaMA · 2026-07-27

一位智能手机电池评测员使用两个本地 LLM(Qwen3.6 模型),运行在高端 NVIDIA GPU 上,驱动一个视觉语言智能体,自主控制机械臂进行逼真的电池耗电测试,实现了低于两秒的延迟。

0 人收藏 0 人点赞
#local-llm

构建本地 LLM 设备的人会关注 RTX Ada/工作站显卡的价格吗?还是只关注消费级显卡如 5090?

Reddit r/LocalLLaMA · 2026-07-26

讨论本地 LLM 设备构建者是否会监控像 RTX 6000 Ada 这样的工作站 GPU 的价格,还是主要关注像 RTX 5090 这样的消费级显卡,以及是否存在针对这些不频繁但高风险的购买的专门跟踪工具。

0 人收藏 0 人点赞
#local-llm

在Jetson Orin NX 16GB上本地运行了一个27B模型(1-bit),仍然有点惊讶它能工作

Reddit r/LocalLLaMA · 2026-07-25

用户报告在Jetson Orin NX 16GB边缘设备上成功运行了量化到1-bit的27B参数模型,对可行性表示惊讶。

0 人收藏 0 人点赞
#local-llm

在RTX 5060 Ti上使用Extened Garlic以float8精度运行Qwen3.5 35B A3B,速度达55 tok/s

Reddit r/LocalLLaMA · 2026-07-24

一种名为'Extened Garlic'的技术使得在RTX 5060 Ti上以float8精度运行Qwen3.5 35B A3B模型达到55 tok/s的速度。

0 人收藏 0 人点赞
#local-llm

如何尝试使用Kimi K3?

Reddit r/openclaw · 2026-07-20

用户询问如何尝试Kimi K3本地大语言模型,指出自4.6+版本以来Claude的限制,并询问有哪些可用的服务或API来运行该模型。

0 人收藏 0 人点赞
#local-llm

使用llama.cpp在GStreamer中进行本地LLM文本翻译或转换

Reddit r/LocalLLaMA · 2026-07-20 缓存

一个新的GStreamer元素集成了llama.cpp,使得在多媒体管道中能够基于本地LLM进行文本翻译和转换,从而实现实时字幕生成和改写。

0 人收藏 0 人点赞
#local-llm

关于OpenCode的令人烦恼和担忧之处

Hacker News Top · 2026-07-20 缓存

一篇批评性的博客文章,关于OpenCode这个开源的AI编码助手,详细描述了令人烦恼的设计缺陷和令人担忧的安全漏洞,这些漏洞可能导致被利用或数据丢失的风险。作者强烈建议不要使用它。

0 人收藏 0 人点赞
#local-llm

@Alacritic_Super: 需要一款不需要强大硬件就能运行的高性能本地大语言模型?来看看 Qwythos-9B。• 9B 参数 • 1M 令牌上下文 • 原生工具调用…

X AI KOLs Timeline · 2026-07-20 缓存

Qwythos-9B 是一款拥有 9B 参数、支持 1M 令牌上下文和原生工具调用的本地大语言模型,提供 GGUF 格式,适用于 Ollama、llama.cpp 和 LM Studio。其在关键基准测试中的表现显著超越其基础模型 Qwen3.5-9B。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈