local-llm

标签

Cards List
#local-llm

在授予本地 AI 代理 Shell 访问权限之前,你应该实施哪种安全边界?

Reddit r/AI_Agents · 1小时前

关于具有 Shell 访问权限的本地 AI 代理安全边界的讨论,涵盖隔离、最小权限、凭据保护、网络出口控制以及人工审批门。作者强调提示词级别的指令并不是真正的安全边界,并向社区询问实际设置。

0 人收藏 0 人点赞
#local-llm

Kimi K3 (Unsloth) IQ2-XXS 从 711GB 降至 478GB!!! 仅移除多语言来缩减体积

Reddit r/LocalLLaMA · 23小时前

Kimi K3 (IQ2-XXS) 的精简版纯英文 GGUF 通过移除多语言组件,将模型大小从 711GB 降至 478GB,早期测试表明它在编码任务上可能达到或超过标准 2-bit 版本。

0 人收藏 0 人点赞
#local-llm

还有人跟我一样对 Qwen 3.8 感到兴奋吗?

Reddit r/LocalLLaMA · 昨天

作者表达了对即将推出的 Qwen 3.8 模型的期待,分享了他们使用 Qwen 3.6 27B 进行本地 LLM 的体验,并讨论了自托管 AI 取代基于订阅的前沿模型的潜力。

0 人收藏 0 人点赞
#local-llm

@mohitwt_: 推理工程第20/30天:构建一个推测解码运行时,用较小的模型提前草拟多个token…

X AI KOLs Following · 2天前 缓存

一位开发者正在构建Octane,这是一个面向消费级硬件上的本地LLM推理的推测解码运行时,目标是实现2-3倍的加速,同时保持完全相同的输出质量。目前处于积极开发阶段,已实现分页KV缓存、连续批处理和批量注意力。

0 人收藏 0 人点赞
#local-llm

LabyrinthBench:一个本地优先、无需裁判的LLM基准测试,用于衡量多步骤智能体任务中干扰下的上下文记忆。

Reddit r/LocalLLaMA · 2天前

LabyrinthBench是一个本地化、无需裁判的LLM基准测试,能够确定性地衡量多步骤智能体任务中干扰下的上下文记忆。初步实验表明,清空上下文并重新注入门控答案对9个模型中的7个有帮助,但对2个适得其反,凸显了上下文管理策略的复杂性。

0 人收藏 0 人点赞
#local-llm

@YRSM_Simon:120 t/s!干得好,@UnslothAI

X AI KOLs Following · 3天前 缓存

Unsloth AI 宣布推出 DSpark,使 DeepSeek-V4-Flash GGUF 模型在本地运行速度提升约 1.4–2 倍,达到 120 tokens/s,且准确率无变化。

0 人收藏 0 人点赞
#local-llm

@CycleDecoded: Olares(来自 beclab 团队),一个专为“全天候 7x24 小时在线 AI Agent”设计的开源个人云操作系统。基于 Kubernetes 底层,把你家里淘汰的旧电脑、N1 盒子或者 NAS 闲置算力,直接改造成属于你自己的“…

X AI KOLs Timeline · 3天前 缓存

Olares 是一个来自 beclab 团队的开源个人云操作系统,基于 Kubernetes,专为全天候 7x24 小时在线的 AI Agent 设计,可将旧电脑或 NAS 改装成自托管 AI 平台,支持本地数据存储和自然语言操作。

0 人收藏 0 人点赞
#local-llm

Deepseek V4 Flash 刚刚登陆 Colibri,有人有性能数据吗?

Reddit r/LocalLLaMA · 4天前

用户询问通过 Colibri 运行 Deepseek V4 Flash 的性能数据,重点关注高 VRAM 配置、长上下文预填充以及面向智能体工作负载的 token 生成速度。

0 人收藏 0 人点赞
#local-llm

图工程?或者我们可以说是打了类固醇的智能体……

Reddit r/artificial · 4天前

介绍 GraphARC,一个 MIT 许可的开源工具,允许模型在运行时编写智能体图拓扑,并配备确定性的准入门以确保可审计的执行,基于 LangGraph 构建,可通过 ollama 在本地运行或对接云 API。

0 人收藏 0 人点赞
#local-llm

构建一个媲美 Llama.cpp 的 Rust 推理引擎

Hacker News Top · 4天前 缓存

Ferrox 是一个纯 Rust 推理引擎,可加载 GGUF 模型,并在 CPU、Metal 或 CUDA 上运行本地 LLM,提供 CLI 和兼容 OpenAI 的服务器。它的目标是在不使用任何绑定、从零编写的情况下,达到与 llama.cpp 相当的性能。

0 人收藏 0 人点赞
#local-llm

DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s

Reddit r/LocalLLaMA · 4天前

一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。

0 人收藏 0 人点赞
#local-llm

DeepSeek v4 Flash 对比 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 基准测试

Reddit r/LocalLLaMA · 5天前

用户在本地编码基准测试中对 DeepSeek v4 Flash 与 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 进行了对比,发现 Flash 总体胜出,但 Qwen 122B 表现惊人,首次尝试成功率更高且 token 消耗更低。

0 人收藏 0 人点赞
#local-llm

@YRSM_Simon: 让 Claude Fable 5 和本地跑的 DeepSeek V4 Flash(DGX Spark,thinking 开满)下国际象棋,下出了年度最离谱对比: Fable:每步思考 ~2,600 token,50 秒落子 V4 Flas…

X AI KOLs Following · 5天前 缓存

作者让 Claude Fable 5 和本地运行的 DeepSeek V4 Flash 下国际象棋,结果 DeepSeek 在长思考下每步消耗数万 token 甚至超时,但局面反而占优,一局耗时 5 小时尚未结束。

0 人收藏 0 人点赞
#local-llm

Deepseek V4 Flash 2-bit 量化是我能在本地运行且在此 SQL 基准测试中达到 100% 的首个模型

Reddit r/LocalLLaMA · 5天前

一位用户报告称,DeepSeek V4 Flash 以 2-bit 量化 GGUF 形式在双 RTX 3080 上运行,是首个在真实世界 SQL 基准测试中取得 100% 得分的本地模型,与 Opus 4.7 和 GPT-5.5 等前沿模型持平。

0 人收藏 0 人点赞
#local-llm

[Deepseek-V4-Flash-0731] 在单张RTX5090 + DDR5桌面配置下,通过VLLM CPU/内存卸载实现完整1M上下文,~800 tps预填充 & 15+ tps解码 [智能体编码]

Reddit r/LocalLLaMA · 5天前

关于在单张 RTX 5090 + 256GB DDR5 台式机上使用 vLLM 配合 CPU/内存卸载运行 DeepSeek-V4-Flash-0731 完整 100 万 token 上下文的技术报告,实现了约 800 tokens/秒的预填充速度和约 15 tokens/秒的解码速度。

0 人收藏 0 人点赞
#local-llm

Homebench – 基准测试本地LLM的速度、内存和质量

Hacker News Top · 5天前 缓存

Homebench 是一款零配置终端工具,可对本地运行的LLM进行速度、内存和质量的基准测试,并提供实时排行榜。它支持 Ollama、LM Studio、llama.cpp、vLLM 以及兼容 OpenAI 的服务器。

0 人收藏 0 人点赞
#local-llm

LM Studio 是否正在放弃其核心产品?

Reddit r/LocalLLaMA · 5天前

LM Studio 用户担心,该公司正在弱化其原有的本地 LLM 应用,将关注点和下载入口转向新的 Bionic 代理,而主应用更新寥寥,且在网站上更难找到。

0 人收藏 0 人点赞
#local-llm

@rohanpaul_ai:Qwen 3.8 Max 构建的3D物理场景比 Fable 5 更好,而运行成本约为其1/7。测试由 @ato… 完成

X AI KOLs Following · 6天前 缓存

atomic.chat 的一项测试显示,Qwen 3.8 Max 在生成自包含的3D物理场景方面胜过 Fable 5,而每次运行成本约为其1/7。

0 人收藏 0 人点赞
#local-llm

@no_stp_on_snek: 非常棒。对3090团队来说意义重大。而且TurboQuant+已经在很多推理引擎中实现了。

X AI KOLs Following · 6天前 缓存

一条回复对Unsloth AI即将推出的Qwen3.8-27B模型表示赞赏,该模型将能在17GB内存/显存配置下运行,并指出TurboQuant+已集成到众多推理引擎中——这对RTX 3090用户来说是个好消息。

0 人收藏 0 人点赞
#local-llm

KAT Coder 2.5 dev:帮自己一个忙,试试吧!

Reddit r/LocalLLaMA · 6天前

一位开发者热情推荐 KAT Coder 2.5 dev,称其比 Qwen 3.6 35b a3b 更快、更准确、使用更少的 token,并且在他们的设置上优于 Gemma 4 模型,同时附有包含详细基准测试的 GitHub 仓库。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈