local-deployment

标签

Cards List
#local-deployment

训练了我的第一个小型语言模型

Reddit r/LocalLLaMA ↗ · 9小时前

作者训练了一个小型语言模型来替代Gemini Flash进行摘要任务,达到了97%的准确率和0.06秒的延迟,适合在内部应用中部署。

0 人收藏 0 人点赞
#local-deployment

@yoheinakajima: 在本地将对象检测延迟降低到0.35秒以下

X AI KOLs Timeline ↗ · 2天前 缓存

一位开发者分享了在本地硬件上将对象检测延迟降低到0.35秒以下的成就,突显了人工智能性能优化的进展。

0 人收藏 0 人点赞
#local-deployment

@Lonely__MH: Hesitantly asking, Qwen-Image-2.1 local deployment How's the image generation speed?!

X AI KOLs Following ↗ · 5天前 缓存

讨论Qwen-Image-2.1本地部署的图像生成速度,并祝贺其发布,认为其在小参数和高效率上有所突破,有望成为国产AI图像生成的领军者。

0 人收藏 0 人点赞
#local-deployment

Layton_Gott: 昨天我说Jev会打开很多门... 24小时后,这东西就出现了。Cua构建了一个2.8MB的模型,得分99.7…

X AI KOLs Timeline ↗ · 2026-09-18 缓存

Cua开源了CUA-S1-FORMS,这是一个微小的2.8MB AI模型,专为表单填写任务设计,达到99.7%的准确率,并支持本地部署。

0 人收藏 0 人点赞
#local-deployment

Bonsai 2 27B:在占用空间缩小9倍的条件下实现近无损压缩

Hacker News Top ↗ · 2026-09-17 缓存

介绍Ternary Bonsai 2 27B,这是一个高度压缩的AI模型,在占用空间缩小9倍的同时保留了98.2%的性能,使得推理、编码和多模态处理等任务能够高效地在本地部署。

0 人收藏 0 人点赞
#local-deployment

Release b11003 · ggml-org/llama.cpp

Reddit r/LocalLLaMA ↗ · 2026-09-16 缓存

llama.cpp 发布版本 b11003,这是一个 C/C++ 工具,可在各种硬件上以最少的设置实现高效的大语言模型推理。

0 人收藏 0 人点赞
#local-deployment

BudgetBench:用于本地大型语言模型代理内存策略评估的预算分层协议与试点工具

arXiv cs.LG ↗ · 2026-09-15 缓存

本文提出BudgetBench,一个通过调整每次调用的输入令牌预算来评估本地大型语言模型代理内存策略的协议与工具,为社区基准测试提供可重用的测量平台。

0 人收藏 0 人点赞
#local-deployment

@akshay_pachaar: 中国研究人员又做到了!OpenBMB刚刚开源了MiniCPM5-2B,一个用于推理的密集2B参数模型……

X AI KOLs Timeline ↗ · 2026-09-11 缓存

OpenBMB已经开源了MiniCPM5-2B,一个2B参数的AI模型,针对资源受限硬件优化,用于推理、编码和工具使用,在其尺寸类别中达到最先进的性能,并展示了有效的本地部署能力。

0 人收藏 0 人点赞
#local-deployment

@omarsar0: 开源视频模型正迎来高光时刻。仅上一代LTX就达到了1800万次下载,这显示了……

X AI KOLs Timeline ↗ · 2026-09-09 缓存

LTX-2.5是一款支持本地部署、具备微调功能,并改进了生成功能和编辑功能的开源视频模型,强调构建者对AI技术栈的所有权。

0 人收藏 0 人点赞
#local-deployment

SOTA图像生成本地部署 NVIDIA Cosmos3(64B) INT4量化 CUDA/MLX

Reddit r/LocalLLaMA ↗ · 2026-09-09

NVIDIA Cosmos3,一个64B参数的图像生成模型,发布了INT4量化版本,支持在CUDA和MLX上本地部署,代码和权重可用,并在Apple Silicon上展示了性能。

0 人收藏 0 人点赞
#local-deployment

CosineAI:Lumen Sovereign 早期版本——我们完全在英国训练的 AI 模型——正在本地 Apple Mac Studio 上运行…

X AI KOLs Timeline ↗ · 2026-09-03 缓存

CosineAI 宣布了 Lumen Sovereign 的早期版本,这是一个在英国训练的 AI 模型,正在本地 Apple Mac Studio 上运行,并计划扩展到一个 1 万亿参数的模型。

0 人收藏 0 人点赞
#local-deployment

在两块 Tesla P40 上运行双模型文学翻译流水线:gemma-4-26B-A4B 达到约 40 词元/秒,配合 MTP 规范解码的 Qwen3.6-35B-A3B 则达到 50-70 词元/秒——完整 llama-server 参数见下文。

Reddit r/LocalLLaMA ↗ · 2026-09-02

该文章详细介绍了一款名为"Sunny Narrator"的开源工具,该工具利用基于Tesla P40 GPU的双模型AI流水线翻译小说,并通过优化的llama-server配置与MTP投机解码技术,实现了每秒40-70个token的生成速度。

0 人收藏 0 人点赞
#local-deployment

@nicebabycat: https://x.com/nicebabycat/status/2091726637155103126

X AI KOLs Following ↗ · 2026-08-24 缓存

本文详细测试了Ling-3.0-tiny模型在Apple M5芯片Mac上的本地部署与性能,展示了在无独立显卡时以47 token/s的速度运行7.9B参数模型的可行性。

0 人收藏 0 人点赞
#local-deployment

@aehyok: Qwen3.8-27B 分享三个越狱无敌的本地量化系列。 自己亲测,毫无底线,请谨慎使用。 丢给AI叫他帮你找一个适合自己的版本安装就行了。 https://huggingface.co/JonathanColetti/Qwen3.8-2…

X AI KOLs Timeline ↗ · 2026-08-23 缓存

本文分享了三个Qwen3.8-27B模型的无审查量化版本,用于本地部署,作者亲自测试并警告谨慎使用。

0 人收藏 0 人点赞
#local-deployment

@servasyy_ai: https://x.com/servasyy_ai/status/2091416214283379123

X AI KOLs Timeline ↗ · 2026-08-23 缓存

本文详细介绍了Qwen3.8 27B模型的本地部署指南,覆盖Mac和Nvidia显卡的两条路线,并提供实测性能数据,帮助用户在消费级硬件上运行该模型。

0 人收藏 0 人点赞
#local-deployment

@LotusDecoder: 搞定了, 双机 DGX spark GB10 本地部署 DeepSeek-V4-Flash-0731

X AI KOLs Following ↗ · 2026-08-22 缓存

成功在双机 DGX spark GB10 系统上本地部署了 DeepSeek-V4-Flash-0731 模型。

0 人收藏 0 人点赞
#local-deployment

Qwen3.8-27B:更慢的词元,更快更好的结果

Reddit r/LocalLLaMA ↗ · 2026-08-18 缓存

Qwen3.8-27B 是一款新型人工智能模型,强调实际运行时间而非词元生成速度,能在配备32GB显存的消费级硬件上本地部署,并提供卓越的智能表现。

0 人收藏 0 人点赞
#local-deployment

@Lonely__MH: 为所欲为! Qwen3.8-27B 剥离安全限制的无审查版本来了! 为社区速度点赞!专为 Mac M芯片深度优化! 看大家都在讨论 ling-3.0-flash 的 DGX Spark 部署,很多人第一反应都是算力太贵买不起 既然云端成本…

X AI KOLs Timeline ↗ · 2026-08-18 缓存

Qwen3.8-27B 无审查版本发布,专为 Mac M 芯片优化,支持本地部署,保留多模态能力和安全研究功能,提供简化安装步骤。

0 人收藏 0 人点赞
#local-deployment

@MinLiBuilds: 新的斩杀线已出现Qwen3.8-27B。 AA指数 52.0 分,能力上屠杀榜上 108/137 的模型。 如果价格比他们更便宜,就地斩杀线。 本地成本公式就一行: 每 Token 成本 =(整机价 + 三年电费)÷ 三年总产出 Toke…

X AI KOLs Timeline ↗ · 2026-08-18 缓存

Qwen3.8-27B 模型被展示为具有高性价比的本地部署AI模型,通过成本分析显示其在性能和成本上显著优于云端模型如Opus,强调了本地推理的经济效益。

0 人收藏 0 人点赞
#local-deployment

@MinLiBuilds: https://x.com/MinLiBuilds/status/2089338660386992295

X AI KOLs Timeline ↗ · 2026-08-17 缓存

本文对比了NVIDIA DGX Spark和魔改RTX 4090在本地部署Qwen3.8-27B和Ling-3.0-flash模型的性能,提供了基准测试数据和购买建议。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈