local-deployment

标签

Cards List
#local-deployment

@Vincent_AINotes: 本地部署大模型,就算你显卡性能拉满,稳定每秒跑100Token,24小时不间断满载运行,一天满打满算也就跑出8.64M Token。 拿这点吞吐量去搞什么Agent自动化集群、海量合成数据或者大批量业务分析,简直是杯水车薪。本地部署图个数…

X AI KOLs Following ↗ · 2026-08-17 缓存

本地部署大模型受限于硬件吞吐量,即使显卡性能满载,一天仅能处理约8.64M Token,不足以支持Agent自动化集群或大规模数据分析,因此规模化应用仍需依赖云端API。

0 人收藏 0 人点赞
#local-deployment

基于加速发展的前沿趋势 → 本地化路径:预计最早2027年1月可运行约300亿参数的'Mythos'本地模型(推理依据如下)

Reddit r/LocalLLaMA ↗ · 2026-08-16

文章分析了前沿AI模型与能在消费级硬件上运行的等效模型之间时间差不断缩小的趋势,基于近期发展预测,约300亿参数的'Mythos'模型最早可能在2027年1月实现本地部署。

0 人收藏 0 人点赞
#local-deployment

小型语言模型的训练与无限API推理

Reddit r/artificial ↗ · 2026-08-15

一个团队开发了一个平台,允许用户微调和部署小型语言模型,并提供无限API推理,利用他们自己的GPU进行高效训练和推理。

0 人收藏 0 人点赞
#local-deployment

@rohanpaul_ai: 阿里巴巴发布了Qwen3.8-27B的权重,这是一个为本地部署构建的27B开放权重多模态模型。 - Apache …

X AI KOLs Timeline ↗ · 2026-08-14 缓存

阿里巴巴发布了Qwen3.8-27B,这是一个用于本地部署的27B开放权重多模态模型,在SWE-bench Pro和OSWorld等编程基准测试中表现出前沿级别的性能,超越了一些更大的模型。

0 人收藏 0 人点赞
#local-deployment

@itsPaulAi: 真不敢相信 Qwen3.8-27B 性能匹敌 Opus 4.6 Max... 这个模型在短短 6 个月前还是最好(也是最昂贵的)……

X AI KOLs Following ↗ · 2026-08-14 缓存

Qwen3.8-27B 是一个拥有 270 亿参数、开放权重的 AI 模型,性能匹敌 Opus 4.6 Max,并且可以在笔记本电脑上本地运行。

0 人收藏 0 人点赞
#local-deployment

@FinanceYF5: NVIDIA发布Nemotron 3.5 Lightning 30B 总参数,激活只有 3B,支持 100 万 token 上下文,可商用。 本地部署友好:BF16 和更小的 NVFP4 版本,单卡 H100 或 DGX Spark 就能…

X AI KOLs Following ↗ · 2026-08-12 缓存

NVIDIA 发布 Nemotron 3.5 Lightning 30B 模型,总参数30B,激活仅3B,支持100万token上下文,可商用,本地部署友好,输出速度最高提升4倍。

0 人收藏 0 人点赞
#local-deployment

@YRSM_Simon: 发现了 deepseek v4 flash vllm 本地部署的一个bug。 同一个 Session 秒回,切到另一个 Session 再切回来,直接重新 Prefill,kv cache 失效。 蹲了一整晚,100% 复现: A 第一次…

X AI KOLs Following ↗ · 2026-08-10 缓存

发现 DeepSeek V4 flash 在 vLLM 本地部署中的 KV 缓存失效 Bug:切换 Session 后前缀缓存命中率为 0,导致重新 Prefill,耗时从约 1 秒暴涨到约 100 秒。根因疑为 vLLM 重用 free queue 块时调用 _maybe_evict_cached_block() 删除了缓存索引。

0 人收藏 0 人点赞
#local-deployment

meta-models/Muse-Glimmer-30B

Hugging Face Models Trending ↗ · 2026-08-09 缓存

Meta超级智能实验室发布了Muse-Glimmer-30B,这是一个具有感知编码器的30B参数因果语言模型,针对消费级硬件上的自主智能体任务进行了优化,支持可靠的工具使用、多步推理和多模态输入。

0 人收藏 0 人点赞
#local-deployment

通过小型语言模型实现AI民主化:面向本地部署的结构化基准测试与参数高效微调

arXiv cs.AI ↗ · 2026-07-21 缓存

本文在结构化基准上评估了九个开放权重的小型语言模型(参数量135M至3B),并证明参数高效微调显著提升了准确率,使其在结构化小众工作负载的本地部署中具备可行性。

0 人收藏 0 人点赞
#local-deployment

@WolfTrainer_101: 一款适合安全研究员本地部署的 9B 超强推理模型 Qwythos-9B-Claude-Mythos-5-1M 基于 Qwen3.5-9B 底座,用 5 亿 + Claude Mythos 高质量推理轨迹二次训练,核心亮点: 1、原生 1M…

X AI KOLs Timeline ↗ · 2026-07-16 缓存

Qwythos-9B 是一款基于 Qwen3.5-9B 底座、用 5 亿+ Claude Mythos 推理轨迹二次训练的 9B 超强推理模型,原生支持 1M 长上下文和工具调用,专为安全研究员本地部署设计,在 MMLU 和数学推理上大幅领先原版底座。

0 人收藏 0 人点赞
#local-deployment

@aigclink: 最近在参与国内某头部医院检验科训练一个垂直细分医疗模型,分享一些个人观点,给AI+医疗领域的从业者一些建议(觉得有用拿走、觉得没用底下留言喷): 1、医疗领域最核心的是数据,国内的公立及三甲医院基本上数据不出医院的,所以细分领域AI落地有…

X AI KOLs Timeline ↗ · 2026-07-14 缓存

作者分享参与国内头部医院训练垂直医疗模型的个人观点,指出医疗数据不出医院、本地化部署成本高、付费意愿弱等核心挑战,并建议与硬件厂商绑定。同时认为通用医疗模型(如百川)已表现良好。

0 人收藏 0 人点赞
#local-deployment

@jianxliao: 这就是为什么开源模型如此重要,以及用于采纳这些开源模型进行特定领域任务、本地运行和持续改进的技术栈…

X AI KOLs Following ↗ · 2026-07-01 缓存

强调开源AI模型对于特定领域任务、本地部署和持续改进的重要性,主张拥有智能而不是租赁智能。

0 人收藏 0 人点赞
#local-deployment

@xiaohu: Anthropic 发布 Claude Science 面向科学家的 AI 工作台,内置 60 多个科研技能 它是一个装在你自己电脑或服务器上的应用:你用大白话向一个 AI 提出科学问题,它调动数十个专业工具去查数据、跑分析、画图表、写手…

X AI KOLs Timeline ↗ · 2026-07-01 缓存

Anthropic 发布了 Claude Science,一个面向科学家的 AI 工作台,内置 60 多个科研技能,支持本地部署和 HPC 集群,可自主起草计算任务并审查结果。

0 人收藏 0 人点赞
#local-deployment

Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF

Hugging Face Models Trending ↗ · 2026-06-29 缓存

在 Hugging Face 上发布,Qwopus-3.6-35B-A3B-Coder 是一个经过微调的混合专家(MoE)编码代理模型,专为高效、低延迟的本地执行而设计,可在代理工作流中减少 token 浪费。

0 人收藏 0 人点赞
#local-deployment

@Pluvio9yte: https://x.com/Pluvio9yte/status/2070318502016426008

X AI KOLs Timeline ↗ · 2026-06-26 缓存

本文深入探讨了AI Agent的记忆架构,以Hermes四层记忆模型为例,分析了Claude Code记忆系统的局限性,并介绍了如何通过开源框架(如EverOS)为Agent增添本地记忆能力,提供了详细部署步骤。

0 人收藏 0 人点赞
#local-deployment

@karminski3: 本地用vLLM部署GLM-5.2的速度终于上来了! 好消息终于轮到本地部署 GLM-5.2 了! 大家都知道 GLM-5.2 这次是自带了MTP头的, 可以进行推测性解码. 但是, 这个只适用于bf16原始精度的GLM-5.2, 而这玩意…

X AI KOLs Timeline ↗ · 2026-06-24 缓存

Community efforts, including a hybrid quantization approach by dnhkng, have enabled vLLM and SGLang to support GLM-5.2 with MTP heads, boosting local inference speed from 2 token/s to over 43 token/s on dual GH200 hardware. The challenge involved managing DSA-based MTP and quantization compatibility.

0 人收藏 0 人点赞
#local-deployment

@supezen: 12.8 万可以部署一个本地 GLM-5.2

X AI KOLs Timeline ↗ · 2026-06-22 缓存

该推文指出可以用12.8万元本地部署GLM-5.2模型。

0 人收藏 0 人点赞
#local-deployment

@Hesamation: 在家本地运行大语言模型并拥有自己AI所需了解的一切。强烈推荐的文章。

X AI KOLs Timeline ↗ · 2026-06-21 缓存

一条推荐文章的帖子,涵盖了在家本地运行大语言模型并保持对自己AI所有权所需了解的一切。

0 人收藏 0 人点赞
#local-deployment

@PatrickToulme: 本周我在本地部署了GLM 5.2,使用OpenCode工具链与Claude Opus进行了对比。底线:这是一个真正的前沿……

X AI KOLs Following ↗ · 2026-06-20 缓存

GLM 5.2 是一个前沿的开源编程模型,在编程任务上的表现接近 Claude Opus,具备出色的工具调用、规划和本地部署能力,且完全免费。

0 人收藏 0 人点赞
#local-deployment

@googledevs: 直接在笔记本电脑上使用 Google Gemma 开放模型部署本地编码代理 → https://goo.gle/gemma-ama-en 加入 Ian…

X AI KOLs Following ↗ · 2026-06-19 缓存

现在可以使用 Google Gemma 开放模型直接在笔记本电脑上部署本地编码代理,实现离线执行和更快的开发工作流程。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈