model-deployment

标签

Cards List
#model-deployment

@svpino: 无服务器,但针对模型的,来了!我在12年前就不再租用服务器了。我基本上把所有东西都迁移到了无服务器函数上……

X AI KOLs Timeline · 2026-07-20 缓存

Runpod 发布 FlashBoot,一种针对 AI 模型的无服务器方案,将空闲模型迁移到更便宜的存储,并在需要时将其调回 GPU,冷启动时间低于 200 毫秒,相比传统云服务降低成本 90%。

0 人收藏 0 人点赞
#model-deployment

我成功让 Nemotron Puzzle 75B 在 64GB M2 Max 上流畅运行

Reddit r/LocalLLaMA · 2026-07-12

成功在搭载 64GB 内存的 M2 Max Mac 上本地运行了 75B 参数的 Nemotron Puzzle 模型,展示了在消费级硬件上进行大规模模型推理的能力。

0 人收藏 0 人点赞
#model-deployment

Archestra OSS 新增功能:将 Claude/OpenClaw/Hermes 迁移至受控生产环境。

Reddit r/openclaw · 2026-07-09

Archestra OSS 引入了一项新功能,用于将 Claude、OpenClaw 和 Hermes 等 AI 模型迁移到受控生产环境中。

0 人收藏 0 人点赞
#model-deployment

从Hugging Face一键跳转至Amazon SageMaker Studio

Hugging Face Blog · 2026-07-07 缓存

Hugging Face与Amazon SageMaker AI宣布深度链接集成,开发者可从Hugging Face模型页面一键直接进入SageMaker Studio,并预加载模型和环境,以便立即进行微调或部署。

0 人收藏 0 人点赞
#model-deployment

GLM-5.2在8×B200上的部署数学:没人详细说明的部分——NVFP4 + 2个TP=4副本比TP=8快约2倍,内含完整配置指导。

Reddit r/LocalLLaMA · 2026-07-07

本文为GLM-5.2在8×B200节点上提供了最佳部署配置,展示了使用两个TP=4副本的NVFP4方案相比FP8 TP=8方案可实现约2倍的吞吐量,并附有详细的性能数据和注意事项。

0 人收藏 0 人点赞
#model-deployment

Foundry 托管计算上的 Hugging Face 模型

Hugging Face Blog · 2026-07-07 缓存

微软宣布了 Foundry 托管计算以及 Foundry 上的 Hugging Face 模型,这是一个来自 Hugging Face 的精选开放权重模型目录,可通过一键部署到微软的托管 GPU 平台上,提供企业级安全性、治理和可观测性。

0 人收藏 0 人点赞
#model-deployment

@googleaidevs: 在构建与快速AI进步同步扩展的工具时,平台设计必须演变,让模型发挥最佳性能…

X AI KOLs Following · 2026-07-06 缓存

Google AI Devs强调了平台设计需要与快速AI进步同步演进,并邀请Kevin Hou在aiDotEngineer讨论Antigravity。

0 人收藏 0 人点赞
#model-deployment

@Tech2Wild: 在家运行完整的GLM-5.2,744B参数,全部256个专家,未剪枝,跨4×NVIDIA DGX Spark (GB10)。200K上下文 · MTP …

X AI KOLs Following · 2026-07-05 缓存

一份详细的指南,介绍如何跨4个NVIDIA DGX Spark节点运行未剪枝的GLM-5.2模型(744B参数,256个专家),支持200K上下文,总吞吐量高达60.5 tok/s。包含性能基准测试、致谢和补丁。

0 人收藏 0 人点赞
#model-deployment

@AstroHanRay: 如果要用 GLM-5.2, Ollama Cloud Pro 个人测试下面是市面上的最佳选择了,量大管饱,20 美金非多并发基本上用不完。 同价位下的 http://Z.ai 海外套餐性价比完全比不过,而且还有北京时间 14:00-18:…

X AI KOLs Timeline · 2026-07-02 缓存

推荐使用 Ollama Cloud Pro 服务运行 GLM-5.2 模型,认为 20 美元套餐性价比优于同价位 Z.ai 海外套餐,并指出下午时段有三倍消耗影响效率。

0 人收藏 0 人点赞
#model-deployment

特朗普政府发布Anthropic Mythos,供超过100家美国公司和机构使用

TechCrunch AI · 2026-06-27 缓存

特朗普政府改变立场,允许Anthropic向超过100家美国政府和公司重新部署其强大的网络安全模型Mythos 5,此前因安全担忧而被禁止。

0 人收藏 0 人点赞
#model-deployment

@TheAhmadOsman: Yannick 在本地 AI 领域的工作深度被严重低估

X AI KOLs Timeline · 2026-06-26 缓存

Yannick Nick 演示了如何使用 KTransformers 在 2 块 RTX Pro 6000 GPU 上以原生 FP4+FP8 精度运行 DeepSeek V4 Flash,从而在资源受限的系统上实现高效推理。

0 人收藏 0 人点赞
#model-deployment

@TheAhmadOsman:感谢GLM 5.2,我确切知道企业正在脱离云,获取算力,并致力于为…

X AI KOLs Following · 2026-06-26 缓存

一条推文讨论了GLM 5.2如何揭示企业向本地计算和后训练模型发展的趋势,以及对开源AI未来的不同看法。

0 人收藏 0 人点赞
#model-deployment

PolicyTrim: 提升视觉-语言-动作模型的本征策略效率

Hugging Face Daily Papers · 2026-06-21 缓存

PolicyTrim是一种基于强化学习的后训练框架,能将视觉-语言-动作模型的动作块利用率提升3倍,并将物理执行步骤减少51.4%,实现高达5.83倍的部署加速。

0 人收藏 0 人点赞
#model-deployment

大多数AI功能失败的原因不在于模型本身

Reddit r/artificial · 2026-06-20

一个用于工单分类的AI功能失败并非模型问题,而是由于管道变更导致的数据过期,这凸显了跨团队集成监控的必要性。

0 人收藏 0 人点赞
#model-deployment

GLM-5.2 现在可以在 llama.cpp 和 Unsloth Studio 中本地运行。

Reddit r/LocalLLaMA · 2026-06-19

GLM-5.2 现已支持通过 llama.cpp 和 Unsloth Studio 本地运行。

0 人收藏 0 人点赞
#model-deployment

在本地运行GLM 5.x的最便宜方式(不使用统一内存系统)?

Reddit r/LocalLLaMA · 2026-06-17

关于以4位量化运行GLM 5.x及类似大小模型的最廉价本地硬件配置的讨论,包括仅CPU和多GPU选项。一位用户分享了其在5900X + 128GB DDR4 + 7900XT配置上运行Minimax 2.7和Qwen 3.6的经验。

0 人收藏 0 人点赞
#model-deployment

Empromptu AI

Product Hunt · 2026-06-01

Empromptu AI 是一款产品,能够利用您正在构建的应用程序来训练微调后的AI模型,从而简化微调工作流程。

0 人收藏 0 人点赞
#model-deployment

@danveloper: 简直不敢相信,我竟然在树莓派 5(8GB 版)上以超过1 tok/s的速度运行了 DeepSeek-V4-Flash(284B 参数)……

X AI KOLs Timeline · 2026-06-01 缓存

一位开发者经过大量实验,成功在树莓派 5 上以超过1 tok/s的速度运行了284B参数的DeepSeek-V4-Flash模型,使用的是来自 antirez 的未经修改的 GGUF 文件。

0 人收藏 0 人点赞
#model-deployment

@Teknium:在你的手表上运行Hermes?不错啊

X AI KOLs Following · 2026-05-22 缓存

讨论在智能手表上运行Hermes AI模型,并考虑添加实时通知流以在锁屏上显示回复。

0 人收藏 0 人点赞
#model-deployment

Cerebras 现已运行 Kimi K2.6(一分钟阅读)

TLDR AI · 2026-05-20 缓存

Cerebras 宣布,其硬件现已运行来自 Moonshot AI 的 AI 模型 Kimi K2.6。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈