@vicky_grok: 这太疯狂了!NVIDIA 的文本转动作模型现在无需 NVIDIA 的技术栈就能运行。输入一句话。获得人类动作。在……
摘要
NVIDIA 的文本转动作模型已通过 kimodo.cpp 移植到 CPU 上运行,无需 NVIDIA 的技术栈。kimodo.cpp 是一个开源的 GGML/C++ 实现,正迅速获得关注。
查看缓存全文
缓存时间: 2026/08/29 08:03
这太疯狂了
NVIDIA的文本转动作模型现在无需NVIDIA技术栈即可运行。
输入一句文本,就能生成人体动作——仅靠CPU实现。
这个项目名为kimodo.cpp,是NVIDIA Kimodo的GGML/C++移植版,诞生仅四天就已获得470+星标。
最核心的突破在于:
- 输入文本,输出SMPL-X22骨骼旋转数据+根节点平移参数
- 支持CPU或Vulkan双后端运行——硬件选择权在你手中
- 权重文件采用GGUF格式封装,配有SHA-256校验清单
- DDIM采样与扩散循环全部用C++重写
- CPU/Vulkan一致性测试证实双后端输出完全一致
无需CUDA环境
无需Python依赖
无需NVIDIA账户登录
笔记本CPU与Vulkan显卡输出相同数值——这正是通过一致性测试实现的。
同时提供: → C/C++ API接口(kimodo_generate函数直接处理提示词) → Go语言演示服务器(端口8094支持提示词历史记录) → safetensors格式转换工具 → 模糊测试与sanitizer预设方案
当然,项目采用Apache-2.0开源协议,四天内每日持续更新。
Vikas Gupta (@vicky_grok): 从大模型到智能体
大模型负责生成,智能体负责行动。
自主智能体融合了:
🧠 推理能力 🗂️ 记忆系统 🛠️ 工具调用 🔄 规划机制 👀 反馈闭环
这些要素共同驱动目标达成,而非简单响应提示。
相似文章
🟩 NVIDIA 的完整语音技术栈现已本地化。ASR + TTS + 编解码器,量化为 GGUF,通过 NeMo-Speech.cpp 在设备端运行
NVIDIA 的完整语音技术栈——ASR、TTS 和编解码器——现已量化为 GGUF,并通过 NeMo-Speech.cpp 在设备端本地运行,同时发布了 Magpie-TTS、Nemotron Speech Streaming 和 Parakeet 的新模型。
我将 NVIDIA Parakeet(语音转文本)移植到 ggml:与 NeMo 输出相同,速度更快,GGUF 量化,无需 Python
NVIDIA 的 Parakeet 语音转文本模型已被移植到纯 C++/ggml,实现了与 NeMo 字节完全相同的输出,GPU 上推理速度提升高达 5 倍,并提供量化的 GGUF 变体,无需 Python 或 PyTorch 即可在任何地方高效部署。
@dhruvtwt_:怎么没人聊这事?@nvidia 正免费提供约 80 款 AI 模型的托管 API
Nvidia 低调开放约 80 款免费托管 AI 模型 API,包括 MiniMax M2.7、GLM 5.1、Kimi 2.5、DeepSeek 3.2、GPT-OSS-120B 等,可直接接入 OpenClaude、Zed IDE 等主流开发工具。
@itsPaulAi: 哇哦,Nvidia刚刚发布了一个2.6B开源世界模型,你可以将单张图片、文本提示和轨迹转化为…
Nvidia发布了一个2.6B开源世界模型,能够从单张图片、文本提示和轨迹生成可控世界,并在单个GPU上运行。
@HuggingPapers: NVIDIA 刚刚在 Hugging Face 上发布了 AnyFlow 首个任意步数视频扩散模型,可生成高质量文本...
NVIDIA 发布了 AnyFlow,这是首个用于文本到视频生成的任意步数视频扩散模型,允许在推理预算(4 到 50 步)之间实现平滑的质量缩放。