如何使用 NVIDIA MCG 工具包自动化 AI 模型文档(8 分钟阅读)
摘要
NVIDIA 推出 MCG 工具包,这是一个自动化流水线,能在不到一分钟内根据源代码生成合规的模型文档(Model Card++ 格式),并利用 RAG 和 NIM 微服务。
NVIDIA 的 MCG 工具包可自动化 AI 模型文档流程,快速生成采用 Model Card++ 格式的全面模型卡。
查看缓存全文
缓存时间: 2026/06/01 18:38
# 如何使用 NVIDIA MCG 工具包自动化 AI 模型文档
来源:https://developer.nvidia.com/blog/how-to-automate-ai-model-documentation-with-the-nvidia-mcg-toolkit
随着 AI 模型日益复杂,以及加州 AB-2013 和欧盟 AI 法案等框架下的监管审查不断加强,软件团队面临着一个超越交付优秀代码的挑战:他们需要在模型发布之前生成全面、可审计的模型文档。
模型卡描述了模型的工作原理、预期用途和许可证、训练数据、性能以及局限性。它们促进了透明度和问责制(https://developer.nvidia.com/blog/enhancing-ai-transparency-and-ethical-considerations-with-model-card/),使下游用户——客户、监管机构和受影响的社区——能够在选择和部署 AI 时做出明智的决策。该受众不仅限于开发人员:政策制定者、采购团队和风险评估人员依靠模型卡来评估适用性并比较不同供应商的模型。
在实践中,手动创建模型卡既繁琐又缓慢。文档开发滞后,元数据在发布时往往已经过时。随着模型变得更加复杂,格式不一致和缺少必填字段会造成不必要的审计风险并减缓采用速度。NVIDIA 模型卡生成器 (MCG) 工具包通过直接读取源数据,在一分钟内自动化和标准化 Model Card++ 格式的模型文档。
MCG 工具包是一个容器化管道,通过读取模型源代码来自动生成模型卡。它遵循模块化的“摄取→提取→渲染”流程。一个中央协调器接收您的请求——可以是 URL 或上传的文件——协调工作流程,并返回完整的模型卡。每个阶段作为一个独立服务运行,因此您可以更新或更换单个组件,而不会影响管道的其他部分。
该工具包提供了一个交互式 UI,可以接受 URL(GitHub、GitLab、HuggingFace 或任何公共网页)或上传的文件(ZIP、PDF、DOCX 或 Markdown)。还提供了 REST API 以实现程序化集成。
从那里,数据流经三个阶段:
1. **输入→摄取。** 系统获取内容并将其处理成文档块,按类型分类:文档、配置文件和代码。
2. **文档→提取。** 提取阶段将摄取的文档通过一个由 NVIDIA 推理微服务 (NIM) 驱动的检索增强生成 (RAG) 管道运行。NVIDIA Nemotron RAG (https://huggingface.co/collections/nvidia/nemotron-rag) 处理高精度嵌入 (llama-nemotron-embed-1b-v2) 和重新排序 (llama-nemotron-rerank-500m-v2),并为代码、配置文件和文档设置独立的检索器,以优先处理信号更强的来源。核心提取由 GPT-OSS-120B 执行,它读取检索到的段落并应用专家策划的格式和内容指南——NVIDIA MC++ 模板和字段级样式指南——以符合要求的格式生成合规信息。一个验证步骤在接受响应之前对其进行检查。输出是结构化的 JSON。概述完成后,相同的内容流向子卡阶段,该阶段生成四个 Model Card++ 子卡:偏见、可解释性、隐私以及安全与保障。
3. **JSON→渲染。** 结构化的 JSON 使用可配置模板渲染成人类可读的 Markdown。您可以在界面中编辑内容并重新渲染,然后下载或与其他系统集成。最终的工件是一张完整的模型卡——概述加四个子卡——可供审阅或发布。
一张展示模型卡生成工具包架构的流程图。源代码输入,如 GitHub 仓库、GitLab 仓库、HuggingFace 仓库、网站 URL 或本地文件,流经特定文档解析,然后通过 llama-nemotron-embed-1b-v2 进行嵌入到向量数据库。一个检索器组件(包含代码检索器、配置检索器和文档检索器)查询向量数据库并将结果传递给 llama-nemotron-rerank-500m-v2 进行重新排序。重新排序后的结果输入 Llama-3.3-Nemotron-Super-49B-v1,该模型在反馈循环中验证响应,然后将输出传递给协调步骤。模板渲染器生成最终的模型卡。
*图 1. MCG 工具包架构:通过直接读取源代码生成全面的模型卡*
## 设计灵活
https://developer.nvidia.com/blog/how-to-automate-ai-model-documentation-with-the-nvidia-mcg-toolkit#designed_for_flexibility
您不会被锁定在单一模型、模板或标准中。该工具包可在三个维度上进行定制:
**1) 模型:** 系统为语言模型、嵌入和重新排序使用可配置的端点。指向不同的 NIM 或兼容 API,以匹配您的性能、成本或数据驻留要求,无论您是在较小模型上进行原型设计还是为生产规模扩展。
**2) 模板:** 输出格式由 Markdown 模板驱动。组织可以针对 Model Card++、内部标准或新兴监管格式进行自定义,而无需修改提取逻辑。输出也符合 CycloneDX (https://cyclonedx.org/) 标准。当出现新的披露要求时,您只需更新模板,而不是管道。
**3) 指南:** 字段级指导——捕获什么、如何措辞——来自可配置的知识库。随着法规或领域需求的发展,更新指南而无需触及核心代码。同一个管道可以服务于不同的行业和合规体系。
## 在需要的地方运行
https://developer.nvidia.com/blog/how-to-automate-ai-model-documentation-with-the-nvidia-mcg-toolkit#run_it_where_you_need_it
该工具包作为容器化服务提供,只需一个命令即可设置。协调器、摄取、提取和子卡阶段各自作为独立容器运行,基础设施(数据库和任务队列)已包含在内。没有专有云锁定:MCG 可在本地或您自己的云中运行,并支持 Kubernetes,可帮助您在自有基础设施上快速部署。
## 性能结果
https://developer.nvidia.com/blog/how-to-automate-ai-model-documentation-with-the-nvidia-mcg-toolkit#performance_results
我们在公共模型仓库上通过标准化测试运行了该工具包,以衡量完成率、生成时间和准确性。每个字段都根据源文档进行评分。准确性计算为正确字段数除以非占位字段数。下表 1 显示了结果。
**模型** | **生成时间** | **完成率** | **准确性**
--- | --- | --- | ---
NVIDIA Nemotron Nano 8B | 56秒 | 97% | 92%
NVIDIA Cosmos Reason | 286秒 | 94% | 82%
NVIDIA Parakeet | 65秒 | 92% | 87%
NVIDIA Proteina | 52秒 | 94% | 82%
第三方模型 *(DeepSeek-V3, Evo2, Gemma, Llama)* | 约80秒平均 | 约89% | 约80%
*表 1. 在标准化测试模型上的 MC++ 概述性能。完成率 = 包含有意义内容的字段数 / 总字段数。准确性 = 正确响应数 / 非占位符响应总数。*
对于大多数仓库,该工具包在一分钟内生成完整的模型卡(概述加四个子卡)。总体完成率达到 91%(第三方基线),在标准化测试集上准确性为 76%。完成率和准确性因模型和仓库而异;README 和配置文件更丰富的仓库结果更高。
该工具包在存在支持性文档且代码库结构良好的情况下表现最佳,并在可能的情况下使用代码分析进行补充。当文档稀疏或缺失时,填充的字段较少,系统不会猜测,而是显示“未找到”或“信息不可用”,以标记需要人工审查的缺口。
我们还测试了完全移除文档时的情况。使用我们标准测试集中的相同仓库,我们删除了所有 .pdf、.md 和 .txt 文件,并仅针对代码重新运行工具包。在五个模型中,平均完成率从 91% 下降到 61%,严格准确性(仅针对可验证字段测量)从 76% 下降到 28%(标准测试中准确性仅针对已完成的字段进行评分)。
61% 的完成率表明该工具包仍然可以从代码、配置文件和仓库结构中提取有意义的信号;准确性下降反映了文档对于正确填充这些字段的重要性。
关键是,该工具包不会通过猜测来弥补。如果无法可靠地填充字段,则会显示为“未找到”或“信息不可用”,使其成为文档仍在编写中的团队的有用缺口发现工具,以及文档已完善的团队的生成工具。
## 早期采用者和行业合作伙伴
https://developer.nvidia.com/blog/how-to-automate-ai-model-documentation-with-the-nvidia-mcg-toolkit#early_adopters_and_industry_partners
Oracle 是首批将 MCG 工具包集成到生产基础设施中的合作伙伴之一。作为其 OCI AI 产品的一部分(涵盖从 A10 到 GB200 NVL72 的 GPU 配置),Oracle 部署了该工具包与 OCI 容器引擎 for Kubernetes 和 AI 产品 (https://www.oracle.com/cloud/cloud-native/kubernetes-engine/) 的组合,在标准 VCN 架构中运行 MCG 容器和 NIM 容器,并由对象存储支持 NIM 模型。
他们的部署使用 Llama-3.3-Nemotron-Super-49B-v1 作为核心提取模型,Nemotron RAG (https://huggingface.co/collections/nvidia/nemotron-rag) 处理嵌入和重新排序。GPT-OSS-120B 模型在专用 AI 集群(配备 2xH100 卡)以及按需模型服务上进行托管和测试。OCI 支持越来越强大的 GPU 基础设施用于大规模 AI 训练和推理,对一致、可审计的模型文档的需求也随之增长。
OCI 专用 AI 集群 (DAC) 是一个私有的、完全托管的生成式 AI 环境,在 OCI 内拥有自己的专用 GPU、端点和安全边界。MCG 工具包不仅将 AI 透明度工具直接引入该工作流程,而无需客户自行构建,还使客户能够识别托管模型所需的最佳 GPU 配置,无论是在 OCI 专用 AI 集群环境还是裸金属 GPU 基础设施中。
## 开始使用
https://developer.nvidia.com/blog/how-to-automate-ai-model-documentation-with-the-nvidia-mcg-toolkit#getting_started
如果您想成为早期采用者,请联系 [Trustworthy AI 团队](mailto:[email protected])。我们很乐意讨论合作事宜。
还没有准备好使用全自动工具包?Trustworthy AI GitHub 仓库 (https://github.com/NVIDIA/Trustworthy-AI) 提供了开源 (https://github.com/NVIDIA/Trustworthy-AI/blob/main/LICENSE.md) 的 Model Card++ 模板和 AI 透明度卡,适用于蓝图、数据集、容器和系统,您可以即刻使用。
文档应与您发布的模型保持同步。无论您是采用 MCG 工具包还是从我们的开源模板开始,NVIDIA 的 Trustworthy AI 计划 (https://www.nvidia.com/en-us/ai-trust-center/trustworthy-ai/) 都致力于让这件事变得更容易。
相似文章
哪款模型适用于技术文档?
一篇探讨哪款AI模型最适合生成技术文档的文章。
NVIDIA BioNeMo Agent Toolkit 在 Claude Science 中为生命科学研究人员带来加速 AI
NVIDIA 发布了 BioNeMo Agent Toolkit,将 GPU 加速的 AI 能力以可调用技能的形式集成到 Anthropic 的 Claude Science AI 工作台中,使生命科学研究人员能够通过自然语言运行加速的工作流程,如蛋白质结构预测和药物发现。
@dhruvtwt_:怎么没人聊这事?@nvidia 正免费提供约 80 款 AI 模型的托管 API
Nvidia 低调开放约 80 款免费托管 AI 模型 API,包括 MiniMax M2.7、GLM 5.1、Kimi 2.5、DeepSeek 3.2、GPT-OSS-120B 等,可直接接入 OpenClaude、Zed IDE 等主流开发工具。
NVIDIA 工程师与研究人员如何利用 Codex 进行构建
NVIDIA 的工程师和研究人员正在使用由 GPT-5.5 驱动的 OpenAI Codex,作为处理复杂工程任务和端到端机器学习工作流的默认工具。本文重点介绍了通过在该 NVIDIA 基础设施上集成 Codex 所取得的显著生产力提升、自主系统构建以及研究自动化成果。
我构建了一个 AI Agent Skill,通过分析你的项目生成所有开源文档(README、LICENSE、CONTRIBUTING 等 20 多种)
作者构建了一个开源 AI Agent Skill,它可以扫描项目并生成 README、LICENSE、CONTRIBUTING 等文档文件,提供分级方案和针对项目定制的内容,避免使用通用占位符。