有人能解释一下'使用系统提示控制推理'是什么意思吗?

Reddit r/artificial 模型

摘要

这篇文章详细介绍了NVIDIA的Nemotron-3-Nano-4B-GGUF模型的发布,这是一款小型语言模型,旨在处理推理和非推理任务,且推理可通过系统提示进行控制。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/14 07:05

nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF · Hugging Face

来源:https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF 预训练数据集 (https://huggingface.co/collections/nvidia/nemotron-pre-training-datasets) 后训练数据集 (https://huggingface.co/collections/nvidia/nemotron-post-training-v3)

主页 (https://developer.nvidia.com/nemotron) Discord (https://discord.gg/9xpKQtVvrk)

许可协议 (https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/)

模型开发者: NVIDIA Corporation

模型发布时间:

2025年12月 - 2026年1月

数据时效性:

2024年9月

预训练数据的截止日期为2024年9月。

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#model-overview 模型概述

NVIDIA-Nemotron-3-Nano-4B-GGUF 是 NVIDIA-Nemotron-3-Nano-4B-BF16 的量化版本(Q4_K_M),是一款由 NVIDIA 从零开始训练的小型语言模型(SLM),旨在统一处理推理和非推理任务。它通过先生成推理过程,再给出最终响应来回答用户查询和任务。模型的推理能力可以通过系统提示词进行控制。如果用户希望模型直接提供最终答案,而不生成中间推理过程,可以进行相应配置,尽管在需要推理的较难提示上准确率可能会略有下降。反之,允许模型先生成推理过程,通常能获得更高质量的查询和任务最终解决方案。

该模型使用 NemotronElastic (https://arxiv.org/pdf/2511.16664) 框架从 NVIDIA-Nemotron-Nano-9B-v2 压缩而来。母模型 NVIDIA-Nemotron-Nano-9B-v2 的详细信息可参见 (Nemotron-H 技术报告 (https://arxiv.org/abs/2504.03624))。该模型采用混合架构,主要由 Mamba-2 和 MLP 层组成,并仅包含四个 Attention 层。

支持的语言包括:英语。并借助 Qwen 进行了优化。

此模型可商用。

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#license/terms-of-use 许可协议/使用条款

适用条款:此模型的使用受 NVIDIA Nemotron 开放模型许可协议 (https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/) 约束。

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#evaluation-results 评估结果:

我们在推理关闭模式下对我们的模型在这些基准测试上进行了评估

基准测试NVIDIA-Nemotron-3-Nano-4B-BF16NVIDIA-Nemotron-3-Nano-4B-FP8NVIDIA-Nemotron-3-Nano-4B-Q4_K_M
IFBench-Prompt43.243.8846.9
IFBench-Instruction44.244.7849.6
Orak22.920.7219.8
IFEval-Prompt82.885.7781.5
IFEval-Instruction88.087.5383.9
HaluEval62.262.2662.4
RULER (128k)91.191.0991.2

所有评估均使用 NeMo-Skills (https://github.com/NVIDIA/NeMo-Skills/tree/main/docs) 和 Orak (https://github.com/krafton-ai/Orak) 进行。对于 Orak,我们在三个游戏(超级马里奥、暗黑地牢和星露谷物语)上进行了评估。

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#deployment-geography-global 部署地区:全球

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#use-case 使用场景

NVIDIA-Nemotron-3-Nano-4B 是一款面向边缘平台(Jetson Thor, GeForce RTX, DGX Spark)上智能体AI的边缘就绪型小型语言模型。其主要用途包括AI游戏NPC(队友/伴侣)、本地语音助手(用于设备、应用和游戏)以及物联网自动化。可用于英语和编程语言。

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#release-date-3162026 发布日期:2026年3月16日

通过 https://huggingface.co/ 于2026年3月16日发布。

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#references 参考资料

  • NVIDIA Nemotron Nano 2: 一个精确高效的混合 Mamba-Transformer 推理模型 (https://research.nvidia.com/labs/adlr/files/NVIDIA-Nemotron-Nano-2-Technical-Report.pdf)
  • Nemotron Elastic: 迈向高效的多合一推理大语言模型 (https://arxiv.org/abs/2511.16664)
  • NVIDIA Nemotron 3: 高效且开放的智能 (https://arxiv.org/abs/2512.20856)
  • Nemotron 3 Nano: 用于智能体推理的开放、高效混合专家混合 Mamba-Transformer 模型 (https://arxiv.org/abs/2512.20848)
  • Nemotron 3 Super: 用于智能体推理的开放、高效混合专家混合 Mamba-Transformer 模型 (https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Super-Technical-Report.pdf)

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#model-architecture 模型架构

  • 架构类型:Mamba2-Transformer 混合架构
  • 网络架构:Nemotron-Hybrid - 此模型从 nvidia/NVIDIA-Nemotron-Nano-9B-v2 (https://huggingface.co/nvidia/NVIDIA-Nemotron-Nano-9B-v2) 压缩而来。
  • 模型参数数量:3.97 x 10^9

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#input 输入

  • 输入类型:文本
  • 输入格式:字符串
  • 输入参数:一维 (1D):序列
  • 其他输入相关属性:上下文长度高达 262K。支持的语言包括英语。

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#output 输出

  • 输出类型:文本
  • 输出格式:字符串
  • 输出参数:一维 (1D):序列
  • 其他输出相关属性:序列长度高达 262K

我们的模型专为在 NVIDIA GPU 加速系统上运行而设计和优化。通过利用 NVIDIA 的硬件(例如 GPU 核心)和软件框架(例如 CUDA 库),与仅使用 CPU 的解决方案相比,该模型实现了更快的训练和推理时间。

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#software-integration 软件集成

  • 运行时引擎:NeMo 25.07
  • 支持的硬件微架构兼容性:NVIDIA A10G, NVIDIA H100-80GB, NVIDIA A100, GeForce RTX
  • 操作系统:Linux

将基础模型和微调模型集成到AI系统中,需要使用特定于用例的数据进行额外测试,以确保安全部署和有效部署。遵循 V 模型方法论,单元级和系统级的迭代测试和验证对于降低风险、满足技术和功能要求以及确保符合安全和伦理标准至关重要。

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#use-it-with-llamacpp 与 llama.cpp 配合使用

启动兼容 OpenAI 的 API 服务器

./llama-server -hf nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF:Q4_K_M -c 0 --alias my_model -ngl 999 --port 5000 --host 0.0.0.0

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#model-version 模型版本

  • v1.0

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#training-testing-and-evaluation-datasets 训练、测试和评估数据集

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#training-datasets 训练数据集

  • 数据模态:文本
  • 文本训练数据大小:超过 10 万亿个 tokens
  • 训练/测试/验证集划分:我们使用了 100% 的语料库进行预训练,并依赖外部基准测试进行测试。
  • 按数据集划分的数据收集方法:混合:自动化、人工、合成
  • 按数据集划分的数据标注方法:混合:自动化、人工、合成

特性: NVIDIA-Nemotron-3-Nano-4B 的后训练语料库包含英语和多语言文本(德语、西班牙语、法语、意大利语、韩语、葡萄牙语、俄语、日语、中文和英语)。我们的来源涵盖多种文档类型,如网页、对话、文章和其他书面材料。语料库跨越领域包括代码、法律、数学、科学、金融等。我们还包含一小部分问答和对齐风格的数据以提高模型准确性。对于上述几个领域,我们使用了来自 DeepSeek R1/R1-0528、Qwen3-235B-A22B、Nemotron 4 340B、Qwen2.5-32B-Instruct-AWQ、Qwen2.5-14B-Instruct、Qwen 2.5 72B 的合成数据,特别是推理轨迹。

关于数据集和合成数据生成方法的更多详细信息,可参见技术报告 NVIDIA Nemotron Nano 2: 一个精确高效的混合 Mamba-Transformer 推理模型 (https://research.nvidia.com/labs/adlr/files/NVIDIA-Nemotron-Nano-2-Technical-Report.pdf)。

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#public-datasets 公开数据集

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#private-non-publicly-accessible-datasets-of-third-parties 第三方私有非公开数据集

数据集全球监管工作台

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#online-dataset-sources 在线数据集来源

英文 Common Crawl 数据从 Common Crawl 基金会下载(有关其爬取的详细信息,请参阅他们的 FAQ (https://commoncrawl.org/faq)),并包括从 CC-MAIN-2013-20 到 CC-MAIN-2025-13 的快照。随后,我们按照 Nemotron-CC 论文 (https://arxiv.org/abs/2412.02595) 中描述的多种方式对数据进行了去重和过滤。

此外,我们从以下三个 Common Crawl 快照中提取了十五种语言的数据:CC-MAIN-2024-51, CC-MAIN-2025-08, CC-MAIN-2025-18。包含的十五种语言是:阿拉伯语、中文、丹麦语、荷兰语、法语、德语、意大利语、日语、韩语、波兰语、葡萄牙语、俄语、西班牙语、瑞典语和泰语。由于我们没有可靠的多语言基于模型的质量分类器可用,因此我们仅应用了启发式过滤——类似于我们在 Nemotron-CC 流程中对低质量英文数据所做的,但针对某些效果不佳的语言有选择性地移除了一些过滤器。去重方式与 Nemotron-CC 相同。

GitHub Crawl 是使用 GitHub REST API 和 Amazon S3 API 收集的。每次爬取都根据其各自来源(GitHub 或 S3)设定的速率限制进行。我们收集原始源代码,并随后删除任何许可证不在我们宽松许可证集合中的内容(更多细节,请参考技术报告)。

数据集模态数据集大小 (Tokens)收集时间段
英文 Common Crawl文本3.360T2025年4月8日
多语言 Common Crawl文本812.7B2025年5月1日
GitHub Crawl文本747.4B2025年4月29日
英文 Common Crawl 1.1文本未公开2025年10月2日

https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF#nvidia-sourced-synthetic-datasets NVIDIA 来源的合成数据集

数据集模态数据集大小 (Tokens)种子数据集用于生成的模型
来自 DeepSeek-R1 的合成“解题的艺术”文本25.5B解题的艺术 (https://artofproblemsolving.com/company); 美国数学竞赛8 (https://artofproblemsolving.com/wiki/index.php/AMC_8_Problems_and_Solutions); 美国数学竞赛10 (https://artofproblemsolving.com/wiki/index.php/AMC_10_Problems_and_Solutions); DeepSeek-R1 (https://huggingface.co/deepseek-ai/DeepSeek-R1)DeepSeek-R1
来自 Mixtral-8x22B-v0.1 的合成道德故事与社会化学文本327Msocial-chemestry-101 (https://huggingface.co/datasets/tasksource/social-chemestry-101); 道德故事 (https://huggingface.co/datasets/demelin/moral_stories)Mixtral-8x22B-v0.1 (https://huggingface.co/mistralai/Mixtral-8x22B-v0.1)
以 OpenStax 为种子,由 DeepSeek-V3, Mixtral-8x22B-v0.1, 和 Qwen2.5-72B 生成的合成社会科学文本83.6MOpenStax - CC BY-SA 子集 (https://openstax.org/)DeepSeek-V3 (https://huggingface.co/deepseek-ai/DeepSeek-V3); Mixtral-8x22B-v0.1 (https://huggingface.co/mistralai/Mixtral-8x22B-v0.1); Qwen2.5-72B (https://huggingface.co/Qwen/Qwen2.5-72B)
以 OpenStax 为种子,由 DeepSeek-V3, Mixtral-8x22B-v0.1, 和 Qwen2.5-72B 生成的合成健康科学文本9.7MOpenStax - CC BY-SA 子集 (https://openstax.org/)DeepSeek-V3 (https://huggingface.co/deepseek-ai/DeepSeek-V3); Mixtral-8x22B-v0.1 (https://huggingface.co/mistralai/Mixtral-8x22B-v0.1); Qwen2.5-72B (https://huggingface.co/Qwen/Qwen2.5-72B)
以 OpenStax, Open Textbook Library, 和 GSM8K 为种子,由 DeepSeek-R1, DeepSeek-V3, DeepSeek-V3-0324, 和 Qwen2.5-72B 生成的合成 STEM文本175MOpenStax - CC BY-SA 子集 (https://openstax.org/); GSM8K (https://github.com/openai/grade-school-math); Open Textbook Library - CC BY-SA & GNU 子集 (https://open.umn.edu/opentextbooks/textbooks/)DeepSeek-R1 (https://huggingface.co/deepseek-ai/DeepSeek-R1), DeepSeek-V3 (https://huggingface.co/deepseek-ai/DeepSeek-V3); DeepSeek-V3-0324 (https://huggingface.co/deepseek-ai/DeepSeek-V3-0324); Qwen2.5-72B (https://huggingface.co/Qwen/Qwen2.5-72B)
Nemotron-PrismMath文本4.6BBig-Math-RL-Verified (https://huggingface.co/datasets/SynthLabsAI/Big-Math-RL-Verified); OpenR1-Math-220k (https://huggingface.co/datasets/open-r1/OpenR1-Math-220k)Qwen2.5-0.5B-instruct (https://huggingface.co/Qwen/Qwen2.5-0.5B-Instruct), Qwen2.5-72B-Instruct (https://huggingface.co/Qwen/Qwen2.5-72B-Instruct); DeepSeek-R1-Distill-Qwen-32B (https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-32B)
来自论文和允许书籍,由 Qwen2.5-72B-Instruct 生成的合成问答数据文本350MMarXiv (https://info.arxiv.org/help/bulk_data/index.html); 美国国立卫生研究院 ExPorter (https://www.nih.gov/); BioRxiv (https://www.biorxiv.org/tdm); PMC Article (https://pmc.ncbi.nlm.nih.gov/tools/textmining/); USPTO Backgrounds (https://data.uspto.gov/apis/transition-guide/bdss#pats); peS2o (https://huggingface.co/datasets/allenai/peS2o); Global Regulation; CORE (https://core.ac.uk/documentation/dataset); PG-19 (https://github.com/google-deepmind/pg19); DOAB CC BY & CC BY-SA 子集 (https://www.doabooks.org/en); NDLTD (https://ndltd.org/thesis-resources/global-etd-search/)Qwen2.5-72B-Instruct (https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)
来自 DeepSeek-V3 的合成 FineMath-4+ 再处理文本9.2BCommon Crawl (https://commoncrawl.org/latest-crawl)DeepSeek-V3 (https://huggingface.co/deepseek-ai/DeepSeek-V3)
来自 phi-4 的合成 FineMath-3+ 再处理文本27.6BCommon Crawl (https://commoncrawl.org/latest-crawl)phi-4 (https://huggingface.co/microsoft/phi-4)
来自 phi-4 的合成 Union-3+ 再处理文本93.1BCommon Crawl (https://commoncrawl.org/latest-crawl)phi-4 (https://huggingface.co/microsoft/phi-4)
Nemotron-MIND (从 phi-4 刷新)文本73BCommon Crawl (https://commoncrawl.org/latest-crawl)phi-4 (https://huggingface.co/microsoft/phi-4)
来自 phi-4 的合成 Union-4+ 再处理文本14.12BCommon Crawl (https://commoncrawl.org/latest-crawl)phi-4 (https://huggingface.co/microsoft/phi-4)
来自 phi-4 的合成 Union-3+ minus 4+ 再处理文本78.95BCommon Crawl (https://commoncrawl.org/latest-crawl)phi-4 (https://huggingface.co/microsoft/phi-4)
来自 phi-4 的合成 Union-3 刷新文本80.94BCommon Crawl (https://commoncrawl.org/latest-crawl)phi-4 (https://huggingface.co/microsoft/phi-4)
来自 phi-4 的合成 Union-4+ 刷新文本52.32BCommon Crawl (https://commoncrawl.org/latest-crawl)phi-4 (https://huggingface.co/microsoft/phi-4)
以 AQUA-RAT, LogiQA, 和 AR-LSAT 为种子,由 DeepSeek-V3 和 DeepSeek-V3-0324 生成的合成 AGIEval文本4.0BAQUA-RAT (https://huggingface.co/datasets/deepmind/aqua_rat); LogiQA (https://huggingface.co/datasets/lucasmccabe/logiqa); AR-LSAT (https://github.com/zhongwanjun/AR-LSAT)DeepSeek-V3 (https://huggingface.co/deepseek-ai/DeepSeek-V3); DeepSeek-V3-0324 (https://huggingface.co/deepseek-ai/DeepSeek-V3-0324)
以 AQUA-RAT, LogiQA, 和 AR 为种子,由 DeepSeek-V3 和 DeepSeek-V3-0324 生成的合成 AGIEval文本(内容截断)

相似文章

nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16

Hugging Face Models Trending

NVIDIA 发布 Nemotron 3 Nano Omni,一款 300 亿参数的多模态模型,能够处理视频、音频、图像和文本,并集成推理能力,适用于企业工作流。

PromptMN:伪提示语言

arXiv cs.CL

PromptMN是一种领域特定语言,通过向自然语言提示中添加类型化指令来减少歧义。该语言在前沿模型上进行了评估,证明了其在实现更清晰的人机交互方面的可行性。

Nemotron 3.5 Content Safety:面向全球企业 AI 的可定制多模态安全解决方案

Hugging Face Blog

NVIDIA 发布 Nemotron 3.5 Content Safety,这是一款统一的多模态 AI 安全模型,可在单次推理调用中融合多语言支持、企业自定义策略执行与可审计推理(THINK 模式)。该模型在前代 Nemotron 3 的基础上深化了多模态集成能力,能够同时评估文本提示、图像及助手响应,从而提供更全面的安全判定结果。

nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 · Hugging Face

Reddit r/LocalLLaMA

NVIDIA发布Nemotron-3-Ultra-550B-A55B,这是一个5500亿参数(550亿活跃参数)的前沿大语言模型,采用混合LatentMoE架构,结合Mamba-2、MoE和注意力层,支持高达100万令牌的上下文长度和可配置的推理模式。它支持11种语言,并针对复杂的智能体工作流、长上下文分析和高精度推理进行了优化。