pipecat-ai/phonellm-alpha-1

Hugging Face Models Trending 模型

摘要

Pipecat团队发布了PhoneLLM Alpha 1,这是一个为低延迟语音代理应用优化的开源AI模型,其性能与更大模型相当,成本却只有一小部分。他们还推出了PhoneBench v1,一个用于评估电话代理场景中大语言模型的基准测试。

任务: 文本生成 标签: transformers, safetensors, nemotron_h, text-generation, nemotron, mixture-of-experts, voice-agent, phone, tool-use, function-calling, conversational, pipecat, custom_code, en, base_model:nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16, base_model:finetune:nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16, license:bsd-2-clause, 端点兼容, 区域:美国
查看原文
查看缓存全文

缓存时间: 2026/08/29 03:20

pipecat-ai/phonellm-alpha-1 · Hugging Face

来源:https://huggingface.co/pipecat-ai/phonellm-alpha-1 模型PhoneLLM Alpha 1 (pipecat-ai/phonellm-alpha-1)基座模型NVIDIA Nemotron 3 Nano 30B-A3B (https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16)架构混合式Mamba-Transformer混合专家模型;总计300亿参数,35亿活跃参数训练使用NVIDIA NeMo框架进行全参数监督微调上下文长度262,144个token精度bfloat16 safetensors推荐推理设置temperature=0,禁用思考 (chat_template_kwargs: {"enable_text": false})部署vLLM或SGLang,参考Nemotron 3 Nano配置;需设置 trust_remote_code=True语言英语许可证BSD 2-Clause (https://huggingface.co/pipecat-ai/phonellm-alpha-1/tree/main/LICENSE);基于NVIDIA Nemotron开源模型许可证 (https://huggingface.co/pipecat-ai/phonellm-alpha-1/blob/main/LICENSE_NVIDIA.txt) 衍生——详见许可证 (https://huggingface.co/pipecat-ai/phonellm-alpha-1#license)开发团队Daily (https://www.daily.co/) / Pipecat (https://www.pipecat.ai/)团队

Pipecat团队很高兴发布PhoneLLM Alpha 1 (https://huggingface.co/pipecat-ai/phonellm-alpha-1),这是一个面向语音智能体用例的开源权重模型。

此次发布是我们持续工作的一部分,旨在训练适用于低延迟和多轮智能体工作负载的小型开源权重LLM。

当通过Pipecat (https://www.pipecat.ai/) 等框架与转录和文本转语音模型配对使用时,PhoneLLM可以处理金融服务、医疗保健、零售和酒店业的呼入客服电话,并执行常见的外呼智能体任务。

PhoneLLM运行成本仅为大型通用模型的一小部分,延迟也更低,同时在特定用例上提供相当的性能。例如,PhoneLLM的性能与GPT 5.6 Terra相当,但成本低94%,且P95首token延迟快1300毫秒。

PhoneLLM是一个开源模型,因此您可以在自己的基础设施上运行它。该模型在BSD许可证下发布,无商业限制。

我们还发布了PhoneBench v1,这是一个根据LLM在电话智能体用例中的适用性进行评估的基准测试。除了准确性和说话风格,我们还测量模型延迟并估算每分钟运行成本。

基准测试准确性、低延迟和低成本的独特组合,使PhoneLLM成为构建语音智能体最具吸引力的选项之一。

https://huggingface.co/pipecat-ai/phonellm-alpha-1#model-specs模型规格

PhoneLLM Alpha 1是基于NVIDIA的Nemotron 3 Nano 30B-A3B模型 (https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16) 的全参数微调版本,使用NVIDIA NeMo (https://docs.nvidia.com/nemo-framework/index.html) 框架训练。

与Nemotron Nano类似,PhoneLLM是一个混合专家模型,拥有35亿活跃参数,可在低成本下实现高速推理。

在我们的PhoneBench基准测试中,PhoneLLM达到了与大多数常用于生产语音智能体的模型相当或更好的准确性,同时延迟和成本更低。

PhoneBench v1排行榜:各模型得分、首答token延迟和每分钟成本 (https://huggingface.co/pipecat-ai/phonellm-alpha-1/blob/main/images/01-phonebench-v1-leaderboard.png)

https://huggingface.co/pipecat-ai/phonellm-alpha-1#why-a-model-specifically-for-voice-agents为何需要专门为语音智能体设计的模型?

在我们使用Pipecat创建语音智能体的工作中,我们发现LLM领域存在一个缺口,即缺乏(1)低延迟且(2)能准确调用工具的模型。

最新的前沿模型针对启用思考token的情况进行了优化。当模型以这种方式推理时,用户查询和智能体响应之间会有很长的延迟。

我们还发现,无论是大型还是小型模型,在长多轮对话中准确调用工具都很困难。在禁用思考时尤其如此。LLM常常会说“是的,我已经为您预订了那张桌子”,但实际上并未操作,这可能导致灾难性的结果和客户不满。

PhoneLLM经过专门训练,能够在正确的时机调用正确的工具,无需启用思考功能。

微调前后对比:Nemotron 3 Nano 30B 与 PhoneLLM 30B Alpha 1 在相同呼叫轮次中的表现 (https://huggingface.co/pipecat-ai/phonellm-alpha-1/blob/main/images/02-before-after-fine-tuning.png)

更广泛地说,我们看到行业正朝着小型开源权重模型转变,这些模型针对特定目的进行微调,在准确性、推理速度、成本和数据隐私方面超越通用前沿模型。

Pipecat团队直接与企业客户合作,使用生产智能体轨迹和专有数据为特定用例训练模型。PhoneLLM是基于Nemotron 3 Nano等强大高效基座模型构建的当今可能性示例。

https://huggingface.co/pipecat-ai/phonellm-alpha-1#phonebenchPhoneBench

当我们训练新模型时,第一步总是找出如何评估它。

语音智能体以及一般的LLM输出难以评估,因为输出是自由形式的,通常无法客观验证。说话风格、事实准确性和与用户查询的相关性等都是无法通过程序检查的。

即使是工具调用的选择也有主观成分:通常基准测试会期望在某个时间以特定参数调用某个工具,但实际上模型在执行动作和查找信息的时机和方式上具有高度灵活性。

为处理这种主观性,PhoneBench使用一组LLM评审员对模型输出进行评分,将动作与高质量参考样本进行比较。评审员经过人工标注校准以确保准确性。

通过这种方式,PhoneBench能够测量通常需要人工标注才能获得的详细质量点:电话说话风格、工具调用准确性、说做一致性、事实依据、对话连贯性、身份验证和升级处理规范,以及呼叫者结果。

基准测试中的场景、工具列表和系统提示与我们用于训练PhoneLLM等模型的数据分开,因此PhoneLLM不会局限于其训练的任务。且基准测试验证了模型能泛化到前所未见的场景、业务用例、工具列表和提示。

PhoneBench:如何评判一个轮次(两个示例候选对及评审员推理) (https://huggingface.co/pipecat-ai/phonellm-alpha-1/blob/main/images/03-how-a-turn-is-judged.png)

https://huggingface.co/pipecat-ai/phonellm-alpha-1#latency延迟

准确性只是等式的一部分。构建优秀的智能体是全栈系统工程挑战!对于语音智能体,响应延迟是一个关键属性。

一般来说,人们期望语音对话中的响应相当迅速,并且对缓慢响应的容忍度很低。在大多数情况下,“语音到语音”延迟需要在1500毫秒左右。(理想情况下,甚至更快。但我们拥有大量关于语音智能体成功经验的数据,人们乐于与P95语音到语音延迟为1500毫秒的智能体交谈。)

这种语音到语音延迟包括网络开销、音频处理、应用逻辑以及STT、LLM和TTS模型的所有推理。1500毫秒是一个相当紧张的延迟预算。GPT 5.6 Terra在快速模式下运行的P95首token延迟约为1900毫秒。因此,仅使用Terra构建的语音智能体的LLM部分就已经超出了我们的延迟目标。

以下是详细分解 (https://voiceaiandvoiceagents.com/#latency),展示了在一个优化良好的语音智能体中(运行在macOS上,并通过WebRTC与云端语音智能体服务器通信)延迟是如何累积的。

语音到语音延迟预算(按阶段),总计1293毫秒 (https://huggingface.co/pipecat-ai/phonellm-alpha-1/blob/main/images/04-voice-to-voice-latency-budget.png)

您可以看到我们的LLM首token延迟目标是650毫秒。

追求极快的首token延迟与成本效益地运行模型之间存在权衡。提供更多的并发推理请求可以降低成本,但会增加延迟。

开源权重模型的一大优势是我们可以为语音智能体用例优化推理栈。我们可以在成本-延迟曲线上选择最佳点。而且,由于我们使用的推理服务器是开源的,我们可以通过编写新代码来移动这条曲线。(我们为LLM和NVIDIA的转录模型 (https://github.com/kwindla/nemotron-voice-agent#production-streaming-asr-serving-rtx-5090–l40s-cluster) 编写延迟优化的推理代码。)

我们选择Nemotron 3 Nano (https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16) 作为PhoneLLM的基座,是因为Nemotron 3架构 (https://research.nvidia.com/labs/nemotron/Nemotron-3/) 在现代NVIDIA硬件上扩展非常高效。我们可以在单个GPU上打包相当多的并发生成,同时仍保持出色的P95延迟。

我们已与Modal (https://modal.com/) 团队合作,为运行PhoneLLM开发优化配置。更多内容请参阅下文的运行模型部分。

https://huggingface.co/pipecat-ai/phonellm-alpha-1#cost成本

估算对话智能体的LLM成本很棘手。

智能体是跨多个轮次的长时间交互。大多数LLM API服务按token计费,对输入token和输出token、缓存写入、缓存读取、服务层级(例如OpenAI的“快速”模式)、区域数据围栏和零数据保留采用不同的费率。

“每分钟成本”是生产语音智能体建模成本的自然方式。因此,将估算的token成本转换为每分钟平均成本很有用。此转换公式取决于对话长度、系统提示大小、典型的模型语言和思考token模式、缓存使用统计以及许多其他因用例和单个会话而异的要素。

如果您在自己的基础设施上运行模型,计算每分钟成本会稍容易一些。您需要知道目标并发量,并对利用率进行假设。

我们构建了一个电子表格 (https://docs.google.com/spreadsheets/d/1mj5cSV7oVY3vLToNEprCkQVVU1uofHZ-_6u779rXS7I/edit?usp=sharing),基于每个模型在PhoneBench基准测试中的推理模式,显示了许多LLM(包括API和自托管模型)的每分钟成本。

PhoneBench语音智能体成本估算电子表格:各模型推算每分钟成本 (https://huggingface.co/pipecat-ai/phonellm-alpha-1/blob/main/images/05-cost-estimator-spreadsheet.png)

请随意复制此表并进行修改或扩展。它相当复杂,但Codex和Claude现在都非常擅长处理大型电子表格、解释其工作原理并进行补充。

您可以看到这些数字中的一些普遍模式。更大的模型通常运行成本更高。Gemini 3.6 Flash是一个例外,因为即使思考设置为最小,它也会产生大量的思考token。

自托管可能比使用API更便宜,但大型推理提供商非常擅长其业务,并以非常大的规模经济运营。通过自托管省钱的途径是模型规模套利:使用一个完美适合您用例的小型模型,而不是更大、更通用的模型。

经济地托管模型需要尽可能利用每个GPU集群,直到性能下降超出目标指标为止。对于语音智能体,我们希望将每个会话固定到单个集群,以便缓存更容易。我们最重要的指标是延迟。

以下是电子表格中每个模型的并发基准测试扫描摘要。我们选择一个“不得超过”的P95首答token延迟目标。然后,针对特定智能体工作负载,运行模拟以找到保持在该目标以下的最大并发量。

P95首答token延迟在600毫秒目标时的交叉点:每个模型和硬件的最大并发量 (https://huggingface.co/pipecat-ai/phonellm-alpha-1/blob/main/images/06-ttfat-crossover-600ms.png)

Nemotron 3 Nano(以及架构相同的PhoneLLM)扩展性非常好。我们在这里的最大并发量是每个NVIDIA B200上44个进程。按照这种扫描方式构建,相当于每个B200节点固定了88个智能体进程。

在Modal上,B200的基础成本为每小时6.2496美元。区域固定增加了1.5倍乘数,使成本达到9.3744美元/小时。我们目标是70%的利用率(除以0.70),因此有效成本为13.392美元/小时,或0.2232美元/分钟。

将0.2232美元/分钟除以88个并发智能体,等于每分钟智能体成本0.00025美元。

我们之所以能够实现如此高的效率,部分是因为Nemotron 3 Nano是一个非常高效的Mamba-Transformer混合专家架构。但也因为Modal团队为其B200基础设施上的PhoneLLM运行开发了工作负载特定的优化。这就引出了……

https://huggingface.co/pipecat-ai/phonellm-alpha-1#weights-and-deployment权重与部署

PhoneLLM Alpha 1的权重在HuggingFace这里 (https://huggingface.co/pipecat-ai/phonellm-alpha-1)。您可以在任何能运行300亿参数开源权重模型的地方运行PhoneLLM。

我们在生产环境中同时使用SGLang和vLLM来提供模型服务。PhoneLLM非常适合在单个NVIDIA B200上运行,并且速度非常快,有足够空间处理长上下文和上下文缓存。在B200上,单请求TTFT P95低于100毫秒。

如果您正在尝试PhoneLLM,标准的Nemotron 3 Nano配置是良好的起点:

  • SGLangNemotron 3 Nano配置 (https://docs.sglang.io/cookbook/autoregressive/NVIDIA/Nemotron3-Nano)
  • vLLMNemotron 3 Nano配置 (https://recipes.vllm.ai/nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16)

重要:将温度设置为0并禁用思考。这两个设置与模型训练方式一致。

https://huggingface.co/pipecat-ai/phonellm-alpha-1#deploying-on-modal在Modal上部署

PhoneLLM也可以通过Modal AutoEndpoints (https://modal.com/docs/guide/endpoints) 部署。您只需在Endpoints控制面板 (https://modal.com/endpoints/) 上点击几下,或使用Modal CLI运行以下命令即可启动部署。

modal endpoint create --model pipecat-ai/phonellm-alpha-1

Modal利用其Auto Endpoints系统,专门使用Pipecat团队提供的代表性数据,针对对话式语音工作负载优化吞吐量,同时保持非常低的引擎首答token延迟。与vLLM食谱中的通用配置相比,此配置在我们的目标低于600毫秒P95首答token延迟指标下,大约将最大智能体并发量提高了一倍。

https://huggingface.co/pipecat-ai/phonellm-alpha-1#a-few-more-things更多说明

我们使用Daily的端到端模型训练栈创建了PhoneLLM。训练一个优秀的模型需要:

  1. 收集或合成生成良好的训练数据
  2. 构建评估环境
  3. 运行优化的训练过程

我们于2024年开始构建这些工具,以支持我们评估模型 (https://github.com/kwindla/aiewf-eval) 用于语音用例的工作,并训练像Pipecat Smart Turn (https://github.com/pipecat-ai/smart-turn) 语音端点检测模型这样的小型原生音频模型。

今年,随着开源权重模型改进到我们可以使用这些新的……

相似文章

为LLM智能体设计的音频感知层,拥有随使用而增长的记忆

Reddit r/LocalLLaMA

一个实验性开源框架,使LLM智能体能够使用本地模型(CLAP、Whisper、Silero VAD)和不断增长的概念记忆来感知并识别非语音音频事件。该系统采用事件门控识别、指纹识别和基于符号的推理,目前尚无正式基准测试。

ThunderPhone

Product Hunt

ThunderPhone 是一个用于构建AI电话代理的自助平台,包含模型,起步价每分钟2美分,在Big Bench Audio上具有高准确性,并支持47种语言。