Perplexity 与 Nvidia 合作推出 Portable Computer,一个完全本地化的 AI 代理,零令牌成本(13 分钟阅读)
摘要
Perplexity 与 Nvidia 合作推出 Portable Computer,一个完全本地化的 AI 代理,运行在用户自有的硬件上,如 DGX Spark 和 RTX GPU,消除了云令牌成本并保持数据私密。
Perplexity 的 Portable Computer 是其代理式计算机平台的一个版本,该平台完全运行在用户已拥有的硬件上。模型、用户数据和工作都可以留在本地机器上,无需计费积分。每个任务默认在设备上开始,系统会在将任何单独步骤发送到云端更强大的模型之前请求许可。Portable Computer 现在向 Linux 上的 Pro、Max、Enterprise Pro 和 Enterprise Max 订阅者提供,Windows 支持将于九月推出。用户需要至少 24GB VRAM 的 RTX GPU 来运行代理。
查看缓存全文
缓存时间: 2026/08/26 15:51
# Perplexity与英伟达合作推出便携式计算机:零代币成本的本地化AI智能体
来源:https://venturebeat.com/infrastructure/perplexity-partners-with-nvidia-to-launch-portable-computer-a-fully-local-ai-agent-with-zero-token-costs
Perplexity (https://www.perplexity.ai/)今日正式推出**便携式计算机** (https://www.perplexity.ai/hub/products/portable-computer)——其智能体“计算机”平台 (https://venturebeat.com/technology/perplexity-takes-its-computer-ai-agent-into-the-enterprise-taking-aim-at)的本地化版本。该系统可完全运行在用户现有的硬件设备上,首批支持英伟达DGX Spark (https://venturebeat.com/infrastructure/nvidias-dgx-station-is-a-desktop-supercomputer-that-runs-trillion-parameter)桌面超级计算机及配备英伟达RTX GPU (https://www.nvidia.com/en-us/geforce/rtx/)的Linux设备。
此次合作开发标志着将企业级AI智能体工作负载从云端迁移到本地设备最具突破性的尝试之一。模型、用户文件及所有处理过程均可完全保留在本地设备:本地执行的任何任务均不消耗计费额度,系统默认所有任务在设备端启动——仅在执行特定步骤需调用更强大的云端前沿模型时,才会请求用户许可。
“我们本质上将完全相同的用户界面移植到了全本地化应用中,”Perplexity基础设施与企业工程副总裁Nate在周一的媒体沟通会上表示。“这整合了完整的智能体框架、推理引擎及本地化作业所需的全部组件。”
对于过去两年一直向全球推广万亿级AI数据中心的英伟达而言,这次发布释放出更微妙但具有战略意义的信号:芯片制造商认为本地AI已跨越从爱好者实验到实用工具的关键拐点——他们计划销售驱动这一变革的硬件产品。
“本地AI已到达临界点,”英伟达开发者技术总监Nader(专注开发者工具与开源领域)表示。“长期以来这只是爱好者与极客的领域,他们运行的是经过极致量化的微型模型……虽然这很有趣,但实用性有限。然而随着一系列真正实用的新型开源模型发布,这种情况已彻底改变。”
## **便携式计算机如何将完整本地AI技术栈集成为单一应用**
Perplexity Computer (https://www.perplexity.ai/products/computer)作为公司的知识工作智能体平台,通过协调AI模型、文件、工具及网络访问来完成多步骤任务——包括文档审查、数据分析、报告生成及结果推送至业务系统。便携式计算机 (https://www.perplexity.ai/hub/products/portable-computer)在本地复现了这一体验:本地模型、智能体框架、推理引擎、工具组件、应用连接器及安全沙箱被集成封装在单一系统中。这种集成化正是核心优势。当前大多数本地AI技术栈仍需用户单独组装和操作各个组件——从下载模型权重、搭建推理服务器,到工具连接与性能调优。
“历史上部署本地AI技术栈一直极其困难,”Nate指出。“便携式计算机的核心目标是提供极简体验,让用户能够快速启动并运行。”
在周一的演示中,系统扮演零售投资者角色,处理包含1099表格和投资文件的文件夹——这类敏感财务材料通常令用户对上传云端服务望而却步。通过在DGX Spark上以GPU全负载运行270亿参数的Qwen模型 (https://venturebeat.com/technology/qwen3-8-27b-runs-frontier-class-coding-agents-and-reasoning-locally-no-cloud-api-required),智能体逐份审查文件并标记假设投资者支付不必要费用的案例。界面中通常显示云端额度动态变化的计数器“完全停留在零值,”Nate解释道,“因为所有处理都在设备端完成。”
第二组演示展示了产品的混合特性。Nate模拟初创公司创始人角色,要求智能体在本地分析用户转化漏斗的CSV文件,然后通过Perplexity的连接器生态系统将分析结果推送至Slack频道——这证明本地优先并不意味着孤立运行。
该系统同时支持连接Google Drive、Gmail和GitHub,并能在本地模型达到性能上限时升级调用云端前沿模型。发布时,用户可配置Qwen 3.8 27B或PPLX 27B模型(后者为Perplexity针对自身框架微调的版本),英伟达Nemotron 3.5 Lightning模型也将很快支持。
便携式计算机今日面向Pro、Max、Enterprise Pro及Enterprise Max订阅用户 (https://www.perplexity.ai/hub/pricing)开放Linux平台支持,Windows支持将于九月推出。任何具备24GB以上显存的RTX GPU(约相当于GeForce RTX 3090或更新型号)均可满足要求,Nate称这一门槛“既是我们确保优质体验的基准线,也兼顾了设备的广泛普及性。”
## **为何协同设计模型与智能体框架优于通用架构**
伴随本次发布,Perplexity发表研究论文 (https://perplexity.ai/hub/blog/a-local-first-agent-for-private-and-cost-effective-knowledge-work)提出:有效的本地智能体需要模型与智能体框架(即围绕模型的提示词、工具及编排逻辑架构)进行协同设计。核心洞察在于:通用框架默认假设前沿模型能够处理海量上下文、操作复杂工具界面并进行长期规划,而小型本地模型在这些要求下不堪重负。
Perplexity通过实证研究发现,尽管Qwen 3.8 27B (https://huggingface.co/Qwen/Qwen3.8-27B)等模型标称支持26万token上下文窗口,但超过10万token后性能开始显著下降。因此公司构建了刻意精简的框架:简洁的系统提示词、核心工具集,以及按需加载卸载的“技能”模块(而非永久占用上下文)。团队将Gmail (http://gmail.com/)和GitHub (https://github.com/)等主流连接器从消耗大量token的MCP服务器 (https://modelcontextprotocol.io/docs/2026-07-28/getting-started/intro)重构为紧凑型命令行工具,添加了监控任务健康状态的自验证钩子,并强制启用操作系统级安全沙箱。若沙箱不可用,框架将自动禁用——这与默认以用户全权限运行命令的开源框架形成鲜明对比。
Perplexity报告的基准测试结果令人瞩目(尽管来自公司自身评估)。在其内部开发的本地知识工作基准测试 (https://perplexity.ai/hub/blog/a-local-first-agent-for-private-and-cost-effective-knowledge-work)(包含深度研究、金融分析和文档创作等53项任务,Perplexity计划开源此测试集)中,运行Qwen 3.8 27B的便携式计算机在DGX Spark上得分82.6%,而开源Pi框架得分为77.6%,使用相同模型的Hermes框架得分为74.0%。
Perplexity微调的PPLX 27B模型将分数提升至85.4%。在复杂任务中差距更为显著:在网页研究基准测试BrowseComp中,便携式计算机准确率达66.7%,而Pi和Hermes分别为50.2%和43.9%,同时处理时间减少51%,token消耗降低70%。在多模态文档理解测试中,便携式计算机得分为65.1%,远超Hermes的34.6%和Pi的13.9%。
## **推动AI智能体从云端转向本地硬件的代币经济逻辑**
分析AI工作负载的演变可清晰理解此次发布的战略逻辑。传统聊天应用是脉冲式交互——提问、回答、结束。智能体则截然不同。
“理想情况下,我们希望智能体始终保持活跃,尽可能消耗更多token,”Nader指出。“我们观察到对token的无限需求,这正是本地AI的优势所在。正如所有演示所示,您不受token计费限制,无需为token付费。这对智能体应用具有颠覆性意义。”
这重新定义了本地硬件的价值主张。一个持续运行数小时执行文档审查、自我验证和迭代分析的智能体,在云端将产生巨额API费用。而在用户自有的设备上,这些token的边际成本趋近于零。Perplexity的论文明确阐述了企业级价值主张:随着智能体在个人工作流和整个组织中规模化应用,token消耗与数据传输“将变得日益难以管控。”本地优先执行同时解决两大难题——通过免费推理控制成本,通过确保敏感token永不离开设备边界保障隐私。
或许最具商业启示性的结果在于混合模式。在Terminal Bench 2.1 (https://www.tbench.ai/leaderboard/terminal-bench/2.1)编程基准测试中,全本地运行的Qwen模型以近乎零边际成本获得59.6%得分。允许其升级调用云端Claude Opus 5“顾问”模型后,得分提升至73.0%,预估每任务成本0.415美元。单独运行前沿模型得分为82.4%,每任务成本0.65美元。换言之,升级机制以约三分之二的成本恢复了近五分之三的前沿性能差距——且用户可自主决定何时进行此权衡。在任何顾问调用前,框架会对传输上下文运行PII分类器,向用户精确展示哪些信息将离开设备。远程模型仅返回文本指导,绝不接触本地文件或工具。
## **便携式计算机与Ollama及DIY本地AI技术栈的定位对比**
The Deep View (https://www.thedeepview.com/)的Jason Hiner询问便携式计算机与Ollama等现有本地推理工具的关系。Nate明确划清界限:这些工具解决的是问题的不同层级。
“本次工作的主要精力集中在智能体框架层,”他指出系统底层使用vLLM托管模型推理,并为需要接入自定义推理端点的用户准备了高级模式。“我们对合作的Qwen和Nemotron模型都进行了深度微调,以获得最佳效果……我们的重点是协同优化模型推理与框架的完整技术栈。”
Nader的比喻更为生动:“在Spark上快速运行推理已有顺畅路径。您可以使用Ollama完成部署。但当开始处理更复杂、更智能的任务时,突然需要更高性能。您开始研究不同模型,探索不同框架,这就像海洋——越深入越深邃。”
这种设备化体验显然打动了至少一位参会者。自称工程师的Ben坦言自己配置DGX Spark时“体验糟糕,必须改进”,他认为该产品“是让人们真正理解和感受智能体意义的关键,需要合适的用户体验来实现。”英伟达同时强调硬件的可扩展性:通过共享内存连接两台Spark可运行DeepSeek等前沿级开源模型,四台可支持GLM 5.2或Nemotron Ultra。“我甚至见过八台Spark互联,”Nader补充道。
## **英伟达-Perplexity战略联盟深化的双重意义**
本次发布延续了一年多的合作关系。2025年6月,英伟达与Perplexity宣布合作 (https://nvidianews.nvidia.com/news/nvidia-partners-with-europe-model-builders-and-cloud-providers-to-accelerate-regions-leap-into-ai)向欧洲出版商和电信商提供主权AI模型,这是CEO黄仁勋说服各国政府建设“国家智能基础设施” (https://apnews.com/article/nvidia-france-artificial-intelligence-1a6b50633db24c22b584597142a564ac)全球倡议的一部分。主权AI理念——用黄仁勋的话说“数据属于您的人民、国家和文化”——与便携式计算机在单个桌面尺度上实现的理念哲学相通:可控的智能,运行在自有的硬件上。
双方合作蕴含互利逻辑。Perplexity在面临出版商版权诉讼(包括2025年12月《纽约时报》起诉 (https://www.nytimes.com/2025/12/05/technology/new-york-times-perplexity-ai-lawsuit.html)及更早与福布斯的公开争端 (https://www.axios.com/2024/06/18/forbes-perplexity-ai-legal-action-copyright))压力下,通过持续提升估值融资,获得了不依赖token计量的盈利模式,并切入了法律、医疗和金融等对隐私敏感的企业市场。英伟达则为DGX Spark (https://www.nvidia.com/en-us/products/workstations/dgx-spark/)找到了杀手级应用——正如周一沟通会参会者坦言,该设备“购买容易使用困难”。当被问及Spark是否会预装便携式计算机和Nemotron模型时,Nader未否认但保持谨慎:“这会是个很棒的体验……我们的目标是确保每位用户都能获得极致流畅的使用感受。”
仍存疑问。Perplexity最亮眼的数据来自内部基准测试,公司也承认紧凑模型在复杂推理任务上仍显著落后前沿模型——顾问升级机制“缩小但未完全弥合差距”。发布初期仅支持Linux系统,24GB显存门槛排除了绝大多数消费级PC,而本地AI爱好者聚集的苹果芯片设备明显缺席路线图。“我们当前非常聚焦于英伟达硬件,”Nate在问答环节表示。
但演进方向已毋庸置疑。Perplexity研究人员将此次发布描述为“更广泛变革的一部分:日益强大的智能体正从远程基础设施迁移至个人本地设备。”两家公司共同押注芯片与开源模型的进步将持续拓展桌面设备的能力边界。周一演示中最具深意的细节并非基准测试得分,而是屏幕角落的代币计数器——当智能体高效处理税务文档文件夹时,它始终静止在零值。两年来,AI行业以吉瓦时和代币/美元衡量其雄心。便携式计算机则提出了另一种计量标准——一个永不转动的计量器。
相似文章
CNBC Television: Nvidia与Perplexity AI在DGX Spark上合作本地运行。
NVIDIA和Perplexity AI已合作通过DGX Spark设备将AI处理引入本地桌面,专注于降低成本和数据隐私,对于高级推理任务则卸载到云端。
@omarsar0: 迫不及待想拥有本地全天候运行的智能体。Perplexity 似乎正在积极追逐本地智能体的趋势,
NVIDIA 发布了 Perplexity's Portable Computer,这是一个针对 NVIDIA DGX Spark 的本地优先智能体栈,提供一键本地推理和为始终在线的本地智能体优化的智能体体验。
Perplexity Personal Computer for Windows
Perplexity 推出了适用于 Windows 的个人电脑,允许用户在本地文件和应用程序中运行 AI 代理。
Perplexity 的 Personal Computer 将 Windows PC 转变为 AI 智能体
Perplexity 推出了其 Personal Computer AI 智能体工具的 Windows 版本,使用户能够在本地文件、Microsoft Office 365 和网页上执行操作。该工具正在向付费的 Max 和 Enterprise Max 订阅用户(每月 200 美元起)推送。
Nvidia 的 Vera CPU、DGX Station、Windows PC 都指向同一个目标:本地运行的 AI 代理
Nvidia CEO Jensen Huang 宣布了 Vera CPU、适用于 Windows 的 DGX Station 以及其他 PC,旨在支持本地 AI 代理,强调本地推理以控制 token 成本。