Perplexity联合英伟达推出便携式计算机:全本地运行、零Token成本的AI智能体平台
Perplexity发布Portable Computer,首款深度集成模型与代理框架的全本地AI智能体系统,首发支持Nvidia DGX Spark及RTX GPU Linux设备,敏感数据不出设备、推理零计费,兼顾隐私、成本与混合调用能力。

Perplexity 今日推出 便携式计算机(Portable Computer) 这是其代理型(agentic) “计算机(Computer)”平台 的一个版本,完全运行在用户已拥有的硬件上——首发支持英伟达(Nvidia)的 DGX Spark 台式超级计算机,以及配备英伟达(Nvidia) RTX GPU的Linux设备。
此次发布由Perplexity与英伟达密切合作开发,是迄今最激进的尝试之一,旨在将严肃的AI代理工作负载从云端迁移至本地设备。模型、用户文件及全部工作本身均可保留在设备上。本地完成的工作不消耗计费积分;公司表示,所有任务默认均在设备上启动——系统仅在将任何单个步骤发送至云端更强大的前沿模型前,向用户请求许可。
Perplexity基础设施与企业业务工程副总裁内特(Nate)周一在新闻简报会上表示:“我们基本上将完全相同的用户界面(UI)带入了一个纯本地应用程序中。这整合了完整的代理框架(agent harness)、推理(inference)功能以及所有实现本地工作的必要组件。”
对过去两年一直在向全球推销万亿美元级AI数据中心的英伟达而言,此次公告传递出一种更为微妙但具有战略重要性的信号:这家芯片制造商相信,本地AI已跨越临界点,从爱好者的好奇心转变为实用工具——而它希望销售运行该类AI的硬件。
专注于开发者工具和开源事务的英伟达开发者技术总监纳德尔(Nader)表示:“本地AI已达到一个拐点。长期以来,它只是爱好者的玩物,他们运行的是被量化压缩至极小尺寸的模型……虽然这很酷,但实用性并不强。但随着近期大量涌现的、极具实用价值的新开源模型,这一切都发生了改变。”
便携式计算机如何将完整本地AI堆栈打包为单一应用程序
Perplexity Computer是该公司面向知识工作的代理型平台,可协调AI模型、文件、工具及网络访问,以完成多步骤任务——例如审阅整批文档、分析数据、生成报告,并将结果推送至业务系统。 便携式计算机(Portable Computer) 在本地复现了这一体验:本地模型、代理框架(agent harness)、推理引擎、工具、应用程序连接器(app connectors)及安全沙箱(security sandbox)被打包整合为单一系统。这种集成正是关键所在。当前大多数本地AI堆栈要求用户分别组装并操作这些组件——下载模型权重、搭建推理服务器、连接各类工具,并调优性能。
内特(Nate)表示:“历史上,部署本地AI堆栈一直非常痛苦。借助便携式计算机(Portable Computer),我们真正聚焦于打造一种极为直接的体验,让用户能快速上手并立即运行。”
在周一的一次演示中,该系统扮演了一名零售投资者,审阅一整批1099表单及投资文件——这类敏感财务材料,许多用户会犹豫是否上传至云服务。系统在 270亿参数的Qwen模型 上以满GPU利用率运行,在 DGX Spark上,该代理逐份审阅文档,并标记出假设投资者正在支付不必要费用的情形。内特指出,通常显示云端积分实时累计的界面元素“就停在零”,“因为所有这些操作均发生在设备本地。”
第二次演示展示了该产品的混合能力。以内创业公司创始人身份,内特(Nate)让代理在本地分析一份用户转化漏斗数据CSV文件,再利用Perplexity的连接器生态系统将最终分析结果推送至Slack频道——证明“以本地为先”并不意味着彼此断连。
该系统还可连接Google Drive、Gmail及GitHub,并可在本地模型达到其能力极限时,升级至前沿云端模型。首发阶段,用户可配置Qwen 3.8 27B或PPLX 27B(Perplexity基于自身框架后训练的版本),英伟达Nemotron 3.5 Lightning版本即将推出。
便携式计算机(Portable Computer)今日面向 Pro、Max、Enterprise Pro及Enterprise Max订阅用户 在Linux系统上线,Windows支持将于9月跟进。任何配备至少24GB显存(VRAM)的RTX GPU——大致相当于GeForce RTX 3090或更新型号——均满足最低要求;内特称该门槛“大致是我们确保能提供卓越体验的底线,同时兼顾广泛可用性。”
为何协同设计模型与代理框架(agent harness)优于通用框架
伴随此次发布,Perplexity发表了一篇 研究论文 ,主张有效的本地代理需将模型与其代理框架(即围绕模型的提示词、工具及编排逻辑等支撑结构)协同设计。核心洞见在于:通用框架假定使用前沿模型,后者可处理极大上下文、驾驭庞杂工具界面、并在长周期内进行规划;而小型本地模型无法承受此类需求。
Perplexity通过实证发现,尽管诸如 Qwen 3.8 27B 等模型宣称支持26万token的上下文窗口,但其实际表现会在超过10万token后开始恶化。因此,该公司构建了一个刻意精简的框架:简洁的系统提示(system prompt)、少量核心工具,以及按需加载/卸载的“技能”(skills)而非永久驻留于上下文中。它将Gmail和GitHub等流行连接器从耗费大量token的MCP服务器转换为紧凑的命令行工具,添加了监控任务健康状态的自我验证钩子(self-verification hooks),并强制实施始终开启的操作系统级沙箱(OS-level sandboxing)。若沙箱不可用,该框架将自行禁用,而非在无保护状态下运行工具——这与默认以用户全部权限运行命令的开源框架形成鲜明对比。 Gmail 和 GitHub 从token消耗巨大的 MCP服务器 转换为紧凑的命令行工具,添加了监控任务健康状态的自我验证钩子,并强制实施始终开启的操作系统级沙箱。如果沙箱不可用,该框架将自行禁用,而非在无保护状态下运行工具——这与默认以用户全部权限运行命令的开源框架形成鲜明对比。
Perplexity报告的基准测试结果令人瞩目,尽管这些结果源自公司自身的评估。在其内部 本地知识工作基准测试集(Local Knowledge Work Bench) ——涵盖深度研究、财务分析及文档创建共53项任务,Perplexity表示计划将其开源——Perplexity Computer在DGX Spark上运行Qwen 3.8 27B模型得分为82.6%,而开源Pi框架为77.6%,Hermes运行相同模型则为74.0%。
Perplexity后训练的PPLX 27B将得分提升至85.4%。在更困难的任务上,差距显著扩大:在网页研究基准测试BrowseComp中,Computer准确率达66.7%,而Pi为50.2%,Hermes为43.9%,且Computer所用挂钟时间(wall time)比Pi少51%,token用量少70%;在多模态文档理解任务中,Computer得分为65.1%,Hermes为34.6%,Pi为13.9%。
驱动AI代理从云端转向本地硬件的token经济
当你考虑到AI工作负载的变化时,此次发布的战略逻辑就变得清晰起来。聊天(Chat)是突发式的——一个问题、一个回答、结束。而智能体(agents)则不同。
纳德尔(Nader)表示:“对于智能体,你希望它们尽可能始终在线。你希望这些智能体尽可能多地消耗token。”“我们看到的是对token的无尽需求,而这恰恰让本地AI如此出色。正如你在所有这些演示中所见,你并未按token计费,也无需为token付费。因此,这对智能体而言确实是杀手级特性。”
这重新定义了本地硬件的价值主张。一个持续运行数小时、审阅文档、自行验证工作并反复迭代分析的智能体,在云端将产生巨额API账单;而在用户已拥有的设备上,这些token的边际成本趋近于零。Perplexity的论文明确提出了这一论点的企业级版本:随着智能体在个人工作流乃至整个组织范围内扩展,token消耗与数据传输“将日益难以管控”。本地优先(local-first)执行可同时解决这两方面问题——成本方面,因为推理是免费的;隐私方面,因为敏感token永远不会离开设备边界。
或许最具商业吸引力的结果关乎混合中间地带。在 Terminal Bench 2.1——一项具有挑战性的编程基准测试中,完全本地运行的Qwen模型以几乎为零的边际成本取得了59.6%的分数。若允许其升级至云端的Claude Opus 5‘顾问’模型,则分数提升至73.0%,每项任务预估成本为0.415美元。仅单独运行前沿模型则得分为82.4%,每项任务成本为0.65美元。换言之,升级策略以约三分之二的成本挽回了约五分之三的前沿性能差距;而用户可自主决定该权衡是否值得。在任何顾问调用之前,运行框架会先对传出上下文执行PII(个人身份信息)分类,并向用户精确展示哪些内容将离开设备。远程模型仅返回文本指导;它从不接触本地文件或工具。
Portable Computer与Ollama及DIY本地AI技术栈之间的定位关系
《The Deep View》的杰森·海纳(Jason Hiner) 《The Deep View》 就 Portable Computer 与Ollama等现有本地推理工具的关系,向两家公司提出质询。内特(Nate)的回答划出了一条清晰界限:这些工具解决的是问题的不同层级。
他表示:“此处大部分努力集中在智能体运行框架(agent harness)层面”,并指出该系统底层使用vLLM托管模型推理,同时为希望接入自有推理端点的用户提供高级模式。“我们已对正在使用的Qwen和Nemotron模型进行了大量后训练,以真正获得最佳可能结果……我们的重点在于自上而下全面打磨整个技术栈,包括模型推理与运行框架本身。”
纳德尔的表述更为生动:“仅在Spark上快速启动推理——这条路很顺畅。你可以使用Ollama,也能轻松完成设置。但一旦开始执行更复杂、更具智能体特性的任务,你突然就需要更高性能。你开始关注不同模型,开始关注不同运行框架,这就如同海洋一般:越往深处去,就越深不可测。”
这种类家电式(appliance-like)的产品定位似乎至少打动了一位与会者。本(Ben)自称身为工程师却仍难以成功配置自己的DGX Spark——“这种体验太糟糕了,我们必须解决它”——并表示该产品正是“人们真正感受并理解‘智能体’含义所需的解锁钥匙,而你需要正确的用户体验(UX)来实现这一点。”英伟达还强调该硬件具备可扩展性:两台Spark通过共享内存互联即可运行DeepSeek最新版等前沿开源模型;四台Spark则可运行GLM 5.2或Nemotron Ultra。纳德尔称:“我甚至见过八台Spark相互连接。”
不断深化的英伟达-Perplexity联盟对双方意味着什么
此次发布延续了一项已持续逾一年的合作关系。2025年6月, 英伟达与Perplexity宣布开展合作 ,旨在为欧洲出版商和电信公司提供主权AI(sovereign AI)模型,这也是首席执行官黄仁勋(Jensen Huang)在欧洲大陆巡回推广活动的一部分;据美联社(Associated Press)在巴黎VivaTech展会报道,其目标是说服各国政府相信,“每个国家都需要一套国家级智能基础设施。”主权AI这一主张——即数据“属于你的人民、你的国家、你的文化”,按黄仁勋的说法——其哲学内核与Portable Computer在单张办公桌尺度上提出的主张完全一致:由你掌控的智能,运行于你拥有的硬件之上。
双方均存在符合自身利益的逻辑。Perplexity在持续攀升的估值下完成多轮融资,但同时也面临出版商因其内容实践而施加的法律压力——包括 《纽约时报》(The New York Times) 于2025年12月提起的诉讼,以及早前与 《福布斯》(Forbes) 发生的公开争议——由此获得一款经济模式不依赖于逐token计量的产品,并在法律、医疗和金融等对隐私高度敏感的企业市场中开辟差异化切入点。英伟达则获得DGX Spark的杀手级应用;而据周一简报会与会者承认,这款设备目前“买起来容易,用起来难”。当一名记者询问Spark是否会预装Portable Computer及Nemotron模型发货时,纳德尔未予否定但亦未确认:“那会很酷……目标只是确保每位用户的体验都极为顺畅。” DGX Spark,一款据周一简报会与会者承认、比购买更难使用的设备。当一名记者询问Spark是否会预装便携式计算机和Nemotron模型时,纳德尔未予确认,但也未排除这种可能:“那会很酷……目标只是确保每位用户都能获得极为顺畅的体验。”
仍有若干问题待解。Perplexity最亮眼的数据来自其内部基准测试,且该公司承认,紧凑型模型在高难度推理任务上仍显著落后于前沿水平——顾问升级“缩小但未能完全弥合这一差距”。当前发布版本仅支持Linux系统,24GB显存的门槛排除了绝大多数消费级PC,而作为最热衷本地AI实验群体之一的Apple硅芯片(Apple silicon)则明显缺席路线图。“我们目前高度聚焦于英伟达硬件,”当被问及时,内特(Nate)表示。
但演进方向毋庸置疑。Perplexity研究人员将此次发布描述为“更广泛转变的一部分,即能力日益增强的智能体正从远程基础设施转向个人及本地设备”;两家公司均押注芯片与开源模型的进步将持续拓展一张办公桌上设备所能实现的功能边界。在周一的演示中,最具启示性的细节并非某项基准测试分数——而是屏幕右下角那个静止不动、始终停留在零的信用计数器(credit counter),而此时智能体正高速处理一整文件夹的税务文件。两年来,AI行业一直以千兆瓦(gigawatts)和每美元token数来衡量自身雄心;Portable Computer则提出一种不同的计量方式——一种永不运转的计量方式。
JOTO 企业落地观察
- 对企业部署而言,该方案首次将企业级AI智能体工作流(如财务文档审阅、转化漏斗分析)完整迁移至本地硬件,规避云端API账单与数据出境风险,为金融、法律等强监管行业提供可审计、可控制的FDE落地路径。
- 对智能体工程而言,Perplexity证明协同设计模型与精简代理框架(如按需加载技能、OS级沙箱、紧凑CLI连接器)比通用框架更适配本地小模型,解决了上下文膨胀、工具token开销大、权限失控等长期痛点。
- 对AI安全治理而言,系统强制启用操作系统级沙箱、PII自动识别与用户显式授权机制,且默认禁用无保护工具执行,显著提升本地智能体运行时安全性;其‘沙箱不可用即停用’的设计逻辑,为FDE场景提供了可复用的安全基线范式。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


