云端起头、遇到敏感信息就交给本地模型:Perplexity 在 Mac 上做了个混合推理编排器

Perplexity 于 9 月 1 日在 Mac 上推出 Hybrid Compute:一个任务里,最难的推理、检索和规划仍在云端,遇到涉及敏感信息的步骤时中途交给跑在 Apple 芯片上的本地模型,用户不需要切模式、重启任务或自己管交接。判断由一个本地运行的 Privacy Gate 完成,它识别姓名、地址、账号、密钥等,给出四种处置之一:留在本地、遮蔽敏感片段、拒绝、或询问用户;遮蔽的值出站时替换成占位符、云端回答返回后再还原。首发三个本地模型:Gemma 4 E4B、Qwen3.6 35B-A3B,以及 Perplexity 自己后训练的一个版本。面向 Pro、Max 和企业订阅者,需 macOS 15 以上、至少 24GB 统一内存,官方建议 32GB。

方向是「云端往下调」,和上周那个反过来

这里有个容易搞混的地方:Perplexity 上周在 NVIDIA DGX Spark 上推的是 local compute——从用户硬件起头、需要时往上调云端。这次 Mac 上的 Hybrid Compute 方向相反:任务从云端开始,把最重的推理、检索和规划留在那里,只在某一步涉及敏感信息时把它交给本地模型。 关键设计在于「同一个任务里中途切换」,用户不切模式、不重启、也不用自己管交接。另一个副作用是成本:本地推理承担较轻的工作,不消耗 Computer 额度,相关数据也留在 Mac 上。

Privacy Gate 是这套东西的核心

真正决定这个方案成不成立的不是本地模型有多强,而是那个判断器准不准。Perplexity 训练了一个在本地运行的 Privacy Gate,用来识别姓名、地址、账号、密钥这类敏感信息,命中后给出四种处置之一:留在本地、遮蔽敏感片段、拒绝、或询问用户是否同意;凭据、支付卡号和政府证件号走最严格的一档。被遮蔽的值在出站时换成占位符,云端答案回来后再还原。 值得一提的是这个分类器被开源了:PII-Tracer 是一个 0.6B 的双向编码器,从 Qwen3 骨干改造而来。对做同类隐私分流的团队,这比产品本身更有参考价值——它把「什么算敏感」这个判断做成了一个可以被检查和替换的独立组件,而不是藏在提示词里的一段规则。

门槛和边界

需要 Pro、Max 或企业订阅,任一 Apple 芯片的 Mac、macOS 15 以上、至少 24GB 统一内存,官方称 32GB 效果最好。不需要装 Ollama 或手工配置运行时。任务跑起来后,应用里会显示本地的 CPU、GPU、内存占用和消耗的 token 数。 首发三个本地模型:Gemma 4 E4B、Qwen3.6 35B-A3B,以及第三个——Perplexity 自己对 Qwen3.6 35B 做后训练的版本,后续还会加。产品页的引导流程指向一键下载 PPLX Qwen 3.8 27B,Perplexity 的 Hugging Face 组织下有对应构建。 对读者的实际含义:这是目前少数把「哪些数据不出本机」做成产品内可见机制、而不是一句隐私承诺的方案。要评估的话,值得重点测的是 Privacy Gate 的误报和漏报——漏报意味着敏感内容照样上云,误报则会把本该云端处理的步骤压到本地模型上,直接影响结果质量。这两类错误的实际比例,官方没有公布数字。

via: Perplexity 官方博客Perplexity 产品页MarkTechPostThe New Stack