展开目录
#Perplexity#AI Agent#隐私#本地模型#混合推理#Apple Silicon

Perplexity 混合推理发布:让 Mac 成为 AI Agent 的「本地保险箱」,敏感数据不再上云

Perplexity 为 Computer Agent 推出 Hybrid Compute:一次任务由云端 Frontier 模型与 Mac 本地模型接力完成,设备端 Privacy Gate 实时识别敏感信息并就地处理。税务、病历、诉讼材料终于敢交给 Agent 了。

预计阅读 6 分钟

一句话总结

Perplexity 于 9 月 1 日发布 Hybrid Compute(混合推理):Perplexity Computer Agent 的一次任务可以由云端 Frontier 模型与 Mac 本地模型接力完成——设备端的 Privacy Gate 实时识别敏感信息,涉密步骤自动落到本地处理,全程无感切换、不丢上下文、文件不出设备。官方称这是「业界首个混合推理编排器」。


企业不敢用 Agent 的最后一公里:数据出境

过去一年,AI Agent 的能力突飞猛进,但企业落地时始终横着一道坎:要让 Agent 处理合同、病历、财务数据,就得把这些文件交给云端模型。不少公司因此只敢让 Agent 处理公开信息——这等于自废武功。

Perplexity CEO Aravind Srinivas 的解法很直接:既然 Mac 本地已经能跑不错的开源模型,为什么不让 Agent 按步骤决定哪些工作在云端做、哪些在本地做?「Mac 提供了一个巨大机会:把 token 消耗转移到 Apple Silicon——本地消耗的 token 不花钱,还能保护隐私。」

Perplexity Hybrid Compute 流程

怎么工作:云端先想,本地守密

Hybrid Compute 的核心是一个任务内(intra-task)的动态分流机制:

  1. 任务从云端开始:最难的部分——复杂推理、联网搜索、长期规划——先交给云端最强的 Frontier 模型;
  2. Privacy Gate 实时判定:Perplexity 自研的 PII 分类器跑在设备上,逐步骤识别姓名、地址、账号、密钥等敏感信息;
  3. 敏感步骤落到本地:一旦判定某一步涉及敏感数据,该步骤交给 Mac 上的本地模型子代理处理,文件始终不出设备;
  4. 合并输出:云端与本地的工作在同一个任务里无缝衔接,最终返回一个完整结果。

关键在于无感:用户不需要切换模式、不需要重启任务,甚至可以从 iPhone 发起任务、把本地步骤「接力」到自己 Mac 上执行。Perplexity 表示会开源这套 PII 分类器,让隐私路由的安全基础设施接受公开检验。

三种模式的定位差异

Hybrid Compute 并不是 Perplexity 的第一个本地化尝试——一周前它刚为 NVIDIA DGX Spark 发布了 Local Compute(本地优先模式)。两者思路恰好相反:

三种计算模式对比

  • 纯云端:全部推理在云端完成,开箱即用,但敏感数据必须上云;
  • 本地优先(DGX Spark):推理从本机开始,调用云端需要显式授权,适合离线或强隔离场景;
  • 混合推理(Hybrid Compute):云端负责「聪明」,本地负责「保密」,按步骤自动分流——兼顾能力与合规。

首发三款本地模型与硬件门槛

上线之初用户可以在三款本地模型间选择:

首发本地模型

  • Gemma 4 E4B:Google 的开放权重小模型;
  • Qwen3.6 35B-A3B:Perplexity 基于通义千问 Qwen3.6 35B 后训练的版本(MoE 架构,激活参数约 3B);
  • Perplexity 自研本地模型:针对 Mac 统一内存架构调优。

硬件要求不算低:Apple silicon Mac、macOS 15 及以上、统一内存 24GB 起步(官方建议 32GB+)。功能面向 Perplexity Mac 应用的全部用户开放,订阅等级覆盖 Pro、Max 与企业版。这个门槛也划出了当前本地 Agent 的现实边界——想跑「够聪明」的本地模型,仍需要一台高配 Mac。

哪些场景终于敢交给 Agent 了

混合推理最直接的价值,是把一类此前「永远不敢上云」的工作解锁给了 Agent:

典型应用场景

  • 税务申报:云端查最新政策,本地读工资单和抵扣凭证;
  • 医疗场景:病历、检查报告只在 Mac 本地处理;
  • 法律服务:云端检索判例法,客户特权文件不出本地;
  • 投研分析:公开财报走云端,非公开交易数据在本地交叉比对。

Srinivas 的原话是:这打开了「大多数人永远不会交给纯云端 Agent 的工作」——特权法律文件、机密客户数据、病历记录。

意义与局限

意义在于,混合推理把「模型路由」从按请求粒度推进到了按步骤粒度:不是「这个任务用云端还是本地」,而是「任务里每一步用谁」。如果这个模式扩散开,隐私感知的计算编排可能成为企业 Agent 基础设施的标配——苹果在财报电话会上点名 Perplexity,也暗示 Mac 正在成为「Agent 硬件」的新叙事。

局限同样明显:Perplexity 没有详细说明云端与本地之间究竟传递了哪些上下文、本地子代理产出的信息在回流主流程前如何过滤——隐私边界的具体实现细节仍然不透明。加上 24GB 起步的硬件门槛,混合推理目前更像高端 Mac 用户的「隐私套餐」,而非大众功能。

但方向已经很清楚:下一阶段 AI 的竞争,不只比模型聪明,还比谁能守住你的数据。

参考来源:The Verge(2026-09-02)、VentureBeat、Perplexity 官方公告与 CEO 公开声明。数据截至 2026-09-03。

Related

相关文章

延伸阅读

查看全部 →
AI安全

阿莫代伊发文《We Must Pace the Frontier》:Anthropic 单方面承诺「嵌入式评估员」,Altman 说同意,Musk 说 Dario 是对的

2026 年 9 月,Anthropic CEO 达里奥·阿莫代伊发表长文《We Must Pace the Frontier》,首次把「放慢前沿能力进步」提为具体方案:三步走——嵌入式第三方评估员、民主国家内部协调、全球协调,Anthropic 单方面承诺第一步。两件事让他改主意:递归自我改进加速,以及 OpenAI-Hugging Face 的 Agent 蜂群越界事件。Sam Altman 表示同意,Elon Musk 说「Dario 是对的」,也有记者批评这是「监管俘获」。

OpenAI

GPT-6 Astra 需求爆表:OpenAI 暂停 200 美元 Pro 新订阅,Altman 说 2026 年不上市

9 月 3 日发布的 GPT-6 Astra 需求「前所未有」,OpenAI 在 9 月 10 日暂停了 200 美元 ChatGPT Pro 的新订阅——Go、Plus 与 API 不受影响。三天后,Sam Altman 又说「考虑到安全方面正在发生的一切,现在上市是不明智的时机」,被追问是否指 2026 年时回答「不是 2026,对」。一个模型,同时顶住了 OpenAI 的产能与 IPO 时间表。

DeepSeek

DeepSeek-V4.1-Flash 发布:552B 参数只激活 8B,KV 缓存砍到 1/4,Agent 账单降了七成

9 月 10 日,DeepSeek 上线 DeepSeek-V4.1-Flash:552B 参数的 MoE 新架构,输入侧只激活 8B、输出侧 16B,KV 缓存压到上一代的 1/4(HBM)与 1/8(SSD),缓存命中低至 0.003 美元/百万 token。峰值输入价格从 V4-Pro 的 1.32 美元降到 0.30 美元,并发从 500 提到 2,500,官方称已全面超越 V4-Pro。