英伟达把家里闲置的 Mac 和 PC 连成一个推理池:PAIR 开源 beta 发布,但它不合并显存

9 月 3 日 IFA 期间,英伟达发布 Personal AI Router(PAIR)beta,一个免费的开源软件(Apache-2.0,Go 编写,仓库在 NVIDIA/Personal-AI-Router)。它本身不是推理引擎:复用各台机器上已装好的 Ollama 或 LM Studio,对外暴露 Ollama 兼容和 OpenAI 兼容的代理端点,现有 agent 不用改任何配置;节点靠 mDNS 局域网发现或手填 IP,配对用六位码,节点间通信走 mTLS。英伟达明确说了它不做什么:不把多块 GPU 合成一块、不池化显存,也不能把一次推理请求拆到多台机器上跑。支持 RTX 20 系及更新、Turing 起的 RTX PRO、DGX Spark 和 Apple M4 及以上芯片,Windows / macOS / Linux 都有。

它是个路由器,不是引擎

英伟达自己的说法是「虚拟推理路由器」,这个定语值得当真。PAIR 不带模型,也不带 kernel,跑模型的还是你机器上那份 Ollama 或 LM Studio;它做的事是发现同一局域网里还有哪些机器能干活、把整条请求整个派给其中一台、再把结果还给发起方。 调度依据是四项:节点在不在线、推理引擎起没起、这个模型在那台机器上是否已经落盘、GPU 眼下占用多少。因为对外的端点分别兼容 Ollama 和 OpenAI 接口,agent 侧不用改代码——决定「做什么」的还是 agent,PAIR 只决定「在哪台机器上做」。有人开始在那台机器上打游戏,它就退出可用池。 安全上是两段:先用六位码人工确认配对,之后节点之间用生成的证书走 mTLS,提示词和上下文不出局域网。仓库是 Apache-2.0,用 Go 写的,Windows、macOS、Linux 都有图形界面和终端两种用法,最低 8GB 内存、建议留 20GB 存储。

演示里那个 2 倍,有多少来自「分发」

IFA 上的对照是这样的:用 Hermes Desktop 加 Ollama 跑一个五子 agent 的工作流,三台设备组成的 PAIR 集群用了 8 分 48 秒,单台 RTX Spark 笔记本要 18 分钟。 数字本身没问题,但对照组只有一个,而且英伟达没有公布另外两台机器的配置。所以这两倍里有多少来自「请求被分发了」、有多少只是「池子里多进来一台更快的机器」,从公开信息里看不出来。想照着评估的人最好自己搭三台再测一遍。

什么情况下值得装

先排除一类需求:它不会让你跑更大的模型。显存不够跑 70B,接三台机器还是跑不了——PAIR 增加的是能同时处理的请求数,不是单次请求的上限。 真正对得上的是子 agent 并行这类形态:一个主 agent 拆出五六个子任务,每个子任务都是一次独立的小模型调用,这时候多几台机器是实打实的吞吐。家里或小办公室有两三台带独显的机器、平时白天闲着,且已经在用 Ollama 或 LM Studio 的人,装它的成本基本是零。只有一台机器,或者主要需求是把一个大模型跑起来,这东西帮不上忙。 目前 Perplexity Portable Computer、Hermes Agent 和 OpenClaw 已经做了 Windows 上的简化安装。beta 阶段,别急着放进生产链路。

via: NVIDIA 技术博客PAIR 产品页与 FAQGitHub: NVIDIA/Personal-AI-RouterThe New Stack 报道Neowin 报道