📖 产品简介
NVIDIA PAIR(Personal AI Router,个人 AI 路由器)是 NVIDIA 于 2026 年 9 月 3 日在 IFA 随本地 AI 推送发布的免费开源工具(beta v0.1.1,Apache-2.0)。
它不是新的推理引擎,而是位于 Ollama / LM Studio 之前的虚拟推理路由器:通过 mDNS 发现局域网内兼容设备,经 MTLS 加密安全配对,将每个独立的推理请求路由到当前有空闲算力的节点(RTX 20 及以上、RTX PRO、DGX Spark、Apple M4+ Mac),无需改动任何 Agent harness——应用仍指向熟悉的 Ollama/LM Studio 接口。PAIR 解决的是多 Agent / 多子 Agent 并行时的本地推理瓶颈:官方演示中 Hermes Desktop 用 5 个子 Agent 跑 Qwen 3.6 35B,单台 RTX Spark 笔记本约 18 分钟,三台(RTX Spark + DGX Spark + RTX 5090)集群约 8 分 48 秒,提速逾 50%。其采用「工作负载级并发」而非显存池化——不合并 GPU、不跨机分片单个模型;支持 Windows/macOS/Linux(x64/arm64,Windows on ARM 实验性),无 GPU 的节点也可加入仅做路由。NVIDIA 估计空闲算力达 60% 利用率时每月可省约 $1,200 云 API 费用(含约 $120 电费)。
定位
NVIDIA PAIR(Personal AI Router)2026-09-03 发布
适合人群
本地多设备 AI 玩家
跑多 Agent/多子 Agent 的开发者
注重数据隐私的本地推理
Ollama/LM Studio 用户
支持平台
Windows 11、Linux、macOS
开源
是 · GitHub
✨ 核心功能
- 本地推理路由:把家中多台 RTX/DGX Spark/Mac 组成本地 AI 集群,单一端点
- 不改 harness:代理 Ollama/LM Studio 接口,Agent 无需新 API
- 安全配对:mDNS 发现 + MTLS 加密 + 实时调度(节点就绪/引擎/模型/GPU 利用率)
- 多 Agent 提速:5 子 Agent 演示 18 分钟 → 8 分 48 秒(提速 >50%)
- 免费开源:Apache-2.0,支持 Windows/macOS/Linux
⚖️ 优缺点分析
👍 优点
- 免费开源、零配置组本地集群
- 不改动现有 Agent 工作流
- 数据全程留本地网络
- 缓解多 Agent 推理瓶颈
👎 缺点
- 不合并显存、不跨机分片单模型(单大模型无收益)
- 提速非线性的、依赖工作负载并行度
- beta 早期、稳定性待社区验证
📊 评分详情
功能完整
8
易用程度
8.5
安全可靠
8.5
性价比
9
💬 用户评价
PAIR 把家里闲置的显卡凑成集群,Agent 多子任务并行直接快一半,还是本地免费开源,香。
📝 更新日志
-
2026-09-03PAIR beta 发布**NVIDIA PAIR beta 发布(9/3 IFA)**——免费开源(Apache-2.0)的本地推理路由器,代理 Ollama/LM Studio 接口,将局域网内 RTX 20+/RTX PRO/DGX Spark/Apple M4+ Mac 组成本地 AI 集群,按节点就绪度/GPU 利用率调度独立推理请求,缓解多 Agent 并行瓶颈(官方 5 子 Agent 演示 18 分钟→8 分 48 秒,提速 >50%)。不合并显存、不跨机分片单模型;数据留本地网络。来源:NVIDIA 技术博客 / GCN / BestHub。