NVIDIA发布PAIR虚拟推理路由器:聚合家庭局域网内的GPU算力,缓解多智能体推理瓶颈
NVIDIA Personal AI Router(PAIR)测试版可将独立的推理请求路由到本地网络中的可用系统,支持Ollama和LM Studio,且无需更改智能体框架。
AI解读:当用户在本地运行多个AI智能体或一个主智能体分解出多个子任务时,所有推理请求往往挤在同一台电脑的GPU上,导致排队等待、主电脑被占满。NVIDIA此次发布的PAIR是一个"路由器",它装在家里的每台设备上,能自动发现局域网内已配对的其他电脑,并根据哪台设备有空闲、装了哪个模型、当前负载如何,把一个个独立的推理请求派发到最合适的机器上执行。最大的意义在于"零改造":智能体仍然以为自己在跟原来的Ollama或LM Studio通信,PAIR只改变请求真正去向哪儿,所以用户不用改任何代码。以官方演示为例,同样的五个子智能体任务,单台RTX Spark笔记本平均要18分钟,而用户实际搭建的三设备PAIR集群(含RTX Spark、DGX Spark和RTX 5090)平均8分48秒就能完成。需要注意:这只是非正式的、特定配置的测试,不是普适基准,实际提升取决于任务本身有多少可并行的小请求。对于普通用户,可先将模型和引擎备好几份,再在几台设备上装上PAIR,观察后台的任务记录就能确认推理是否真的分到了多台机器。
NVIDIA在官方技术博客上宣布推出NVIDIA Personal AI Router(PAIR)测试版,这是一个在本地网络内进行推理调度的虚拟路由器,能够将多个智能体产生的独立推理请求分发到家中的其他可用设备上。该软件并非新的推理引擎,模型仍由目标机器上的Ollama或LM Studio负责执行,用户无需修改智能体框架。PAIR测试版支持Windows、macOS和Linux系统,兼容NVIDIA GeForce RTX 20系列及以上GPU、NVIDIA RTX PRO工作站GPU(Turing架构及更新)、NVIDIA DGX Spark以及Apple M4+芯片。
当多个智能体或多个子智能体同时向单一本地GPU发送推理请求时,系统容易出现瓶颈。PAIR通过mDNS自动发现局域网内已安装PAIR的系统,允许用户进行安全配对,将可用的计算节点加入资源池,并通过代理接管Ollama或LM Studio的默认端口,接收智能体发来的请求,将其分配到合适且就绪的节点上执行,并原路返回响应。同时,PAIR支持弹性客户端——节点可在不使用时下线或休眠,不要求所有系统配置相同或永久在线。
PAIR的调度机制与设备要求
PAIR的调度器在决定将请求发送到哪个节点时,会考虑多项因素:节点是否在线且就绪、所需推理引擎是否启用、是否包含精确请求的模型、节点当前的作业负载,以及GPU利用率(例如是否正在运行图形密集型应用)。PAIR要求每个参与节点运行Ollama或LM Studio之一,如果节点未安装引擎,PAIR可协助安装并启动模型下载,模型无需在集群所有节点上完全相同,不同系统可以承载不同模型,同一模型标签在更多节点上加载会扩大该请求的可调度范围。
PAIR还通过mTLS和生成的证书保护节点间通信,在任何未完成安全配对前,节点间的通信都会被阻止。应用无需集成新的API,PAIR通过代理兼容Ollama和LM Studio接口,支持可配置base URL的应用继续指向原引擎端点。每项推理请求只会被分配给一个节点并全程在该节点上完成,PAIR不支持跨GPU拆分单一模型或合并GPU的VRAM;对于高度串行或只在一台机器上有模型的工作负载,收益可能有限。
演示数据:五子智能体场景下的耗时对比
为了展示PAIR的实际效果,NVIDIA在演示中使用了Hermes Desktop(负责产生子智能体工作负载)和Ollama(负责执行推理)。演示任务是让Hermes分析一个合成的家庭收件箱并生成一份周日的重置计划,Hermes将任务分解给五个专家子智能体,它们分别审查独立证据,最后汇总成统一计划。该演示显示了PAIR如何将推理分配到多个节点。
官方提供的非正式测试数据显示:在一个NVIDIA RTX Spark笔记本上单独运行相同的五个子智能体任务,平均耗时18分钟;而使用三设备PAIR集群(包括RTX Spark笔记本、DGX Spark和RTX 5090)时,平均耗时为8分48秒。NVIDIA强调,这只是一个非官方、特定配置的演示,不是通用基准或线性扩展承诺,实际结果取决于工作负载并行度、模型、引擎设置、硬件、网络和节点可用性。
- NVIDIA PAIR项目为开源,开发者可以检查代码、报告问题并贡献改进。
- PAIR提供的作业视图和指标视图能显示每个路由请求由哪个节点处理。