产品NVIDIA Blog·原文 2026年9月4日本站收录 2026年9月5日

NVIDIA于IFA 2026发布PAIR本地AI路由工具,RTX Spark Windows PC十月上市

NVIDIA携多家合作伙伴在IFA 2026上推出多项本地AI更新:全新RTX Spark Windows PC定于十月发售,同时发布免费开源工具PAIR,可跨本地网络PC分配AI推理任务。

AI解读:NVIDIA在IFA 2026上宣布了一系列本地AI更新,核心是解决个人电脑运行AI智能体时算力不足和配置繁琐的问题。新发布的免费开源工具PAIR(Personal AI Router)能自动发现家庭或办公室局域网内的多台PC,把独立的AI推理请求分发给有闲置算力的设备,相当于把多台电脑拼成一个本地算力池。这对拥有多台PC的用户尤其有用,比如当你正在用主力机打游戏或做设计时,可以让另一台闲置电脑去跑AI任务,互不干扰。另一项重要更新是RTX Spark Windows PC将于十月上市,搭载 1 Petaflop算力的RTX Blackwell GPU、最高 128GB统一内存和 20 核Grace CPU,支持本地运行AI智能体。这意味着开发者、创作者和AI爱好者可以在不依赖云端的情况下,运行更复杂、数据更安全的本地模型。需要注意的是,这些工具和优化目前大多处于beta或刚发布阶段,具体效果和兼容性仍有待用户实际测试。

柏林IFA 2026展会上,NVIDIA联合微软及其他合作伙伴宣布多项本地AI更新,包括推出免费的NVIDIA PAIR(Personal AI Router)工具、优化llama.cpp和vLLM推理性能,并确认搭载RTX Spark的Windows PC将于十月发售,首批机型来自联想和宏碁。

NVIDIA PAIR工具:整合局域网内PC算力

NVIDIA PAIR是一款免费、开源的软件工具,能够自动发现本地网络中的兼容PC,并将独立的推理请求路由到有容量的设备上。该工具适配Ollama和LM Studio,可适应设备的加入或离开。PAIR的测试版现已在Windows、macOS和Linux上提供,支持图形和终端界面,兼容NVIDIA GeForce RTX 20系列及以上GPU、RTX PRO工作站GPU(Turing架构及更新)、DGX Spark和Apple M4或更新芯片。

  • NVIDIA表示,超过一半的美国家庭拥有两台或更多PC,其中大部分算力在一天中处于闲置状态。
  • 在代理工作流中,PAIR可将任务拆分为多个子任务,并分配到不同PC上并行运行,减少单一GPU的排队压力。

RTX Spark与本地模型推理性能提升

NVIDIA RTX Spark将推出紧凑型Windows PC,配备 1 Petaflop算力的RTX Blackwell GPU、最高 128GB统一内存和 20 核Grace CPU,支持全天候运行的智能体,并适配Windows Agent框架以增强后台运行安全性。联想已宣布推出Yoga Pro 9n和Yoga 9n二合一设备,宏碁展示了紧凑型RTX Spark概念机,这些机型将于十月发售。

在性能优化方面,llama.cpp在GeForce RTX 5090上实现了最高 1.9 倍的吞吐量提升,通过内核优化和增强的投机解码技术实现;vLLM在RTX PRO 6000 Blackwell工作站版上提升 1.2 倍,在双DGX Spark集群上提升 1.4 倍。此外,FlashInfer中的新XQA注意力内核进行了后端优化,这些改进已可直接使用,也可通过LM Studio和Ollama获取。

  • 在游戏合作方面,艺电(Electronic Arts)、Embark和育碧(Ubisoft)等游戏发行商和开发商将把大作引入RTX Spark,此前COMPUTEX上已有KRAFTON、网易、Riot Games和Xbox宣布支持。

本地智能体应用与模型更新

Hermes Agent(由Nous Research开发)将支持在Windows上的一键本地模型设置,自动检测GPU并选择合适的模型,预集成llama.cpp和NVIDIA推理优化,Linux支持预计稍后提供。

OpenClaw Windows应用简化了在至少 24GB显存的RTX GPU上设置优化本地模型的过程。Perplexity Portable Computer现已支持具有 24GB及以上显存的RTX GPU的Linux系统,Windows支持即将推出,用户可以在本地运行完整工作流,并可选择将任务升级到云端 15 种前沿模型。

多个新模型发布:Nemotron 3.5 Lightning(30B参数)可在RTX PC上运行;Z.ai的GLM-5.3-Flash面向DGX Station;Qwen的Qwen3.8-Flash-Next和Qwen3.8-27B兼容DGX系统;LTX的LTX 2.5视频生成模型支持本地运行;MiniMax-H3支持本地视频生成;Meta的Muse Glimmer(30B参数)面向编码和智能体工作负载;DeepSeek v4 Flash(284B参数MoE,13B激活参数)可在双DGX Spark集群上运行。

  • NVIDIA还发布了NVFP4量化技术,支持在DGX Spark上进行更高效的内存部署。
  • CyberLink的PhotoDirector AI PC模式将于十月随RTX Spark推出,支持本地或云端图像处理选择,利用TensorRT-RTX和FP8加速。

信息来源

NVIDIA Blog原始来源