摘要:
英伟达近日在IFA 2026期间正式推出Personal AI Router(PAIR)测试版。这是一款免费的开源软件,并非传统意义上的网络硬件路由器,而是面向本地AI推理的“虚拟路由器”,能够自动发现同一局域网中的兼容电脑,将多台设备的闲置计算能力组织起来,为AI代理和本地大模型任务提供更加充足的推理资源。
英伟达公布的一项五子代理演示也体现了这种方式的效果。在使用Hermes Desktop和Ollama的情况下,一个由三台设备组成的PAIR集群完成任务耗时8分48秒,而单台RTX Spark笔记本则需要18分钟。英伟达认为,这说明将家庭网络中多个设备的空闲计算能力利用起来,可以明显提升本地多任务AI的吞吐能力。
PAIR背后的一个重要判断是,家庭用户往往已经拥有多台具备一定计算能力的电脑,只是这些设备的大部分时间处于闲置状态。英伟达援引的数据指出,美国超过一半的家庭拥有两台或更多电脑,因此大量GPU和其他计算资源在一天中的相当一部分时间里并没有被充分利用。对于拥有游戏电脑、笔记本电脑以及其他高性能设备的家庭来说,PAIR试图把这些原本相互独立的设备转变为一个能够共同服务本地AI的计算资源池。
英伟达技术团队甚至估算,在一个极端情况下,一户家庭内部可能存在约165 TFLOPS的闲置计算能力。相关负责人将这些尚未被充分利用的本地算力形容为“家中闲置的免费Token资源”。不过,英伟达预计真正适合PAIR的典型用户并不需要拥有如此夸张的设备规模,更现实的配置可能是一台MacBook或Windows笔记本,再加上一台游戏PC。
除了PAIR之外,英伟达此次还宣布进一步简化本地AI代理的部署体验,包括Perplexity Portable Computer、Hermes Agent和OpenClaw在内的三款AI代理软件都将针对NVIDIA GPU提供更加简单的本地配置方式。过去,用户往往需要自行选择模型、寻找兼容的推理服务器、调整量化参数并完成各种配置,而新的方案希望将这一过程压缩为几次点击。
其中,Perplexity Portable Computer此前已经可以在配备至少24GB显存的NVIDIA RTX GPU以及Linux系统上的DGX Spark上运行,Windows版本也正在推进。它允许用户将更多工作流保留在本地,并在需要额外搜索或更强推理能力时再选择使用云端模型;在将内容交给云端之前,系统会征得用户同意。
Hermes Agent由Nous Research开发,是一款通用型AI代理。Windows版本的本地配置将支持一键完成模型部署,软件可以自动识别NVIDIA GPU,并根据硬件选择合适的模型和配置,通过集成了NVIDIA优化的llama.cpp运行。Linux支持则将在后续推出。Hermes运行后可以调用工具、跨任务保持上下文、记忆不同会话的信息,并随着使用积累可复用的技能。
OpenClaw同样获得了针对Windows的简化部署方案。英伟达称,OpenClaw已经成为开放式AI代理生态中的重要项目,GitHub上的项目规模已经超过38万颗Star。新的Windows应用将降低本地模型配置门槛,使拥有至少24GB显存NVIDIA RTX GPU的用户更容易启动本地AI助手。
为了进一步提升本地AI代理的响应速度,英伟达还同步公布了针对llama.cpp和vLLM的推理优化。基于新的内核优化、更先进的投机解码以及更快的prefill处理,llama.cpp在GeForce RTX 5090上的吞吐量最高可提升至原来的1.9倍;vLLM在RTX PRO 6000 Blackwell Workstation Edition上的性能提升可达1.2倍,在两台DGX Spark组成的集群上最高可达1.4倍。这些优化已经可以通过相应推理后端使用,同时也能够在LM Studio和Ollama中获得。
英伟达此次还透露,搭载RTX Spark平台的新型Windows小型AI电脑预计将在10月陆续上市。随着这些面向本地AI的硬件、推理软件以及AI代理工具逐渐成熟,英伟达显然正在推动一种不同于传统云端AI的使用方式:用户无需把所有任务提交给远程数据中心,而是可以直接利用家中的GPU和其他设备构建属于自己的本地AI计算环境。
PAIR目前仍处于Beta阶段,项目已经以开源形式发布,开发者可以查看源代码、提交问题并参与改进。英伟达希望通过PAIR让本地AI从“单台高性能电脑运行一个模型”逐渐走向“多台家庭设备共同承担AI工作负载”,而这也可能成为本地AI代理进一步普及之后的一种新型计算模式。
评论