NVIDIA выпустила PAIR — open-source роутер, который распределяет запросы локальных ИИ-агентов между несколькими компьютерами в домашней сети. Один агент с субагентами получает вычислительный пул без облака, при этом видеокарты каждой машины остаются независимыми.
Локальный ИИ-агент на одном компьютере работает хорошо, пока задача занимает одну модель за раз. Стоит добавить мультиагентную схему, где основной агент раскидывает независимые подзадачи по субагентам, как десятки вызовов модели выстраиваются в очередь на одну видеокарту. При этом рядом может стоять второй компьютер, который простаивает.
Роутер, а не новый движок
3 сентября 2026 года NVIDIA представила PAIR (Personal AI Router). Это не новый способ запускать модели — Ollama или LM Studio по-прежнему выполняют их на конкретной машине. PAIR встаёт между агентом и движком: принимает запрос через привычный интерфейс, находит свободный узел в сети и возвращает ответ так, будто агент разговаривал с одним локальным сервером.
Установка требует минимальных изменений. PAIR проксирует стандартные порты Ollama и LM Studio, поэтому агентский каркас не нужно адаптировать под новый API. Поддерживаются видеокарты GeForce RTX 20-й серии и новее, профессиональные RTX PRO на архитектуре Turing и выше, системы DGX Spark, а также компьютеры Apple с чипом M4 или новее. Работает на Windows, macOS и Linux.
Кластер собирается без выделенного сервера. PAIR находит соседние машины через mDNS, новый узел можно добавить по IP. Доверие устанавливается шестизначным PIN-кодом, после чего трафик между узлами шифруется через mTLS с генерируемыми сертификатами. Узел может временно выходить из пула — например, когда ноутбук уходит в сон или видеокарта занята игрой — и возвращаться, когда снова готов.
Как PAIR решает, куда отправить запрос
При каждом вызове роутер проверяет несколько условий: онлайн ли узел, включён ли нужный движок, есть ли там точно та модель, которую запросил агент, свободна ли сейчас видеокарта и не загружена ли она другой задачей. Модели на разных машинах могут отличаться — PAIR направляет запрос туда, где нужная модель установлена.
NVIDIA показывает работу на примере пяти субагентов внутри Hermes Desktop: ведущий агент анализирует домашнюю почту и составляет план дел, а пять субагентов параллельно проверяют разные части доказательств. На одном ноутбуке с DGX Spark такая задача занимала в среднем 18 минут. Кластер из трёх устройств — DGX Spark, ноутбука с RTX и рабочей станции с RTX 5090 — справился за 8 минут 48 секунд. Компания прямо оговаривает, что это неформальная демонстрация на конкретной конфигурации, а не бенчмарк и не обещание линейного масштабирования.
Практический смысл
Главный сценарий — не экономия времени на одиночном запросе, а параллелизм. Мультиагентная система, где один агент поручает подзадачи нескольким субагентам, создаёт пакет независимых вызовов модели. Без PAIR они стоят в очереди к одной видеокарте, с PAIR часть уходит на другие машины в сети. Основной компьютер при этом остаётся свободным для интерактивной работы.
Есть и второй сценарий: несколько одновременных сессий. Если сначала запустить агента для исследования, а затем открыть второго для кода, обычно их запросы разделяют одну видеокарту. PAIR умеет раскладывать их по разным узлам.
Для домашней сети это смещает границу локального ИИ. Раньше мультимашинный запуск требовал ручной маршрутизации; здесь NVIDIA предлагает готовый инструмент, который агент воспринимает как один сервер.
Где заканчиваются возможности
Важная оговорка: PAIR не объединяет видеокарты в один большой ускоритель. Запрос назначается ровно одной машине и выполняется там целиком. Память GPU не суммируется, модель не делится между узлами, один вызов не распараллеливается на несколько компьютеров. Поэтому задача с одной длинной цепочкой рассуждений выигрыша почти не получит.
Другое ограничение — статус продукта. На момент публикации это бета-версия 0.1.1. Поддержка только двух движков, Ollama и LM Studio. Если модель загружена на одном узле, запросы к ней будут идти туда даже когда остальные машины свободны. Домашний кластер также требует, чтобы нужные модели регулярно синхронизировались или чтобы агент работал с тем набором, который действительно есть на нескольких машинах.
Кому стоит попробовать
PAIR имеет смысл проверять тем, у кого уже есть два-три совместимых устройства и локальный агент с параллельными задачами. Практический тест простой: взять повторяющийся мультиагентный сценарий, замерить время его выполнения на одной машине, затем добавить второй узел и сравнить сквозное время до результата, а не скорость отдельного вызова. Если задачу нельзя разложить на независимые части, кластер не поможет.
Итог выше уровня одного релиза
PAIR интересен не столько как утилита, сколько как признак: у локальных ИИ-агентов начинает появляться собственная вычислительная инфраструктура, не требующая облака. NVIDIA подчёркивает, что это открытый проект, и предлагает разработчикам смотреть код и предлагать улучшения. Если домашние агенты продолжат усложняться, роутер вроде PAIR может стать таким же стандартным элементом локальной сети, каким сегодня является NAS или медиасервер.
Ссылки
Ссылки
- Сайт: NVIDIA Personal AI Router
- Репозиторий: NVIDIA/Personal-AI-Router
- Документация: NVIDIA Technical Blog