NVIDIA Personal AI Router объединяет домашние компьютеры в ИИ-кластер для локальных моделей

164 комментарии
NVIDIA выпустила Personal AI Router (PAIR) – бесплатную программу с открытым кодом, которая распределяет запросы к локальным ИИ-моделям между компьютерами в домашней сети и помогает ускорить работу ИИ-агентов

NVIDIA выпустила бета-версию Personal AI Router, сокращённо PAIR – бесплатную программу с открытым исходным кодом, которая объединяет компьютеры в домашней сети в единый ИИ-кластер и распределяет между ними запросы к языковым моделям. Версия 0.1.1 доступна для Windows, macOS и Linux.

Демонстрация работы PAIR: запросы приходят на один компьютер, а выполняются на обоих узлах кластера, у каждого видна загрузка видеокарты и памяти

Потребность в таком инструменте возникла с распространением ИИ-агентов. Ведущий агент может разбивать сложную задачу на части и поручать их нескольким помощникам, поэтому одно задание пользователя на практике превращается в десятки независимых обращений к модели. Если все запросы обрабатывает одна видеокарта, они выстраиваются в очередь, хотя в той же сети в это время может простаивать второй компьютер или ноутбук.

PAIR позволяет распределить эти запросы между свободными машинами. При этом собственного движка для запуска моделей у программы нет: модель по-прежнему обслуживает Ollama или LM Studio на выбранном компьютере, а PAIR определяет, куда направить очередной запрос, и возвращает полученный ответ приложению.

Ограничения NVIDIA Personal AI Router (PAIR)

При этом PAIR не превращает несколько видеокарт в один большой ускоритель. Программа не объединяет видеопамять, не разбивает модель на части и не распределяет один запрос между несколькими компьютерами. Каждый запрос целиком выполняется на одном узле, а выигрыш достигается за счёт параллельной обработки нескольких независимых запросов.

Поэтому последовательные задачи, сценарии с одним длительным обращением к модели и ситуации, когда нужная модель установлена только на одном компьютере, заметного ускорения практически не получат.

Как PAIR распределяет запросы между компьютерами

PAIR нужно установить на каждый компьютер, который должен войти в кластер. Устройства в локальной сети программа обнаруживает автоматически через mDNS, а при необходимости узел можно добавить вручную по IP-адресу. Соединение устанавливается только после подтверждения пользователем: сначала компьютеры необходимо сопрячь, и лишь после этого они смогут обмениваться данными. Связь защищена взаимной аутентификацией mTLS с автоматически созданными сертификатами, а до установления доверенного соединения обмен данными между узлами блокируется.

Сопряжение узлов в PAIR: слева шестизначный PIN на приглашающем компьютере, справа окно приглашения в кластер на втором Сопряжение подтверждается шестизначным кодом: приглашающий компьютер показывает PIN, а на втором его нужно ввести. Изображение: NVIDIA

На каждом узле должен быть запущен поддерживаемый движок – Ollama или LM Studio. PAIR может помочь установить их и загрузить модели на сопряжённые компьютеры. Конкретный узел участвует в обработке запроса только в том случае, если на нём запущен нужный движок и доступна запрошенная модель. При этом хранить одинаковый набор моделей на всех компьютерах не требуется: на разных узлах могут находиться разные модели, а PAIR учитывает их расположение при распределении запросов.

Переписывать приложения или агентов для работы с PAIR не требуется – на этом построена основная идея проекта. Программа занимает стандартный порт Ollama или LM Studio и выступает для приложения в роли привычного сервера. Поэтому агент продолжает отправлять запросы по тому же адресу и видит одно подключение. Если приложение использует другой порт, его можно указать в настройках прокси. Затем PAIR определяет, какой движок и какая модель нужны для запроса, и передаёт эту информацию планировщику.

Планировщик проверяет сопряжённые компьютеры и учитывает сразу несколько факторов: доступен ли узел и готов ли он принимать задания, запущен ли нужный движок, установлена ли требуемая модель, сколько запросов уже обрабатывается и насколько загружена видеокарта – например, не запущена ли на ней игра или ресурсоёмкое приложение. После этого выбирается один подходящий узел, который полностью выполняет запрос, а результат через PAIR возвращается исходному приложению. Посмотреть, куда было направлено каждое задание, можно в соответствующем разделе интерфейса и в метриках.

Окно PAIR: слева список заданий с указанием, откуда пришёл запрос и на каком узле он выполняется, справа два сопряжённых компьютера с переключателями Ollama и LM Studio Раздел «Обзор»: слева показано, откуда пришло каждое задание и на каком компьютере оно выполняется, справа – два узла кластера. Изображение: NVIDIA

NVIDIA отдельно отмечает, что домашний кластер работает в условиях, далёких от дата-центра. Игровой компьютер в любой момент может понадобиться для игры, ноутбук – перейти в спящий режим или покинуть сеть, а Ollama или LM Studio – остановиться. PAIR рассчитан на такие ситуации и просто исключает временно недоступные компьютеры из списка кандидатов на выполнение заданий.

Как PAIR показал себя в демонстрации NVIDIA

В качестве примера NVIDIA использовала Hermes Desktop. Агент анализировал синтетический почтовый ящик и составлял план дел, распределяя работу между пятью помощниками. Для обработки запросов использовалась модель Qwen 3.6 35B A3B, запущенная через Ollama.

На одном ноутбуке RTX Spark выполнение задачи занимало в среднем 18 минут. Кластер из трёх устройств – ноутбука RTX Spark, DGX Spark и настольного компьютера с GeForce RTX 5090 – справлялся с ней в среднем за 8 минут 48 секунд.

Оригинал видео – на канале NVIDIA Developer в YouTube

NVIDIA подчёркивает, что это не полноценный тест производительности, а демонстрация работы PAIR на конкретной конфигурации. Результат зависит от того, насколько хорошо задача поддаётся распараллеливанию, а также от выбранной модели, настроек движка, оборудования, скорости сети и доступности узлов. Поэтому линейного прироста производительности при добавлении новых компьютеров компания не обещает.

Системные требования и загрузка

В список конфигураций, на которых NVIDIA проверяла PAIR, входят компьютеры с видеокартами GeForce RTX серии 20 и новее, профессиональными NVIDIA RTX PRO на архитектуре Turing и новее, системы NVIDIA DGX Spark с чипом GB10, а также компьютеры Apple с чипами M4 и новее. Для работы программы требуется не менее 8 ГБ оперативной памяти, а на диске рекомендуется иметь 20 ГБ свободного места. Постоянное подключение к интернету не требуется – оно нужно только для загрузки моделей.

При этом требования к видеокарте определяет не столько сам PAIR, сколько используемый движок. В репозитории проекта отдельно отмечается: если PAIR запускается на компьютере, это ещё не означает, что на нём сможет работать Ollama или LM Studio. Сам маршрутизатор можно запустить на любом поддерживаемом компьютере, тогда как требования к операционной системе, видеокарте и драйверам устанавливает выбранный движок. Кроме того, для запуска модели должно хватать доступной памяти. Поэтому узел рассматривается как кандидат на обработку запроса только в том случае, если на нём действительно работает совместимый движок.

PAIR поддерживает Windows 11, Linux и macOS, причём компьютеры с разными операционными системами можно объединять в один кластер. Версии для x64 и arm64 доступны для всех трёх платформ, хотя Windows на Arm разработчики пока называют экспериментальной. Готовые установщики распространяются в форматах .exe, .deb и .dmg, а для других дистрибутивов Linux программу можно собрать из исходного кода. Помимо совместимого с Ollama интерфейса, PAIR предоставляет точку входа в формате OpenAI API, поэтому поддерживающие его приложения также можно подключать привычным способом. Проект распространяется по лицензии Apache 2.0.

Диалог установки движков в PAIR: идёт загрузка Ollama с отображением хода установки Ollama и LM Studio можно установить непосредственно из PAIR – заранее настраивать движки не обязательно. Изображение: NVIDIA

Версия установщика для 64-разрядной Windows занимает около 146 МБ. Скачать бета-версию можно на сайте NVIDIA, а исходный код опубликован на GitHub. Разработчики могут изучать реализацию проекта, сообщать об ошибках и предлагать изменения в механизмах обнаружения и сопряжения узлов, маршрутизации запросов и интерфейсе.

Скачать NVIDIA Personal AI Router (PAIR)

Промпты, файлы и контекст агента остаются внутри домашней сети – PAIR не отправляет их в облако. Разработчики уточняют, что это верно, пока локальны все звенья: приложение, движок, источник моделей и сами узлы.

Автор:
Комментарии и отзывы

Нашли ошибку?

Новое на сайте