Назад в ленту

Perplexity Portable Computer: локальный ИИ-агент на Nvidia RTX и DGX Spark без счетов за токены

Компания Perplexity AI совместно с Nvidia запускает Portable Computer — версию своей агентной платформы, которая целиком работает на вашем железе, не сжигая облачные кредиты.

Perplexity AI представила Portable Computer: локальный ИИ для Nvidia RTX и DGX Spark

Perplexity AI официально запускает Portable Computer — вариант своей агентной платформы «Computer», которая целиком работает на оборудовании пользователя. Список поддерживаемых систем открывают настольный суперкомпьютер Nvidia DGX Spark и Linux-машины с видеокартами Nvidia RTX. Разработка велась в тесном партнерстве с Nvidia, и это, пожалуй, самая смелая попытка перетащить серьезные агентные ИИ-нагрузки из облака на локальные устройства.

Модель, пользовательские файлы и результаты работы остаются на машине. Локальные операции не сжигают биллинговые кредиты, а каждая задача по умолчанию стартует на устройстве. Если системе нужно отправить отдельный шаг в более мощную фронтирную модель в облаке, она всегда спрашивает разрешения.

«Мы перенесли тот же самый интерфейс в полностью локальное приложение, — пояснил на брифинге Нейт, вице-президент Perplexity по инфраструктуре и корпоративным решениям. — Здесь собрана вся агентная обвязка, инференс и все, что нужно для работы локально».

Для Nvidia, которая последние два года продает миру дата-центры на триллионы долларов, этот анонс означает нечто более тонкое, но стратегически важное: чипмейкер уверен, что локальный ИИ перешагнул порог от хобби энтузиастов к практическому инструменту. И Nvidia хочет продавать железо, на котором этот инструмент работает.

«Локальный ИИ достиг переломного момента, — считает Нейдер, директор по технологиям разработки в Nvidia, отвечающий за инструменты для разработчиков и открытый код. — Долгое время это были хоббисты и энтузиасты, которые запускали квантованные модели, ужатые до крошечных размеров. Это круто, но не очень практично. Однако все изменилось с появлением множества новых открытых моделей, которые оказались по-настоящему полезными».

Как Portable Computer упаковывает полный локальный ИИ-стек в одно приложение

Perplexity Computer — агентная платформа для интеллектуальной работы — оркестрирует модели, файлы, инструменты и веб-доступ для выполнения многошаговых задач: ревью папок с документами, анализ данных, подготовку отчетов и отправку результатов в бизнес-системы. Portable Computer воспроизводит этот опыт локально: локальные модели, агентная обвязка, инференс-движок, инструменты, коннекторы приложений и защитная песочница упакованы в единую систему.

Именно в этом суть. В большинстве локальных ИИ-стеков сегодня пользователю приходится собирать и настраивать эти компоненты по отдельности: скачивать веса моделей, поднимать инференс-сервер, связывать инструменты и заниматься тюнингом производительности. «Исторически поднимать локальный ИИ-стек было очень больно, — говорит Нейт. — С Portable Computer мы сфокусировались на том, чтобы сделать процесс максимально простым и быстро запуститься».

В одной из демонстраций система играла роль частного инвестора, изучающего папку с налоговыми формами 1099 и инвестиционными документами. Это как раз тот чувствительный финансовый материал, который многие не рискнули бы загружать в облачный сервис. Используя модель Qwen с 27 миллиардами параметров при полной загрузке GPU на DGX Spark, агент проверил каждый документ и указал случаи, где инвестор платил ненужные комиссии. Счетчик облачных кредитов в интерфейсе «просто застыл на нуле», отметил Нейт, «потому что все происходит на устройстве».

Вторая демонстрация показала гибридную сторону продукта. Нейт выступил в роли основателя стартапа и попросил агента проанализировать CSV-файл с данными воронки пользователей локально, а затем отправить готовый анализ в канал Slack через экосистему коннекторов Perplexity. Наглядное доказательство того, что локальный приоритет не означает изоляцию.

Система подключается к Google Drive, Gmail и GitHub, а также умеет переключаться на передовую облачную модель, когда локальная упирается в пределы. На старте доступны Qwen 3.8 27B или PPLX 27B — версия, которую Perplexity дообучила на собственной обвязке. Вскоре добавится Nemotron 3.5 Lightning от Nvidia.

Portable Computer выходит сегодня для подписчиков Pro, Max, Enterprise Pro и Enterprise Max на Linux, а Windows-версия появится в сентябре. Любая видеокарта RTX с минимум 24 ГБ видеопамяти — примерно GeForce RTX 3090 или новее — проходит порог. Нейт назвал это «нижней границей, которая гарантирует отличный опыт и одновременно сохраняет доступность для широкого круга пользователей».

Почему совместная разработка модели и агентной обвязки побеждает универсальные фреймворки

Вместе с запуском Perplexity опубликовала исследование, где утверждается: эффективные локальные агенты требуют, чтобы модель и агентная обвязка — каркас из промптов, инструментов и оркестрационной логики — проектировались вместе. Ключевая мысль в том, что универсальные обвязки рассчитаны на фронтирную модель, способную впитывать огромные контексты, перемещаться по обширным поверхностям инструментов и планировать на длинные горизонты. Маленькие локальные модели под таким давлением сгибаются.

Эмпирически Perplexity обнаружила, что хотя Qwen 3.8 27B заявляет контекстное окно на 260 тысяч токенов, модель начинает спотыкаться уже после 100 тысяч. Поэтому компания построила намеренно минималистичную обвязку: лаконичный системный промпт, небольшой набор основных инструментов и функции, которые загружаются и выгружаются как «навыки» по требованию, а не висят в контексте постоянно. Популярные коннекторы вроде Gmail и GitHub превратились из прожорливых MCP-серверов в компактные инструменты командной строки. Добавились хуки самопроверки, отслеживающие состояние задачи, и принудительно включенная песочница на уровне ОС. Если песочница недоступна, обвязка отключается, а не запускает инструменты без защиты — в отличие от open-source обвязок, которые по умолчанию выполняют команды с полными правами пользователя.

Цифры, которые приводит Perplexity, впечатляют, хотя получены на ее собственных оценках. На внутреннем бенчмарке Local Knowledge Work Bench — 53 задачи от глубоких исследований до финансового анализа и создания документов, который компания планирует открыть, — Computer с Qwen 3.8 27B на DGX Spark набрал 82,6%. Для сравнения: открытая обвязка Pi показала 77,6%, а Hermes с той же моделью — 74,0%. После дообучения PPLX 27B результат вырос до 85,4%.

На более сложных задачах разрыв становится драматическим. На BrowseComp — бенчмарке веб-исследований — Computer достиг 66,7% точности против 50,2% у Pi и 43,9% у Hermes, потратив на 51% меньше реального времени и на 70% меньше токенов, чем Pi. В мультимодальном понимании документов Computer набрал 65,1% против 34,6% у Hermes и 13,9% у Pi.

Токен-экономика: почему агенты переезжают с облака на локальное железо

Стратегическая логика запуска становится ясной, если посмотреть, как изменились ИИ-нагрузки. Чат работает импульсами: вопрос — ответ — готово. Агенты работают иначе.

«С агентами вы хотите, чтобы они работали постоянно, если это возможно. Вы хотите, чтобы агенты потребляли как можно больше токенов, — говорит Нейдер. — Мы наблюдаем ненасытный спрос на токены, и именно это делает локальный ИИ таким привлекательным. Как вы видели в демо, вас не ограничивают по токенам и не заставляют за них платить. Для агентов это убийственно эффективно».

Это переосмысляет ценность локального железа. Агент, который часами просматривает документы, перепроверяет себя и итерирует анализ, в облаке накопил бы приличные счета за API. На устройстве, которое пользователь уже купил, предельная стоимость таких токенов стремится к нулю. В своей работе Perplexity прямо формулирует корпоративный аспект: когда агенты масштабируются от отдельных рабочих процессов до целых организаций, расходы на токены и перемещение данных «становятся все труднее контролировать». Локальный подход закрывает обе проблемы: затраты, потому что инференс бесплатен, и приватность, потому что чувствительные токены не покидают границы устройства.

Пожалуй, самый коммерчески интересный результат связан с гибридной серединой. На Terminal Bench 2.1 — сложном бенчмарке для кода — полностью локальная модель Qwen набрала 59,6% при практически нулевой предельной стоимости. Разрешение эскалации к «советнику» Claude Opus 5 в облаке подняло результат до 73,0% при примерной цене $0,415 за задачу. Только фронтирная модель показала 82,4% за $0,65. Другими словами, эскалация восстанавливает примерно три пятых разрыва до фронтирной производительности примерно за две трети цены — и пользователь сам решает, стоит ли такой компромисс. Перед каждым вызовом советника обвязка прогоняет исходящий контекст через классификатор PII и показывает пользователю, что именно покинет устройство. Удаленная модель возвращает только текстовые рекомендации; к локальным файлам и инструментам она не прикасается.

Место Portable Computer среди Ollama и самодельных локальных ИИ-стеков

Джейсон Хайнер из The Deep View попросил обе компании уточнить, как Portable Computer соотносится с существующими локальными инструментами инференса вроде Ollama. Нейт провел четкую границу: эти инструменты решают разные слои задачи.

«Основная часть усилий здесь приходится на уровень агентной обвязки», — сказал он, отметив, что система использует vLLM для размещения инференса, а продвинутый режим позволяет подключать собственный инференс-эндпоинт. «Мы серьезно дообучили модели Qwen и Nemotron, над которыми работаем, чтобы добиться максимально возможных результатов. Наш фокус — отточить весь стек сверху донизу, инференс и обвязку как единое целое».

Нейдер выразился красочно: «Просто быстро запустить инференс на Spark — это гладкий путь. Можно взять Ollama и все настроить. Но когда начинаешь делать более сложные, более агентные вещи, внезапно не хватает производительности. Начинаешь смотреть на другие модели, на другие обвязки. Это как океан: чем глубже погружаешься, тем глубже становится».

Похоже, предложение восприняли всерьез, по крайней мере один участник. Инженер Бен, признавшийся, что с трудом настроил собственный DGX Spark («этот опыт отвратителен, мы должны это исправить»), сказал, что продукт ощущается как ключ, «необходимый, чтобы люди по-настоящему почувствовали и поняли, что значит агентность, и для этого нужен правильный UX». Nvidia также подчеркнула, что железо масштабируется: объединение двух Spark через общую память запускает открытые модели уровня фронтира вроде последней DeepSeek, четыре Spark способны тянуть GLM 5.2 или Nemotron Ultra. «Я видел даже восемь связанных Spark», — добавил Нейдер.

Что углубление альянса Nvidia и Perplexity значит для обеих компаний

Запуск расширяет партнерство, которое строилось более года. В июне 2025 года Nvidia и Perplexity объявили о совместной работе по внедрению суверенных моделей ИИ для европейских издателей и телекомов — части кампании генерального директора Nvidia Дженсена Хуанга по убеждению правительств в том, что «каждой стране нужна национальная интеллектуальная инфраструктура», как сообщал Associated Press с VivaTech в Париже. Суверенный ИИ — аргумент о том, что данные «принадлежат вашему народу, вашей стране, вашей культуре», по словам Хуанга, — философски тот же довод, который Portable Computer приводит в масштабе одного рабочего стола: интеллект под вашим контролем на аппаратуре, которая вам принадлежит.

У обеих компаний есть своя выгода. Perplexity, привлекавшая капитал при стабильно растущих оценках и одновременно испытывающая юридическое давление со стороны издателей из-за своей работы с контентом — включая иск The New York Times в декабре 2025 года и более ранний публичный конфликт с Forbes, — получает продукт, экономика которого не зависит от учета каждого токена, а также дифференцированный доступ к чувствительным к приватности предприятиям в юриспруденции, здравоохранении и финансах. Nvidia получает killer-приложение для DGX Spark — устройства, которое, по признанию участников брифинга, легче купить, чем использовать. Когда один журналист спросил, можно ли будет купить Spark с предустановленными Portable Computer и моделью Nemotron, Нейдер не исключил такой возможности: «Это было бы круто... цель — просто сделать максимально плавный опыт для каждого пользователя».

Остаются вопросы. Самые впечатляющие цифры Perplexity получены на собственном внутреннем бенчмарке, и компания признает: компактные модели все еще заметно отстают от фронтира на сложных задачах рассуждений — эскалация к советнику «сокращает разрыв, но не закрывает его полностью». Запуск пока только под Linux, порог в 24 ГБ видеопамяти отсекает подавляющее большинство потребительских ПК, а Apple silicon — дом самых активных энтузиастов локального ИИ — демонстративно отсутствует в дорожной карте. «Сейчас мы очень сфокусированы на оборудовании Nvidia», — ответил Нейт на вопрос.

Но направление движения очевидно. Исследователи Perplexity описывают запуск как часть «более широкого сдвига, в котором все более способные агенты перемещаются из удаленной инфраструктуры на отдельные и локальные устройства», и обе компании делают ставку на то, что достижения в чипах и открытых моделях продолжат расширять возможности устройства на столе. В демо самой показательной деталью был не результат бенчмарка, а счетчик кредитов в углу экрана, неподвижно застывший на нуле, пока агент перемалывал папку налоговых документов. Два года индустрия ИИ измеряла свои амбиции в гигаваттах и токенах за доллар. Portable Computer предлагает другой измеритель — тот, который никогда не бежит.

Что ж, первый заход на территорию локальных агентов выглядит уверенно. Остается дождаться Windows-версии, чтобы проверить, как эта история поведет себя на обычных игровых видеокартах Nvidia RTX с 24 ГБ памяти. Apple silicon в списке нет, но этот рынок никогда не спит. Держим руку на пульсе.

Справка по теме (FAQ)
Какие видеокарты Nvidia RTX подходят для Portable Computer?
Требуется минимум 24 ГБ видеопамяти. Проходной порог — GeForce RTX 3090 или новее. Владельцы RTX 4090, 5080, 5090 — вы в деле.
Когда выйдет Windows-версия Portable Computer?
На старте доступна только версия для Linux (Nvidia DGX OS). Windows-версия появится в сентябре 2026 года.
Какие модели ИИ работают локально в Portable Computer?
На старте доступны Qwen 3.8 27B или дообученная PPLX 27B. Вскоре добавится Nemotron 3.5 Lightning от Nvidia. Можно подключать и свой инференс-эндпоинт.
Что такое гибридный режим в Portable Computer?
По умолчанию все задачи решаются локально. Если агенту не хватает мощности, он спрашивает разрешения отправить отдельный шаг в более мощную облачную модель (например, Claude Opus 5). При этом перед отправкой сканирует PII, а облачная модель не имеет доступа к локальным файлам.