Руководство предназначено разработчикам, которые хотят запустить Prime Agent с локальной моделью Ollama и не отправлять код во внешний API по умолчанию. Материал построен по временной шкале: подготовка, первое подключение, проверка инструментов, длительный запуск и последующее обслуживание.
Последняя проверка выполнена 11 августа 2026 года по текущей документации Prime Agent и Ollama.
У Ollama локальный API по умолчанию доступен на http://localhost:11434/api, а совместимый с OpenAI интерфейс — через путь /v1. Поэтому Prime Agent Ollama 2026 подключается не через случайный старый фрагмент конфигурации, а через пользовательский провайдер в ~/.prime/agent/models.json. Практическое решение такое: сначала проверить модель, контекст, структурированный вывод и вызовы инструментов, затем запускать долгие задачи и дочерних агентов. Сам факт успешного соединения не доказывает, что модель надёжно справится с автономной разработкой. (документация Ollama по API, официальная настройка пользовательских моделей Prime Agent)
Эта статья предназначена:
- разработчикам, которым нужно запускать Prime Agent в локальной или закрытой среде;
- командам, работающим с чувствительным исходным кодом и нежелающим отправлять его во внешний сервис;
- техническим руководителям, которые планируют тестировать Ollama на изолированном Mac в nuvcloud.
До установки: определите границы локального запуска
Может ли Prime Agent использовать модели Ollama? Да, текущая документация Prime Agent прямо предусматривает добавление Ollama, vLLM, LM Studio и других серверов с поддерживаемым API через models.json. Для Ollama обычно используется интерфейс OpenAI Chat Completions с адресом http://localhost:11434/v1. При этом конкретные поля провайдера нельзя переносить из старых конфигураций без проверки: документация и встроенный каталог моделей меняются вместе с релизами Prime Agent. (официальный список провайдеров Prime Agent)
До загрузки модели нужно разделить четыре независимые способности:
- Диалоговая работа — модель отвечает на обычные текстовые запросы.
- Работа с кодом — модель понимает структуру проекта, предлагает изменения и сохраняет последовательность действий.
- Вызов инструментов — модель возвращает корректный
tool_call, а не описывает нужную команду обычным текстом. - Длинный контекст — модель сохраняет цель, ограничения и результаты предыдущих шагов при увеличении истории.
Это не одно и то же. Локальная модель может хорошо объяснять код, но игнорировать схему инструмента, возвращать некорректный JSON или терять первоначальную цель после нескольких итераций. Prime Agent выполняет сгенерированный Python-код и команды проекта с правами текущего пользователя; его рабочие процессы улучшают восстановление, но сами по себе не являются полноценной песочницей. Для первого запуска нужен временный клон или чистая рабочая ветка.
В конфигурации Prime Agent значение contextWindow по умолчанию равно 128000 токенам, а maxTokens — 16384, если эти поля не переопределены. Это значения интерфейса Prime Agent, а не гарантия того, что конкретная модель или сборка Ollama действительно обработает такой объём. Реальный предел нужно сверять с параметрами модели и проверять отдельным длинным запросом. (документация Prime Agent по полям модели)
Что проверить до скачивания
- модель доступна в локальной библиотеке Ollama или может быть загружена из доверенного источника;
- идентификатор модели записывается точно, включая тег после двоеточия;
- модель рассчитана на кодовые задачи, если Prime Agent будет изменять репозиторий;
- сервер поддерживает нужный формат Chat Completions;
- тестовая среда не содержит настоящих ключей, production-файлов и необратимых команд;
- свободного диска и памяти достаточно для самой модели, кэша и рабочего репозитория.
Первый этап: установите Ollama и подтвердите сервис
Сначала необходимо установить Ollama по актуальной инструкции для используемой операционной системы, затем загрузить выбранную модель. Команда должна использоваться только с тем идентификатором, который действительно поддерживается текущей библиотекой моделей:
ollama pull <имя-модели>
После загрузки проверьте список локальных моделей:
ollama list
Затем проверьте базовый API Ollama:
curl http://localhost:11434/api/generate \
-H "Content-Type: application/json" \
-d '{
"model": "<имя-модели>",
"prompt": "Ответьте одним коротким предложением: сервис работает?",
"stream": false
}'
Для подключения Prime Agent важнее проверить совместимый интерфейс /v1. Список моделей можно запросить так:
curl http://localhost:11434/v1/models
Если ответ содержит нужный идентификатор, значит, Prime Agent сможет обратиться к модели по тому же имени. В документации Ollama указано, что для совместимости можно использовать /v1/chat/completions; поле api_key требуется клиенту, но локальный сервер Ollama его игнорирует. (официальная документация Ollama по OpenAI-совместимости)
Минимальная проверка генерации через совместимый endpoint:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ollama" \
-d '{
"model": "<имя-модели>",
"messages": [
{
"role": "user",
"content": "Верните только слово OK."
}
],
"stream": false
}'
Если /api/generate работает, а /v1/chat/completions возвращает ошибку, проблема находится на уровне совместимого интерфейса, а не Prime Agent. Если оба запроса не работают, бессмысленно переходить к настройке провайдера: сначала нужно восстановить службу Ollama.
Второй этап: добавьте локальный провайдер Prime Agent
Текущая документация использует файл:
~/.prime/agent/models.json
Для первого теста конфигурация может выглядеть следующим образом:
{
"providers": {
"ollama": {
"baseUrl": "http://localhost:11434/v1",
"api": "openai-completions",
"apiKey": "ollama",
"models": [
{
"id": "<имя-модели>"
}
]
}
}
}
Важны четыре поля:
| Поле | Что указать | Что проверить |
|---|---|---|
baseUrl |
http://localhost:11434/v1 |
Не добавлять лишний путь /api |
api |
openai-completions |
Сервер должен принимать Chat Completions |
apiKey |
ollama |
Значение нужно клиенту, Ollama его не проверяет |
models[].id |
Точный идентификатор модели | Совпадает с ollama list и /v1/models |
Для локального запуска Prime Agent также поддерживает параметры совместимости. Если модель или сервер не принимает роль developer либо параметр reasoning_effort, их можно отключить:
{
"providers": {
"ollama": {
"baseUrl": "http://localhost:11434/v1",
"api": "openai-completions",
"apiKey": "ollama",
"compat": {
"supportsDeveloperRole": false,
"supportsReasoningEffort": false
},
"models": [
{
"id": "<имя-модели>",
"reasoning": false
}
]
}
}
}
Не следует сразу указывать завышенные contextWindow, maxTokens или reasoning: true. Эти поля описывают возможности, которые Prime Agent будет ожидать от модели. Если заявить неподдерживаемый режим, ошибка проявится позже — например, во время вызова инструмента или длинной сессии.
Prime Agent подключился к Ollama, но не находит модель — что проверять? Сначала нужно сравнить три строки посимвольно: результат ollama list, идентификатор из /v1/models и значение models[].id. Частая причина — отличие тега, например использование сокращённого имени вместо полного. Затем следует открыть /model в Prime Agent: текущая документация указывает, что файл моделей перечитывается при открытии этого меню, поэтому для изменения models.json перезапуск не всегда требуется. (описание перезагрузки models.json)
Если модель отображается, но запрос завершается ошибкой, временно отключите reasoning-параметры и оставьте одну модель без сложных overrides. Так легче отличить неверный идентификатор от неполной совместимости API.
Третий этап: первый час — только базовые способности
После выбора модели не следует сразу включать автономный режим, расписания или параллельных дочерних агентов. Первый час должен подтвердить четыре операции в фиксированной последовательности.
- Чтение файла. Попросите Prime Agent прочитать небольшой безопасный файл и перечислить его разделы без изменений.
- Генерация кода. Дайте локальную задачу, например добавить небольшую функцию и написать тест, но сначала попросите показать план.
- Выполнение команды. Разрешите безопасную команду вроде запуска теста или просмотра статуса Git.
- Структурированный ответ. Запросите JSON с заранее определёнными полями и проверьте, что ответ действительно парсится.
Поддерживает ли локальная модель вызовы инструментов Prime Agent? Только если поддержка есть одновременно на трёх уровнях: сервер Ollama принимает поле tools, выбранная модель умеет формировать вызовы функций, а Prime Agent корректно обрабатывает полученный формат. Ollama документирует поддержку инструментов в OpenAI-совместимом Chat Completions API, однако это не означает одинаково надёжную работу всех моделей. Ссылка на соответствующую документацию приведена в разделе проверки API выше.
Успешным считается не красивое объяснение команды, а наблюдаемое действие: Prime Agent отправил вызов инструмента, получил результат, использовал его в следующем шаге и не подменил структурированный объект обычным текстом.
Чек-лист первого часа:
- [ ]
ollama listпоказывает выбранную модель; - [ ] запрос к
/v1/modelsвозвращает тот же идентификатор; - [ ]
/v1/chat/completionsотвечает без ошибки; - [ ] Prime Agent видит провайдера в
/model; - [ ] чтение файла выполняется без лишних изменений;
- [ ] безопасная команда запускается только после подтверждения;
- [ ] модель возвращает валидный JSON в отдельном тесте;
- [ ] вызов инструмента виден в журнале или интерфейсе сессии;
- [ ] после ошибки можно восстановить чистое состояние репозитория.
Четвёртый этап: первый день — длинная задача и дочерние агенты
После базовой проверки нужно провести отдельный тест на длительность. Используйте небольшой репозиторий, который можно удалить или восстановить из контрольной точки. Задача должна включать несколько связанных шагов: анализ структуры, изменение кода, тестирование и краткий отчёт.
В ходе запуска фиксируйте:
- увеличивается ли время ответа после загрузки большого контекста;
- повторяет ли модель уже выполненные действия;
- сохраняет ли первоначальные ограничения;
- корректно ли обрабатывает результат команды с ошибкой;
- не начинает ли изменять файлы вне рабочей директории;
- что происходит после остановки и возобновления процесса.
Prime Agent рассчитан на долгие задачи: в его документации описаны постоянное состояние IPython, фоновые сессии, автоматическое сжатие контекста, цели и дочерние агенты. Однако эти функции увеличивают требования к памяти, диску и стабильности локального сервера. (описание длительных агентов Prime Agent)
Какая среда нужна для Prime Agent с локальной моделью? Нужны поддерживаемая Prime Agent операционная система, установленный Ollama, рабочий каталог проекта, доступный локальный HTTP-порт, достаточно памяти для выбранной модели и запас диска под модель, кэш и журналы. Официальный установщик Prime Agent рассчитан на macOS и Linux; при запуске из исходников документация отдельно указывает требование Node.js 22.8.0 или новее. (официальное руководство установки Prime Agent)
Дочерних агентов следует подключать только после того, как один агент стабильно выполняет базовую задачу. Сначала запускается один короткий подзапрос, затем два независимых подзапроса с небольшим объёмом данных. Если сервер начинает отвечать с тайм-аутами, система расходует память или модели выгружаются из памяти, нужно вернуться к последовательному режиму.
Удалённый Ollama: доступ только через закрытый канал
Локальный запуск на одной машине проще и безопаснее: по документации Ollama сервис по умолчанию привязан к loopback-адресу и порту 11434. Для подключения Prime Agent с другого компьютера потребуется изменить адрес прослушивания через OLLAMA_HOST, но открывать этот порт в интернет без дополнительного контроля доступа нельзя. (официальная справка Ollama по сетевому доступу)
Как ограничить доступ к удалённому Ollama? Предпочтительный порядок такой:
- оставить Ollama на закрытом интерфейсе, если удалённый доступ не нужен;
- при необходимости использовать приватную сеть или SSH-туннель;
- ограничить входящие адреса правилами межсетевого экрана;
- поставить обратный прокси с аутентификацией и журналированием;
- не публиковать порт
11434напрямую; - отделить пользователя, запускающего Ollama, от административной учётной записи;
- проверить, какие каталоги доступны Prime Agent и его командам.
Если Ollama размещён на отдельном Mac, в baseUrl Prime Agent указывается адрес приватного хоста, например:
{
"baseUrl": "http://<внутренний-адрес-хоста>:11434/v1"
}
Плейсхолдер нужно заменить только после проверки маршрута и правил доступа. Публичный IP, токены и реальные секреты не следует помещать в статью, репозиторий или общий файл конфигурации.
После теста: обслуживание и диагностика
Для долгой эксплуатации полезно разделить ошибки на четыре класса.
Ошибка соединения. Проверяется, запущен ли Ollama, доступен ли адрес из той же среды, не перепутан ли /api с /v1, не блокирует ли порт firewall. Сначала повторяется curl вне Prime Agent, затем проверяется провайдер.
Модель не найдена. Сверяются ollama list, /v1/models и models[].id. После обновления модели нужно проверить, не изменился ли тег или локальное имя.
Неверный формат вывода. Временно отключаются reasoning-параметры, сложные overrides и структурированный режим. Затем тестируется обычный текст, после чего отдельно возвращается JSON.
Инструменты не выполняются. Проверяются поддержка tools сервером, способность модели формировать function call и настройки compat. Если модель только описывает нужную команду, её нельзя считать проверенной для автономной работы.
Для обслуживания следует:
- зафиксировать версию Prime Agent и имя модели в журнале эксперимента;
- хранить копию рабочего
models.jsonбез секретов; - регулярно очищать неиспользуемые модели и кэш;
- сохранять журналы ошибок, но удалять из них ключи и чувствительный код;
- иметь процедуру перезапуска Ollama и Prime Agent;
- повторять минимальный тест после обновления любого из компонентов.
Если локальный компьютер перегревается, не хватает памяти, а параллельные агенты постоянно прерываются, проблема уже не в поле baseUrl. В такой ситуации нужно оценивать не только совместимость API, но и устойчивость всей среды: модель, дисковую подсистему, доступную память, сетевой маршрут и права процесса.
Для конфиденциальных проектов полезно заранее изучить подход nuvcloud к конфиденциальности, а порядок подключения и восстановления среды сверять с русскоязычной справкой nuvcloud. Если тестирование планируется на отдельной машине, текущие варианты можно сопоставить через страницу аренды Mac в nuvcloud.
Локальный запуск или аренда отдельного Mac
Домашний Mac удобен, если модель запускается постоянно, проект не требует изоляции от личных данных и разработчик готов самостоятельно поддерживать систему. Но такой вариант часто ограничен общей памятью, занятым диском и невозможностью безопасно экспериментировать с сетевыми настройками. Кроме того, перезапуск Ollama или длительная задача Prime Agent могут мешать обычной работе.
Если компьютер используется совместно, остаются ещё три недостатка: непредсказуемая конкуренция за ресурсы, сложнее очищать следы тестов и выше риск случайно дать агенту доступ к личным каталогам. Для короткой проверки совместимости покупка отдельного устройства также может оказаться преждевременной.
В этих условиях аренда выделенного Mac через nuvcloud даёт более управляемый сценарий: среду можно подготовить отдельно, проверить Ollama и Prime Agent на чистом проекте, затем удалить эксперимент или переустановить окружение. Это не заменяет собственное устройство для постоянной тяжёлой нагрузки и не решает задачи, которым нужны физические интерфейсы, но для временного теста локальной модели снижает цену ошибки и не затрагивает основной компьютер.
Перед выбором стоит определить срок эксперимента, нужный объём модели, требования к удалённому доступу и необходимость постоянного хранения данных. Если задача состоит именно в проверке совместимости, а не в круглосуточной эксплуатации, отдельный Mac в nuvcloud разумнее использовать как временный изолированный стенд: сначала подтвердить соединение, инструменты и длинный запуск, а уже затем принимать решение о покупке собственного оборудования.
Разверните локальную среду для Prime Agent с nuvcloud
Арендуйте выделенный Mac mini M4 в nuvcloud для запуска локальных моделей и работы с кодом в удалённой среде.
Подключайтесь к рабочей станции по SSH или VNC и настраивайте инструменты под собственный процесс разработки.