VK Tech: локальный ИИ-агент в закрытом контуре на Ollama и OpenClaw
Описание проекта
Стек: Ollama плюс OpenClaw на GPU-сервере в облаке. Железо — NVIDIA A30 с 24 ГБ HBM2 и пропускной способностью 933 ГБ/с, Ubuntu 24.04 LTS, диск 96 ГБ. Модели: gpt-oss:20b (13 ГБ) для текста и инструментов и qwen3-vl:8b (6,1 ГБ) для понимания изображений. При контексте 65 536 токенов память распределяется так: веса gpt-oss 13,0 ГБ, KV-кэш 0,9 ГБ, веса qwen3-vl 6,1 ГБ, KV-кэш 2,4 ГБ — суммарно 22,4 ГБ из 24 доступных. Агент правит тексты в заданных персонах, гоняет ночную очередь исследований, ищет в вебе (5 результатов на запрос) и работает с файлами в границах рабочей директории.
Вендор и технология: VK Tech, связка Ollama и OpenClaw на арендованном GPU.
Задача
Отправка корпоративных данных во внешние LLM неприемлема, нужен агент в собственном контуре. При настройке четыре конфигурационные ошибки вызывали тихие отказы при «зелёном» статусе: отсутствие префикса провайдера в имени модели, неверный baseUrl с суффиксом /v1, рассинхрон окна контекста между платформой и движком инференса и слишком маленький таймаут для холодной загрузки модели.
Цели внедрения
-
Развернуть агента в собственном контуре без внешних облаков
-
уместить две модели в 24 ГБ видеопамяти
-
обеспечить работу с текстом и изображениями
-
автоматизировать ночные исследовательские задачи
-
устранить тихие отказы конфигурации
Результаты
-
Результаты
-
Две модели уместились в 22,4 ГБ из 24 ГБ при контексте 65 536 токенов
-
надёжная работа цепочки до примерно 6 последовательных вызовов инструментов
-
ночная автоматизация по cron каждые 10 минут
-
таймаут для холодной загрузки поднят выше 300 секунд
-
на отладку двенадцати ошибок ушёл один вечер Нагрузка и масштаб
-
Однопользовательский режим с последовательной обработкой запросов на текущем железе Сроки
-
Публикация 21.08.2026