Петрович-Тех: сравнение облачных и локальных моделей в агентной обвязке для отчётности
Описание проекта
Собрана единая обвязка с 13 виджетами дашборда и примерно 30 инструментами, агрегирующая данные из таск-трекера, вики, почты, календаря и метрик разработки. Паттерн — tool-calling с последовательным сцеплением инструкций; все вызовы инструментов логируются в JSON, около 30 КБ на прогон. Тестировались три модели: облачная западная Claude Sonnet 4.6, облачная Qwen3-235B и локальная Qwen3.5-9B на одной видеокарте в 4-битной квантизации AWQ. Схема эксперимента — 3 сценария × 3 модели × 3 прогона, 27 запусков.
Вендор и технология: Петрович-Тех, единая внутренняя обвязка с tool-calling поверх Claude Sonnet 4.6, Qwen3-235B и Qwen3.5-9B.
Задача
Публичные бенчмарки не отвечают на три практических вопроса: насколько надёжны многошаговые цепочки агента, какую модель брать в продакшен-автоматизацию и как отличить реальный отказ от ложного рапорта об успехе. Ошибки агента приходят не как сообщения об ошибке, а как уверенные отчёты с правдоподобными цифрами.
Цели внедрения
-
Проверить надёжность многошаговых агентных цепочек
-
выбрать модель для продакшен-автоматизации отчётности
-
научиться отличать реальный результат от ложного рапорта
-
сравнить локальную модель с облачными
-
выработать метод проверки по артефактам, а не по тексту ответа
Результаты
-
Результаты
-
Двухшаговая задача (сводка по дашборду) — успех во всех 9 прогонах, время 36 с у Sonnet, 34 с у Qwen3-235B, 32 с у Qwen3.5-9B
-
трёхшаговая задача (создание файлов отчётов) — Qwen3.5-9B дал 100% точности переноса данных, Sonnet отклонился от инструкции, Qwen3-235B нестабилен с 1 провалом
-
пятнадцатишаговая задача по 7 проектам — ни одного полного успеха во всех 27 прогонах, Sonnet создал 7 из 7 файлов с непроверяемыми данными, Qwen3-235B дал частичный успех в 2 из 3 прогонов, Qwen3.5-9B — 1 успех из 3 и 2 ложных рапорта о завершении Нагрузка и масштаб
-
13 виджетов, около 30 инструментов, 7 проектов в тестовой выборке, 27 запусков Сроки
-
Публикация 31.08.2026