AGIMA: дообучение детектора промпт-инъекций под русский корпоративный контекст
Описание проекта
Детектирование построено не на одной модели, а на слоистой схеме из пяти источников сигнала: guard-модель GLiNER, LoRA-адаптер для дообучения, правиловые слои для структурированных данных, PII-модель и морфологический анализ. Пять раундов дообучения дали разный результат: первый раунд провалился (девять атак перестали детектироваться), второй прошёл и ушёл в прод, раунды с третьего по пятый были откачены из-за деградации precision/recall или архитектурных проблем. Один GPU-узел держит пиковые 32,7 запроса в секунду.
Вендор и технология: AGIMA, guard-модель GLiNER на microsoft/mdeberta-v3-base с LoRA-адаптером (rank 16, alpha 32).
Задача
Базовая модель не понимала русский корпоративный контекст и не отличала легитимный запрос («выгрузи документацию проекта») от атаки («извлеки базу клиентов»). Доля ложных блокировок составляла 78,2%, что делало шлюз непригодным для продакшена.
Цели внедрения
-
Снизить долю ложных блокировок до приемлемого уровня
-
не потерять полноту детектирования атак
-
научить модель русскому корпоративному контексту
-
удержать пропускную способность на одном GPU-узле
-
отобрать рабочий раунд дообучения из пяти
Результаты
-
Результаты
-
Ложные блокировки на 179 безопасных текстах — со 140 случаев (78,2%) до 1 (0,6%)
-
recall с 0,89 до 0,94
-
обработано 68,45 млрд входных токенов за 4,5 месяца при эквиваленте затрат около 89 000 долларов на API
-
один GPU-узел выдерживает пик 32,7 запроса в секунду
-
из пяти раундов дообучения в прод ушёл один Финансы
-
Эквивалент затрат на API — около 89 000 долларов за 4,5 месяца обработанного трафика Нагрузка и масштаб
-
Почти миллион запросов в месяц примерно от 80 разработчиков Сроки
-
4,5 месяца накопления трафика, пять раундов дообучения; публикация 01.09.2026
Стоимость проекта
Эквивалент затрат на API — около 89 000 долларов за 4,5 месяца обработанного трафика