ЦИАН: единый контур генеративного ИИ и шлюз на 300 тысяч запросов в сутки
Описание проекта
ЦИАН построил единый контур генеративного ИИ для всей компании, внутреннюю ИИ-платформу, работающую как единый шлюз к моделям. Платформа обрабатывает около 300 тысяч запросов в сутки с пиками до 15 запросов в секунду. Стек гибридный: используются Claude, модели GLM и Kimi, Qwen, а для чувствительных данных локальные решения.
В продуктовой части внедрён нейросетевой подход к рекомендациям объектов, учитывающий последовательность действий пользователя, а не только совокупность его интересов; скорость мобильного поиска во втором квартале выросла на 13%. ИИ-модерация обеспечивает 99% чистоты базы из 2,1 млн объявлений. Внутри работают несколько агентов: они пишут код, делают ревью и ищут уязвимости, более 35% строк кода ежедневно пишет нейросеть. Компания описала и неудачный опыт: при попытке масштабно внедрить языковые модели в разработку в некоторых командах производительность снизилась из-за неготовности инфраструктуры, эксперимент приостановили, доработали инфраструктуру и обучили команды.
Задача
Генеративные модели использовались командами разрозненно, часть данных нельзя отдавать во внешние модели, а нагрузка на инференс росла. Требовался единый контур с маршрутизацией запросов и контролем того, какие данные передаются в модели.
Цели внедрения
-
Построить единый шлюз генеративного ИИ для всей компании
-
Развести чувствительные данные на локальные модели, остальное на внешние
-
Персонализировать поиск недвижимости под последовательность действий пользователя
-
Поднять чистоту базы объявлений через ИИ-модерацию
-
Масштабировать агентные системы в разработке под контролем человека на критичных действиях
Результаты
-
Нагрузка и масштаб
-
Около 300 000 запросов в сутки через платформу, пик до 15 запросов в секунду
-
2,1 млн объявлений в модерации
-
Более 7 млн пользователей ИИ-ассистента с момента запуска Качество и эффективность
-
Скорость мобильного поиска выросла на 13% во втором квартале
-
Чистота базы объявлений: 99%
-
70% пользователей просматривают все рекомендации ассистента, 30% переходят по ним
-
Более 35% строк кода ежедневно пишет нейросеть Надёжность
-
Обязательный человеческий контроль на критичных действиях
-
Неудачный этап внедрения языковых моделей в разработку был приостановлен, инфраструктуру доработали и обучили команды, после чего внедрение продолжили Импортозамещение и compliance
-
Гибридный стек с локальными моделями для чувствительных данных, единый шлюз позволяет управлять тем, какие данные передаются в модели