Т-Банк: агент многошагового поиска T-Search
Описание проекта
Агент не генерирует финальный ответ, а возвращает ранжированный список чанков, отдавая генерацию любой модели. Работа идёт раундами с бюджетом около 32 000 токенов каждый и тремя инструментами: search_corpus, save_and_advance и finalize_ranking. При заполнении 75% контекста новые поиски блокируются, что вынуждает агента явно управлять памятью. Дисциплина обвязки жёсткая: минимум 5 поисков до сброса контекста, запрет финализации при более 50% нераскрытого запроса, запрет дублей запросов и повторной выдачи уже просмотренного. Обучение двухстадийное с языковыми ветками, слитыми через DARE.
Вендор и технология: Т-Банк, собственный агент на базе Qwen3.6-35B-A3B, обучение SFT + RL (GSPO).
Задача
Классический RAG предполагает, что нужные документы находятся одним запросом. Реальные задачи требуют промежуточного обнаружения сущностей, сопоставления нескольких документов и отделения правильных документов от правдоподобных дистракторов.
Цели внедрения
-
Обеспечить многошаговый поиск с явным управлением памятью
-
отделить ретрив от генерации
-
обучиться на полностью синтетических данных
-
выпустить русскоязычные бенчмарки поиска
-
сохранить работоспособность на разных ретриверах
Результаты
-
Результаты
-
Средний Recall 55,96% при N=1 и 61,33% при N=3 против 53,96% у GLM 5.1 и 48,19% у DeepSeek-V4-Flash
-
тестирование на 7 бенчмарках
-
сгенерировано около 67 000 кандидатных вопросов, отбор прошли около 40 000 (порядка 60%)
-
обучающая выборка 11 000 примеров на язык из 8000 уникальных вопросов
-
выпущены бенчмарки TRuST (324 вопроса на русском) и SynthComp (по 395 вопросов на язык)
-
устойчивость подтверждена на Qwen-эмбеддингах 8B и 0.6B, Jina, BM25 и LLM-реранкинге Нагрузка и масштаб
-
Около 2800 вопросов в оценочных наборах, конфигурируемое число раундов от 1 до 5 Сроки
-
Публикация 17.07.2026