Сбер: диффузионная языковая модель GFusion на базе GigaChat
Описание проекта
Вместо обучения с нуля авторегрессионную модель GigaChat3-10B-A1.8B-base перевели в диффузионный режим. Генерация идёт блоками фиксированного размера: внутри блока токены декодируются итеративно в произвольном порядке, между блоками сохраняется авторегрессионная зависимость. Пайплайн: претрейн, мидтрейнинг, расширение контекста с 4K до 32K, SFT и confidence tuning. В инфраструктуру добавлены интеграция с SGLang и алгоритм сэмплирования с ограничением по энтропии, а также attention-ядра на TileLang.
Вендор и технология: Сбер, GFusion на базе GigaChat3-10B-A1.8B-base с интеграцией SGLang и ядрами на TileLang.
Задача
Авторегрессионная генерация принципиально ограничена одним токеном за проход. Диффузионные модели позволяют генерировать токены внутри блока параллельно, но обычно требуют обучения с нуля.
Цели внедрения
-
Перевести существующую авторегрессионную модель в диффузионный режим без обучения с нуля
-
ускорить генерацию
-
удержать качество близко к исходной модели
-
ускорить само обучение
-
довести контекст до 32K
Результаты
-
Результаты
-
Генерация на 70% быстрее GigaChat3 в однопользовательском режиме и на 39% быстрее варианта GigaChat3 с MTP-головой
-
падение качества на 2–4 п.п. относительно GigaChat3
-
сопоставимость с LLaDA-MoE-7B и LLaDA2.0-mini
-
скорость обучения выше на 60% за счёт оптимизированного внимания
-
ядра на TileLang дают ускорение обучения end-to-end от +41,7% до +77,4%
-
обработано около 530 млрд токенов Нагрузка и масштаб
-
Около 530 млрд токенов на претрейне и мидтрейнинге, контекст расширен с 4K до 32K Сроки
-
Несколько месяцев работы стажёрской команды; публикация 02.07.2026