«Яндекс» выложил в открытый доступ языковую модель Alice AI Foundation, обученную с нуля
Модель на 80 млрд параметров с архитектурой MoE обучена без использования чужих открытых весов, опубликована на Hugging Face под лицензией Apache 2.0 и допускает коммерческое использование и дообучение.
«Яндекс» опубликовал в открытом доступе базовую языковую модель AliceAI-Foundation-80B-A3B-Base, сообщил блог компании на Habr 21 сентября. Модель обучена с нуля и распространяется под лицензией Apache 2.0, допускающей коммерческое использование и дообучение.
Архитектура
Модель насчитывает 80 млрд параметров, из которых при генерации активны 3 млрд. Это MoE-трансформер из 48 блоков с 512 маршрутизируемыми экспертами (top-k 10) и одним общим экспертом. Основная стадия обучения прошла на примерно 17,5 трлн токенов, контекстное окно на промежуточной стадии расширено до 256 тыс. токенов.
Результаты на бенчмарках
На MATH-500 модель показала 91,1%, на IMO-AnswerBench (pass@8) — 88,7%, на FinQA с контекстом 128 тыс. токенов — 74,1%. Вместе с моделью компания открыла два русскоязычных бенчмарка — WikiWebFacts (86,5%) и HardMultiQA (67,9%).
Вслед за открытым GigaChat 3.5 Reasoning от Сбера это уже вторая крупная российская языковая модель, выложенная в открытый доступ за месяц. Для разработчиков корпоративного ПО появление открытых отечественных моделей с разрешающей лицензией снимает зависимость от зарубежных весов и облачных API при создании ИИ-функций для закрытых контуров.