Сбер: обновление бенчмарка русскоязычных LLM MERA Text 2.0
Описание проекта
Бенчмарк переработан вокруг четырёх категорий навыков: Human-Centric, Culture-Specific, Agentic и Reasoning. Состав сжат с 23 датасетов и примерно 37 000 примеров до 12 датасетов и примерно 8700 примеров. Агрегация оценок — геометрическое среднее на трёх уровнях: метрики внутри теста, результаты теста, оценки группы и итог. Тестовые ответы закрыты, чтобы избежать контаминации, на каждый тест используется пять разных формулировок промпта для устранения смещения, протокол оценки детерминированный, без дополнительных рассуждающих или инструментальных обвязок поверх модели. Датасеты разрабатывались совместно с партнёрами по Альянсу в сфере ИИ.
Вендор и технология: Сбер, открытый бенчмарк MERA Text 2.0.
Задача
Существующие тесты насытились: современные модели превышают человеческий уровень, и рост баллов перестал отражать реальный прогресс. Открытые тестовые ответы приводят к контаминации, а единственная формулировка промпта даёт смещение.
Цели внедрения
-
Переосмыслить, какие навыки остаются сложными для современных моделей
-
убрать насыщение метрик
-
исключить контаминацию за счёт приватных тестов
-
снять смещение от формулировки промпта
-
свести оценку в честную агрегацию по уровням
Результаты
-
Результаты
-
12 датасетов и около 8700 тестовых примеров вместо 23 датасетов и около 37 000
-
5 формулировок промпта на каждый тест
-
SOTA-модели показывают стабильно высокие и близкие результаты на reasoning-задачах, наибольший потенциал роста — в категории Culture-Specific
-
код и датасеты выложены на GitHub и Hugging Face Нагрузка и масштаб
-
12 датасетов, около 8700 примеров, четыре категории навыков Сроки
-
Релиз 31.08.2026