Яндекс открывает новую языковую модель AliceAI-Foundation-80B-A3B-Base

Компания «Яндекс» объявила о выпуске и предоставлении в открытый доступ весов своей новой большой языковой модели AliceAI-Foundation-80B-A3B-Base. Модель, разработанная с нуля без использования сторонних опенсорс-решений, является значительным шагом на пути к созданию единой рассуждающей модели (ЕРМ), которая станет основой для развития агентских функций Алисы AI.

Превосходство в производительности и инновационный подход

AliceAI-Foundation-80B-A3B-Base демонстрирует впечатляющие результаты в претрейн-замерах, обходя более крупные модели, такие как DeepSeek-V4-Flash-Base и Nemotron-3-Super, по множеству задач, включая фактологические вопросы, математику и кодирование. На сложных бенчмарках IMO AnswerBench и LiveCodeBench новая модель лидирует среди сравниваемых открытых претрейнов. Она также превосходит предыдущую закрытую модель Яндекса, Alice AI LLM 235B, по фактологическим знаниям, математическим способностям, программированию и обработке длинного контекста, при этом имея почти втрое меньше общих параметров и примерно в семь раз меньше активных.

Разработка модели заняла около полугода, что стало возможным благодаря накопленному опыту команды. В процессе были переработаны датасеты, оптимизированы архитектурные решения, подобраны гиперпараметры и добавлены данные для улучшения рассуждений и агентских взаимодействий. Этот релиз продолжает инициативу Яндекса по открытию своих разработок, следуя за недавним представлением претрейна Alice AI Search.

Подробный технический отчёт и открытые бенчмарки

Вместе с весами модели «Яндекс» публикует обширный технический отчёт, который подробно описывает пайплайны подготовки данных, протоколы оценки, стабилизацию обучения и масштабируемые законы (scaling laws). Отчёт включает абляционные эксперименты для ключевых решений и анализ подходов, от которых пришлось отказаться. Вклад обновленного корпуса, архитектуры и гиперпараметров был проверен в серии обучений с нуля, каждое по 2 триллиона токенов.

Отдельный раздел отчёта посвящен сложностям измерения качества претрейнов. «Яндекс» также открывает два фактологических бенчмарка — WikiWebFacts и HardMultiQA, с акцентом на русскоязычный контекст, а также протоколы их оценки. Это позволит сообществу более точно оценивать и сравнивать модели, особенно в задачах, требующих глубоких знаний и рассуждений на русском языке.