Яндекс представил в опенсорсе Alice AI Foundation LLM — базовую версию новой большой языковой модели, полностью обученной внутри компании. По заявлению разработчиков, она демонстрирует сильные результаты в программировании и задачах на рассуждение, а также хорошо отвечает на русскоязычные вопросы, связанные с фактами и локальным контекстом.
Модель можно использовать в исследовательских и коммерческих проектах: она распространяется по свободной лицензии Apache 2.0. При этом разработка не требует чрезмерно высоких вычислительных ресурсов во время работы и, как утверждает компания, может конкурировать с более крупными открытыми моделями.
Alice AI Foundation LLM стала экспериментальной площадкой для проверки решений, которые в дальнейшем планируют применить в единой рассуждающей модели Яндекса. Такая модель должна стать технологической основой для агентных возможностей Алисы AI — функций, при которых ассистент сможет выполнять конкретные задачи по поручению пользователя.
Архитектура и производительность
В основе модели лежит подход Mixture of Experts, или MoE. Всего в ней насчитывается 80 млрд параметров, но для формирования ответа активируются только 3 млрд. Это помогает сохранить высокую скорость работы и сократить затраты на инференс.
Разработчики заложили в модель способность рассуждать и работать в агентных сценариях. По данным Яндекса, она показывает хорошие результаты в решении сложных задач по логике и математике, а также в написании кода. В математических олимпиадных тестах модель сопоставима с Qwen3.5-35B-A3B-Base, а в программировании, по внутренним оценкам компании, превосходит NVIDIA Nemotron-3-Super-120B-Base при значительно меньшем числе активных параметров.
Также Яндекс отмечает, что в тестах на фактические знания новая модель обходит некоторые более масштабные открытые решения. По этому показателю она близка к предыдущей закрытой модели Alice AI LLM, хотя её общий размер и количество активных параметров заметно меньше.
Проверка знаний на русском языке
Для оценки качества русскоязычных ответов компания создала два собственных набора тестов: WikiWebFacts и HardMultiQA.
WikiWebFacts состоит из коротких вопросов и ответов. Он проверяет знание дат, определений, исторических событий и персоналий. Задания основаны на данных онлайн-энциклопедий и популярных поисковых запросах.
HardMultiQA включает более сложные вопросы из медицины, права, IT, искусства и других областей. Здесь модели нужно не просто вспомнить один факт, а выбрать несколько правильных вариантов, перечислить нужные сведения или найти ошибку в тексте.
Оба бенчмарка опубликованы вместе с эталонными ответами и методикой проверки. Это позволит исследователям самостоятельно сравнивать между собой различные языковые модели.
Как оптимизировали обучение
Во время обучения инженеры Яндекса доработали оптимизатор — компонент, который управляет обновлением параметров модели. Обмен данными между видеокартами удалось выполнять параллельно с вычислениями, что примерно вдвое ускорило отдельные этапы обучения.
Кроме того, была улучшена подготовка данных. Вместо оценки всего массива документов ресурсоёмкой моделью разработчики использовали последовательность классификаторов. На каждом шаге более сложная модель обрабатывает всё меньший объём материалов. Такой подход позволил снизить количество вычислений в десятки раз и сохранить около 95% полезных документов.
Отдельно команда расширила набор знаний модели в сферах права, медицины и математики.
Модель, техническая документация и тестовые наборы уже доступны разработчикам для дальнейшей работы и создания собственных решений.
Источник: пресс-служба Яндекса.