Яндекс открыл веса AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Модель обучена с нуля внутри компании, без использования весов сторонних опенсорс-решений. Путь к релизу занял около полугода. Вместе с весами опубликован большой технический отчёт и два фактологических бенчмарка: WikiWebFacts и HardMultiQA с акцентом на русскоязычный контекст.
Модель имеет 80B общих параметров и 3B активных. В претрейн-замерах она обходит DeepSeek-V4-Flash-Base и Nemotron-3-Super на многих задачах. Среди них фактологические и экспертные вопросы, математика и код. На IMO AnswerBench и LiveCodeBench модель лидирует среди сравниваемых открытых претрейнов. Предыдущую закрытую Alice AI LLM 235B она превосходит по фактологии, математике, программированию и работе с длинным контекстом. У новой модели почти втрое меньше общих параметров и примерно в семь раз меньше активных. Вклад обновлённого корпуса, архитектуры и гиперпараметров проверили в серии обучений с нуля — по 2 трлн токенов каждое.
Что это значит для агентов
В Яндексе прямо описывают релиз как шаг к единой рассуждающей модели (ЕРМ). На её базе будут развивать агентские возможности Алисы AI. При обучении уже добавляли данные для рассуждений и агентских взаимодействий.
В релиз вышла именно base-модель. В отчёте команда отдельно указывает, что результат базовой модели сильно зависит от примеров в промпте. На сложных задачах правильный ответ может появляться лишь в одной из многих попыток.