Яндекс выложил в открытый доступ веса новой языковой модели AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Главная инженерная деталь этого релиза заключается в методологии: модель прошла полный цикл обучения с нуля, без заимствования чужих весов или компиляции готовых опенсорсных наработок.
Команда разработчиков рассматривает этот запуск как промежуточный шаг на пути к созданию единой рассуждающей модели (ЕРМ), которая должна лечь в основу будущих корпоративных агентских систем.
Меньше параметров при росте метрик
В претрейн-замерах AliceAI-Foundation-80B-A3B-Base обходит сопоставимые по классу модели на многих задачах, включая экспертные вопросы, математику и генерацию кода. На сложных бенчмарках IMO AnswerBench и LiveCodeBench модель удерживает лидерство среди открытых претрейнов.
«Нашу предыдущую закрытую Alice AI LLM 235B она превосходит по фактологическим знаниям, математике, программированию и работе с длинным контекстом — при почти втрое меньшем общем числе параметров и примерно в семь раз меньшем числе активных».
Подобная разница в архитектурной эффективности наглядно демонстрирует, насколько изменилось качество подготовки данных и подбор гиперпараметров по сравнению с предыдущим поколением собственной линейки.
Эксперименты и открытые датасеты
Весь путь к релизу AliceAI-Foundation-80B-A3B-Base занял около полугода. Чтобы изолировать влияние архитектурных модификаций и обновлённого корпуса, разработчики провели серию обучений с нуля по 2 трлн токенов каждое, опираясь на накопленный инженерный опыт.
Вместе с моделью Яндекс открыл два профильных датасета — WikiWebFacts и HardMultiQA с акцентом на русскоязычный контекст, а также сопутствующие протоколы оценки. В сравнительных тестах модель занимает первое место на большинстве бенчмарков фактологических знаний и экспертных навыков, а на MATH-500 и LiveCodeBench показывает лучшие результаты в своей категории.
Этот релиз выглядит как прагматичный манёвр: корпорация не просто делится весами, а задаёт новую планку прозрачности для рынка, которому надоело верить закрытым заявлениям на слово. Посмотрим, как конкуренты будут отвечать на эту открытость.