11 сентября Яндекс открыл Alice AI Search Pretrain — базовую языковую модель, на основе которой создана система быстрых ИИ-ответов в Поиске.
Это интересный релиз не только потому, что компания выложила ещё одну модель на Hugging Face. В открытый доступ попала именно база модели, связанной с реальным поисковым продуктом, которым уже пользуются миллионы людей.
Техническое название опубликованного чекпойнта — AliceAI-T5-35B-A0.6B Base. В ней 34,35 млрд параметров, контекст до 128 тысяч токенов и архитектура Mixture of Experts, при которой для обработки одного токена активируется лишь небольшая часть всей сети.
Но здесь сразу важна оговорка: Яндекс не открыл полную копию той системы, которая отвечает пользователям в Поиске. Выложена базовая pretrain-модель, а production-версия Alice AI Search проходит дополнительное обучение и работает внутри более крупного поискового контура.
Что именно открыл Яндекс
В публичный доступ выложена AliceAI-T5-35B-A0.6B Base — базовая модель после этапа предварительного обучения.
Её можно скачать с Hugging Face, запускать через Transformers, исследовать, дообучать и использовать в собственных проектах в рамках лицензии Apache 2.0.
Это довольно важное различие.
Модель из Hugging Face — не готовый поисковый ассистент. Она сама по себе не получает свежие результаты поиска, не проходит через весь production-пайплайн Яндекса и не содержит всех настроек дообученной версии, работающей в Поиске.
Другими словами:
Alice AI Search Pretrain — это фундамент. Alice AI Search в Поиске — уже продукт, построенный поверх этого фундамента.
Сам Яндекс отдельно указывает, что внешним разработчикам доступен обычный инференс через Hugging Face Transformers, а оптимизированный production-инференс пока остаётся внутренней технологией компании.
Модель AliceAI-T5-35B-A0.6B на Hugging Face
35 млрд параметров, но одновременно работают меньше 2%
Главная техническая особенность AliceAI — архитектура encoder-decoder с Mixture of Experts, или MoE.
В модели 34,35 млрд уникальных параметров. Но для каждого токена они не используются целиком.
В каждом MoE-слое находится 512 экспертов, из которых система выбирает только восемь. В результате для обработки одного токена активируется около 600 млн параметров — менее 2% от общего объёма модели.
Зачем это нужно?
Если очень упростить, обычная плотная модель при каждом запросе задействует почти всю сеть. В MoE-модели разные части сети специализируются на разных типах входных данных, а маршрутизатор выбирает только те «экспертные» блоки, которые нужны сейчас.
Это позволяет увеличить общую ёмкость модели, не увеличивая вычисления на каждый токен пропорционально общему числу параметров.
Для поискового продукта это особенно важно. Когда система обрабатывает огромное количество запросов, разница между «использовать все 35 млрд параметров» и «активировать около 600 млн» превращается уже не только в красивую архитектурную идею, но и в вопрос стоимости инфраструктуры.
Почему здесь encoder-decoder, а не привычная decoder-only LLM
Большая часть самых известных современных LLM — GPT, Claude, Qwen, Llama — обычно обсуждается в контексте decoder-only архитектуры.
AliceAI устроена иначе: у неё есть отдельные encoder- и decoder-части.
Такой подход особенно естественен для задач, где сначала нужно прочитать большой объём входной информации, а затем сформировать результат на её основе.
Для поисковой системы это логичный сценарий:
найти документы → прочитать релевантные фрагменты → сформировать ответ.
Поэтому AliceAI интересна не только размером. Она показывает, что для массового генеративного поиска оптимальная архитектура может отличаться от архитектуры универсального чат-бота.
Модель обучили с нуля на 15 трлн токенов
По данным команды Яндекса, AliceAI обучалась с нуля на собственном корпусе объёмом около 15 трлн токенов.
Для pretraining использовалась задача UL2 denoising. Если упростить, модель получает текст, из которого разными способами удалены или скрыты части информации, и учится восстанавливать недостающий контекст.
На финальном этапе обучения максимальный контекст увеличили с 8 тысяч до 128 тысяч токенов с помощью YaRN.
Это означает, что модель рассчитана не только на короткие поисковые сниппеты. Она способна работать с довольно большими массивами текста — длинными документами, подборками источников и большим поисковым контекстом.
В техническом разборе команда также описала проблему, которая возникла при масштабировании MoE: маршрутизация начала нестабильно распределять токены между экспертами. В итоге Яндекс перешёл на aux-free routing, подход, похожий на решение из DeepSeek-V3.
Это хороший пример того, почему крупная модель — это не просто «добавить больше параметров». Чем сложнее архитектура, тем больше отдельных инженерных проблем появляется уже на этапе обучения.
Технический разбор команды Яндекса
Но сама LLM — только часть системы
Самая интересная часть релиза, на мой взгляд, находится даже не внутри AliceAI.
Чтобы сделать ИИ-ответы быстрыми и достаточно дешёвыми для массового Поиска, Яндекс не отправляет в большую модель всё найденное подряд.
Сначала запрос проходит через поисковую систему, которая собирает информацию из разных источников. Затем документы обрабатывает отдельная BERT-подобная модель примерно на 80 млн параметров.
Её задача — найти внутри документов только те фрагменты, которые действительно относятся к вопросу пользователя.
Яндекс называет такие выбранные части текста инфоконтекстами.
Получается примерно такая цепочка:
запрос → поиск → отбор релевантных фрагментов → Alice AI Search → готовый ответ.
И это, пожалуй, одна из главных идей всей системы.
В генеративном поиске дорого не только сгенерировать текст. Дорого передавать в большую модель огромный объём ненужной информации.
Поэтому иногда выгоднее поставить перед основной LLM маленькую модель, которая сначала выбросит всё лишнее.
По данным самого Яндекса, такой подход позволил примерно на 40% увеличить пропускную способность системы без ухудшения качества.
Пока это именно внутренний результат компании, а не независимо подтверждённый показатель — релиз появился только 11 сентября, поэтому внешних воспроизводимых тестов практически ещё нет.
Насколько AliceAI сильна в сравнении с Qwen и другими моделями
Яндекс опубликовал большой набор собственных сравнений с T5 Gemma 2, Gemma 4 и моделями Qwen 3.5.
На некоторых задачах, связанных с фактологичностью и русским языком, AliceAI выглядит очень сильно.
Например, в опубликованных результатах:
- CultCat: 68,0 у AliceAI против 59,2 у Qwen 3.5 35B-A3B;
- WikiWebFacts: 81,3 против 62,4;
- Ruler 32K: 94,7 против 93,0.
Но говорить, что AliceAI «лучше Qwen», было бы неправильно.
На ряде универсальных, математических и кодовых тестов Qwen 3.5 35B-A3B заметно впереди:
- MMLU: 84,4 у Qwen против 78,5 у AliceAI;
- MATH 500: 81,9 против 62,9;
- HumanEval: 88,3 против 69,3.
То есть картина выглядит логично: AliceAI не пытается быть лучшей моделью вообще во всём. Судя по опубликованным результатам, её сильная сторона — задачи, которые ближе к поисковому сценарию: работа с фактами, извлечение информации, русский язык и длинный контекст.
Есть ещё одна важная оговорка. Все эти цифры сейчас опубликованы самим Яндексом. Масштабной независимой проверки модели пока нет, поэтому относиться к бенчмаркам лучше как к данным разработчика, а не как к окончательному рейтингу.
Можно ли запустить модель локально
Формально — да.
Модель доступна через Hugging Face Transformers, а её веса занимают примерно 69 ГБ.
Но слово «локально» здесь легко вводит в заблуждение.
Это не модель, которую большинство пользователей запустит на обычном ноутбуке с 16 или 32 ГБ памяти. Для комфортного инференса в исходной точности понадобится серверная GPU с большим объёмом памяти или несколько видеокарт. Возможна дальнейшая квантизация, но готовый оптимизированный production-движок Яндекса в открытый доступ не выложен.
Поэтому главный интерес релиза сейчас скорее исследовательский и инженерный: разработчики получают веса, архитектуру и возможность строить собственные дообученные версии, но повторить производительность Яндекс Поиска одним скачиванием модели не получится.
Что здесь действительно важно
Можно посмотреть на этот релиз как на очередную открытую LLM и быстро перейти к сравнению цифр в бенчмарках.
Но мне кажется, интереснее другое.
Alice AI Search показывает, как выглядит генеративный поиск, когда его нужно обслуживать не в демонстрации, а на большом реальном трафике.
В такой системе уже недостаточно просто взять максимально мощную модель.
Нужно одновременно решить несколько задач:
- быстро найти свежую информацию;
- отделить полезные фрагменты от мусора;
- не переплачивать за обработку лишнего контекста;
- уменьшить количество активных вычислений внутри самой LLM;
- сохранить достаточно высокое качество ответа;
- сделать всё это с задержкой, приемлемой для обычного поиска.
Именно поэтому вокруг AliceAI находятся MoE, отдельный экстрактор контекста, поисковый пайплайн и собственная production-инфраструктура.
То есть соревнование постепенно смещается от вопроса «у кого модель умнее?» к вопросу «у кого эффективнее вся система вокруг модели?»
Для поиска это может оказаться намного важнее очередного увеличения числа параметров.
Что пока остаётся неизвестным
Релиз достаточно открытый по меркам крупного коммерческого продукта, но полной картины всё равно нет.
Яндекс не опубликовал оптимизированный production-инференс, а подробности состава и очистки обучающего корпуса раскрыты лишь частично. Кроме того, открыта базовая модель, а не полностью дообученная версия Alice AI Search из Поиска.
И главное — модель вышла буквально вчера.
Поэтому пока у нас есть архитектура, веса и бенчмарки разработчика, но ещё почти нет независимых измерений скорости, качества, требований к железу и реальной эффективности после стороннего дообучения.
Сейчас правильнее воспринимать Alice AI Search Pretrain не как уже доказанного нового лидера среди открытых моделей, а как интересный открытый фундамент поисковой LLM, который теперь можно независимо исследовать.
Ссылки
Ссылки
- Сайт: Официальный анонс Яндекса
- Статья: Технический разбор команды Яндекса на Хабре
- Репозиторий: AliceAI-T5-35B-A0.6B на Hugging Face