Aleph Alpha выпустила Kolibri — немецко-английскую Mixture-of-Experts модель для регулируемых отраслей: госсектора, промышленности, аэрокосмоса. Полные веса открыты под Apache 2.0, а главная ставка сделана не на мощность, а на суверенный запуск внутри собственной инфраструктуры компании.

Большинство сильных моделей с открытыми весами пишутся под английский и под облачную экономику. Организации, которым нельзя отдавать данные наружу — министерства, промышленные предприятия, подрядчики в чувствительных сферах, — оказываются перед неудобным выбором: сильная модель, но чужая инфраструктура, либо своя инфраструктура, но модель заметно слабее.

Kolibri отвечает именно на эту потребность. Это модель с относительно небольшим числом активных параметров, которую реально развернуть на собственных мощностях, обученная в Европе по европейским правилам. В анонсе от 3 октября компания прямо называет это суверенным ИИ, и здесь интереснее не очередные бенчмарки, а сама ставка.

Модель под локальный запуск, а не под облако

Kolibri — Mixture-of-Experts трансформер на 78,1 млрд параметров, из которых при обработке одного токена активно около 3,46 млрд. Архитектура на 50 слоёв, все — MoE, с 384 экспертами, из которых на токен задействуются шесть. Такой разброс между полным и активным числом параметров — это не маркетинговая деталь, а ключ к экономике запуска: платишь за вычислительную мощность как за модель в 3 млрд, а получаешь качество заметно более крупной.

Обучение шло на 768 GPU B200 в Германии и Финляндии. Через три этапа — предобучение, mid-training и адаптацию к длинному контексту — прошло почти 24 трлн токенов. В основном предобучении 21,3% данных были на немецком, что для компании из Гейдельберга принципиально: модель двуязычная по построению, а не англоязычная модель, которая немного читала по-немецки.

Предшественником была Kolibri Origin — 30,6 млрд параметров, 3,27 млрд активных, окно контекста 65 тыс. токенов. Между моделями три месяца, за которые компания подняла размер почти в 2,5 раза, расширила контекст и перестроила маршрутизацию экспертов. Это важная деталь: Kolibri — не разовый релиз, а результат выстроенного конвейера, который компания намерена использовать и дальше.

Практический смысл таких параметров хорошо ложится на давно известную развилку: локальный запуск против облачного API. Модель с открытыми весами и небольшим числом активных параметров — это возможность оставить данные у себя, не платя при этом за чужую инфраструктуру.

Анонс релиза модели Kolibri в блоге Aleph Alpha: суверенная open-weight архитектура и запуск в инфраструктуре компании

Открытые веса — но не open-source

Веса модели выложены на Hugging Face под лицензией Apache 2.0, и здесь нужна точность. Сама Aleph Alpha называет модель open-weight, и это правильное слово: лицензия распространяется на опубликованные веса и конфигурационные файлы, а не на весь тренировочный конвейер компании. Данные, код обучения и внутренние наработки остаются закрытыми.

Для заказчика это значит следующее: скачать и запустить модель можно свободно, но воспроизвести её обучение или дообучить на своих данных так же открыто, как у полностью open-source проектов, не выйдет. Открытость здесь — инструмент контроля и проверки, а не лицензия на копирование всей цепочки. Если нужно понять, как вообще оценивать такие модели перед внедрением, есть отдельный разбор: как выбрать LLM под конкретную задачу.

Репозиторий и карточка модели Kolibri-1-BF16 на Hugging Face с открытыми весами под Apache 2.0

Суверенность здесь — про процесс, а не про флаг

Aleph Alpha вкладывает в слово «суверенность» два измерения. Первое — как построена модель: вся цепочка, от отбора данных через предобучение и постобучение до финальных оценок, проходит внутри компании на европейской инфраструктуре, без внешнего контроля. Второе — как модель переходит к заказчику: полная свобода развёртывания, контроль над данными и интеллектуальной собственностью.

Компания прямо пишет, что модель разрабатывалась с учётом EU AI Act, General-Purpose AI Code of Practice и GDPR. На практике это обещание, что соответствие требованиям регуляторов заложено в сам продукт, а не прикручивается к нему потом. Для организаций, которые обязаны отвечать за обработку данных, это снимает часть вопросов при закупке.

Заявленный контекст и реальный режим работы

Заявленный контекст — до 1 048 576 токенов. Но компания сама рекомендует для сложных задач и эффективного запуска держаться в пределах примерно 262 тыс. токенов: это длина, на которой модель фактически обучалась, а не теоретический предел, который включается отдельным флагом при запуске. Такая честность в анонсе — редкая и полезная вещь: она сразу задаёт реалистичные ожидания.

Модель поддерживает tool calling — вызов внешних инструментов, — и четыре режима рассуждения: none, low, medium и high. Это регулируемый уровень усилий: заказчик сам решает, сколько вычислений модель потратит на ответ, и может менять баланс между стоимостью, скоростью и качеством под конкретную задачу. Для агентных сценариев это важнее одного фиксированного уровня интеллекта.

Модель, которую учили говорить «не знаю»

Отдельная ставка — борьба с галлюцинациями. Стандартное обучение поощряет угадывание: у догадки есть шанс попасть в ответ, а у отказа отвечать — нет. Для регулируемого заказчика модель, которая умеет воздержаться, когда в контексте нет ответа, — это разница между пилотом и промышленной эксплуатацией.

Kolibri учили отказываться на данных, где правильный ответ — «я не знаю», и по собственной процедуре Merlin-Arthur: синтетические примеры, где из документа убирают нужное свидетельство, а модель должна распознать, что отвечать не на что. По заявлениям компании, модель воздерживается вместо неверного ответа на 44% пунктов AA-Omniscience против 15% у Kolibri Origin. Это та самая способность, которую заказчик в госсекторе просит в первую очередь: отвечать только по документам, а не сочинять правдоподобное.

Тесты пока проводила только сама Aleph Alpha

Компания приводит сравнительные таблицы, где Kolibri по математике, коду и агентным задачам сопоставим с моделями, у которых активных параметров в разы больше — вплоть до четырёх раз. Но относиться к этим цифрам стоит как к данным самой Aleph Alpha: бенчмарки запускались на собственных харнесах компании, и независимых проверок на момент публикации нет.

Есть и собственные внутренние оценки по вертикалям — немецкий госсектор, аэрокосмос, автопром, полупроводники, — где модель, по словам компании, наращивает результат между контрольными точками обучения. Эти метрики ещё менее независимы: они собраны под задачи конкретных заказчиков, это косвенные показатели, а не открытый стандарт. Их стоит читать как демонстрацию подхода, а не как доказательство превосходства.

Что это меняет для практики

Главное изменение — в расчёте, где держать модель. Открытые веса, относительно небольшое число активных параметров и поддержка локального запуска означают, что организация может оставить чувствительные данные внутри своего периметра, а не отдавать их в сторонний облачный сервис. Для тех, кто уже решал для себя вопрос локального против облачного ИИ, это ещё один аргумент в пользу первого варианта.

Для агентных сценариев полезна связка из tool calling и управляемых режимов рассуждения: можно держать часть задач на дешёвом режиме без рассуждений, а тяжёлые переключать на high. Но не стоит переносить на модель критический процесс сразу. Возьмите один повторяющийся сценарий, где ответ должен опираться на внутренние документы, и проверьте две вещи: насколько точно модель отказывается отвечать, когда ответа в документах нет, и во что обходится запуск на вашей инфраструктуре.

Почему не стоит торопиться с выводами

Независимых тестов нет, и до их появления сравнительные цифры остаются заявлением разработчика. Контекст в миллион токенов — технически возможный предел, а не рабочий режим: для сложных задач разумно ориентироваться на 262 тыс. токенов, и это стоит закладывать в оценку сценариев.

Запуск такой модели всё равно требует заметной инфраструктуры и навыков её обслуживания: vLLM, контейнеры, настройка плагинов. Для небольшой команды без инженерной поддержки порог входа выше, чем у облачного API. А открытость ограничена весами: полную цепочку обучения воспроизвести не получится, поэтому «суверенность» не означает независимость от поставщика во всех смыслах.

Кому стоит присмотреться

Модель адресована в первую очередь организациям в регулируемых сферах, где контроль данных и локальный запуск — обязательное условие, а не приятная опция: госсектор, промышленность, аэрокосмос, финансы. Если вы работаете преимущественно на немецком языке, двуязычность модели — отдельный аргумент: таких моделей с открытыми весами заметно меньше, чем англоязычных.

Если же задача — быстрый прототип агента без ограничений по данным, разумнее начать с облачного API и не поднимать инфраструктуру ради проверки гипотезы. Выбор между локальной и облачной моделью — это отдельное решение, и его стоит принимать по требованиям к данным и бюджету, а не по анонсу.

Суверенный ИИ как отдельная категория рынка

Kolibri — это не ещё одна модель в гонке бенчмарков, а заявка на отдельную категорию: суверенный ИИ, где открытые веса, европейское обучение и локальный запуск собираются в один продукт под регулируемых заказчиков. Aleph Alpha делает ставку на то, что для определённого класса организаций контроль над данными и соответствие регуляторике важнее нескольких процентных пунктов в тесте.

Станет ли эта категория значимой, покажут не бенчмарки, а то, как быстро компании начнут переводить на такие модели реальные чувствительные процессы. Пока это скорее проверяемая гипотеза, чем сложившийся тренд, — но гипотеза с понятным способом проверки: один сценарий, одна неделя, один измеримый результат.