Marin запустила обучение модели на 535 миллиардов параметров и открыла почти весь процесс — от данных до промежуточных контрольных точек.

Обычно большая модель появляется так: компания обучила её, показала бенчмарк, иногда выложила веса. Что было внутри — какие данные, какая архитектура, какие запуски провалились — остаётся за кадром.

Marin работает иначе. Это открытая лаборатория, которая документирует каждый шаг по мере работы. В репозитории проекта так и написано: каждый шаг от сырых данных до финальной модели записывается, а неудачные эксперименты — часть этой записи.

Что именно запустили

Сейчас главный фокус Marin — обучение с нуля большой модели со смесью экспертов. Речь о 535 миллиардах общих параметров, из которых на каждом шаге активно около 23 миллиардов. Это архитектура MoE: модель состоит из сотен «экспертов», и на каждый токен срабатывает лишь небольшая их часть.

План обучения — 18,75 триллиона токенов на 11 стойках GB200 NVL72, примерно три месяца работы и 2,7×10²⁴ FLOPs вычислений. Восемьдесят процентов — предобучение, двадцать — промежуточная стадия, дальше постобучение.

Здесь есть тонкость, которую стоит держать в голове. В публичном анонсе фигурирует 18,75 триллиона токенов, а в одной из опубликованных конфигураций — 18,0 триллиона. Поэтому правильнее говорить о заявленном плане, а не о зафиксированном объёме.

Почему за этим стоит следить

У большинства крупных моделей публика видит только результат. Здесь виден процесс: эксперименты по масштабированию, выбор архитектуры, ошибки, производительность инфраструктуры, потери, промежуточные контрольные точки.

Команда выкладывает не только веса после обучения, но и смесь данных, примеры документов, значения функции потерь и детали реализации. Каждый эксперимент оформлен как задача на GitHub — с гипотезой, кодом и результатами.

Для тех, кто работает с ИИ, это редкая возможность увидеть, как принимаются решения при обучении большой модели. Не очередное сравнение бенчмарков, а почти весь путь создания модели.

Следить за Marin 535B стоит ради процесса. Если вы строите продукты на ИИ, откройте репозиторий и посмотрите, как команда фиксирует решения и ошибки — часть этих практик можно перенести в собственную работу с моделями.

Ссылки

Ссылки