23 сентября Stanford и NVIDIA выпустили CLM-8B — открытую модель, которая вместо генерации текста выбирает из набора действий лучшее для текущего состояния. Зачем агенту отдельный быстрый слой решений — разбираю ниже.

У агента уже есть LLM. Она пишет код, вызывает инструменты, отвечает на вопросы. Зачем рядом ставить ещё одну модель, которая умеет только выбирать вариант из списка?

Выбор — самая частая операция в работе агента: какой инструмент вызвать, какой ответ оставить, какой шаг сделать следующим. Ради него большую LLM приходится запускать целиком, а это медленно и дорого. Она выдаёт текст токен за токеном, даже когда нужен просто один вариант из пяти.

Выбор вместо генерации

CLM кодирует текущее состояние и каждый вариант действия в векторы, считает их близость и возвращает вероятность для каждого. Авторы называют её «моделью System One»: быстрый слой решений, который работает рядом с тяжёлой LLM. Отвечает она на три типа вопросов — правда ли утверждение, какой вариант выбрать, как оценить результат по шкале. Это покрывает маршрутизацию инструментов, проверку результатов и выбор лучшего из нескольких сгенерированных ответов.

По заявлению команды, CLM-8B работает на уровне Jev — закрытой System One-модели от TypeSafe AI — при задержке до девяти раз ниже. Оговорка важная: это результат авторских тестов, а не независимой проверки. На вызове инструментов (BFCL v4) модель уже уступает Jev — 95,2% против 99,2%.

Что я бы проверил первым

Скорость объясняется просто: состояния и действия кодируются отдельно и кешируются. У агента набор действий почти не меняется, а к уже виденным состояниям он возвращается постоянно — пересчитывать эмбеддинги каждый раз не нужно, остаётся сравнить готовые векторы. Тот же принцип, что и при выборе LLM под задачу: для выбора варианта из списка не нужен тяжёлый генератор текста.

Код и веса открыты под Apache 2.0, запуск — на одной видеокарте NVIDIA под Linux. Если ваш агент много раз решает однотипные задачи — маршрутизация, сортировка заявок, отбор ответов — быстрый слой выбора может реально разгрузить контур. Цифру «девять раз быстрее» пока стоит принимать как заявление команды, а не как доказанный факт.

Ссылки

Ссылки