23 сентября Stanford и NVIDIA выпустили CLM-8B — открытую модель, которая вместо генерации текста выбирает из набора действий лучшее для текущего состояния. Зачем агенту отдельный быстрый слой решений — разбираю ниже.
У агента уже есть LLM. Она пишет код, вызывает инструменты, отвечает на вопросы. Зачем рядом ставить ещё одну модель, которая умеет только выбирать вариант из списка?
Выбор — самая частая операция в работе агента: какой инструмент вызвать, какой ответ оставить, какой шаг сделать следующим. Ради него большую LLM приходится запускать целиком, а это медленно и дорого. Она выдаёт текст токен за токеном, даже когда нужен просто один вариант из пяти.
Выбор вместо генерации
CLM кодирует текущее состояние и каждый вариант действия в векторы, считает их близость и возвращает вероятность для каждого. Авторы называют её «моделью System One»: быстрый слой решений, который работает рядом с тяжёлой LLM. Отвечает она на три типа вопросов — правда ли утверждение, какой вариант выбрать, как оценить результат по шкале. Это покрывает маршрутизацию инструментов, проверку результатов и выбор лучшего из нескольких сгенерированных ответов.
По заявлению команды, CLM-8B работает на уровне Jev — закрытой System One-модели от TypeSafe AI — при задержке до девяти раз ниже. Оговорка важная: это результат авторских тестов, а не независимой проверки. На вызове инструментов (BFCL v4) модель уже уступает Jev — 95,2% против 99,2%.
Что я бы проверил первым
Скорость объясняется просто: состояния и действия кодируются отдельно и кешируются. У агента набор действий почти не меняется, а к уже виденным состояниям он возвращается постоянно — пересчитывать эмбеддинги каждый раз не нужно, остаётся сравнить готовые векторы. Тот же принцип, что и при выборе LLM под задачу: для выбора варианта из списка не нужен тяжёлый генератор текста.
Код и веса открыты под Apache 2.0, запуск — на одной видеокарте NVIDIA под Linux. Если ваш агент много раз решает однотипные задачи — маршрутизация, сортировка заявок, отбор ответов — быстрый слой выбора может реально разгрузить контур. Цифру «девять раз быстрее» пока стоит принимать как заявление команды, а не как доказанный факт.
Ссылки
Ссылки
- Статья: Contrastive Language Models — официальный анонс
- Репозиторий: Contrastive-LM/CLM