Команда Qwen выложила Qwen3.8-27B — плотную vision-language модель с 27 млрд параметров, контекстом 262K и акцентом на агентные задачи. Релиз состоялся 14 августа.

Qwen3.5 и Qwen3.6 уже занимали верхнюю часть открытых бенчмарков. Очередной шаг — не добавление параметров, а смена архитектуры и фокус на автономное выполнение задач.

27B — это плотная модель, не MoE. Параллельно вышел Qwen3.8-2.4T-A95B — смесь экспертов с 2,4 трлн параметров и 95 млрд активных, но разговор сегодня про компактную версию.

Что поменялось в архитектуре

Главное архитектурное решение — гибридное внимание. Из 64 слоёв 48 используют linear attention, 16 — full attention. Паттерн повторяется каждые четыре слоя: три линейных, одно полное. Линейное внимание работает дешевле и держит длинный контекст без квадратичного роста памяти. Полное внимание в каждом четвёртом слое сохраняет качество на сложных фрагментах, где нужен полный доступ к контексту.

Модель нативно работает с изображениями и видео — это не отдельная надстройка, а встроенный vision encoder. Поддерживаются STEM-диаграммы, документы и видео длительностью до часа.

Контекст — 262 144 токена из коробки. Через облачный сервис Qwen Cloud обещают расширение до одного миллиона токенов. Словарь — 248 320 токенов, что заметно больше типичных 128K у предшественников.

Ещё одна деталь: модель обучена с multi-token prediction — предсказанием нескольких токенов одновременно. Это должно ускорять генерацию и улучшать планирование текста.

Бенчмарки: где реальный скачок

Цифры сравнивают с Qwen3.6-27B — предыдущей плотной версией того же размера. Приросты неоднородны: на стандартных задачах — скромные, на агентных — большие.

  • SWE-bench Pro (агентный кодинг): 61,7 против 53,5 — плюс 8,2 пункта.
  • QwenSWEBench (software engineering): 79,0 против 49,3 — плюс 29,7 пункта. Почти тридцать пунктов.
  • Terminal Bench 2.1 (агент в терминале): 73,0 против 63,4.
  • OSWorld (computer use): 84,3 против 63,9 — плюс 20,4 пункта.
  • WebArena (browser use): 64,8 против 48,8.
  • LiveCodeBench v6 (соревновательное программирование): 90,3 против 83,9.

GPQA Diamond — научный reasoning — вырос всего на 1,4 пункта (89,2 против 87,8). HLE — междисциплинарный reasoning — на 6,8 пункта. Общий паттерн: на рассуждениях прирост умеренный, на автономном выполнении — значительный.

Thinking mode и агентные сценарии

Thinking mode включён по умолчанию. Его можно отключать per-request через API, а глубину reasoning настраивать параметром reasoning_effort. Предыдущие сообщения с reasoning сохраняются через preserve_thinking — агент не теряет контекст рассуждения между шагами.

Это важно для многошаговых задач. Когда агент работает в три-пять шагов, каждый раз начинать reasoning с нуля — дорого и неточно. Сохранение цепочки рассуждения делает длинные агентные маршруты стабильнее.

Важно: бенчмарки показывают заявленные разработчиком результаты. Независимых тестов на момент публикации немного. Цифры на своих задачах — не гарантия результата на ваших.

Что это значит на практике

Плотная 27B-модель с Apache 2.0 — это категория, где конкуренция за последние месяцы сильно выросла. Модель можно крутить локально на одной видеокарте с 24 ГБ памяти в FP8, а GGUF-квантизации от unsloth и bartowski уже доступны.

Главный вопрос — не «умнее ли она», а «где она надёжнее в агентной цепочке». Бенчмарки намекают на ответ: автономный кодинг и работа с интерфейсами — интерфейс компьютера, браузер, мобильные устройства. Если у вас есть агентный процесс, где модель регулярно падает на длинных маршрутах, Qwen3.8-27B — кандидат на проверку.

Я бы начал с одной задачи: выберите процесс, где текущая модель делает 3-5 шагов и срывается на четвёртом. Прогоните его на Qwen3.8-27B и сравните долю успешных завершений. Не переносите весь конвейер — проверьте на одном маршруте.

Совет: для первого теста берите задачу с измеримым результатом — исправленный баг, найденный файл, выполненный API-вызов. Не «оценку качества текста», а конкретный pass/fail.

Ограничения

Ограничения

Модель свежая. Экосистемная поддержка — vLLM и SGLang заявлены в README, но реальные инструкции развёртывания ещё наполняются. Cloud-версия с контекстом до миллиона токенов объявлена как coming soon — её пока нет.

Vision-часть — native, но без отдельных бенчмарков по видео на момент релиза. Если видео — ваш основной сценарий, стоит дождаться независимых тестов.

Qwen3.8-27B — не «ещё одна большая модель». Это попытка сдвинуть плотную архитектуру в зону, где раньше правили только закрытые системы: автономный кодинг, computer use, browser use. Если бенчмарки подтвердятся на реальных задачах — открытые модели перешагнули планку, за которой их можно ставить в агентный контур без оговорок.

Ссылки

Ссылки