Команда Qwen выложила Qwen3.8-27B — плотную vision-language модель с 27 млрд параметров, контекстом 262K и акцентом на агентные задачи. Релиз состоялся 14 августа.
Qwen3.5 и Qwen3.6 уже занимали верхнюю часть открытых бенчмарков. Очередной шаг — не добавление параметров, а смена архитектуры и фокус на автономное выполнение задач.
27B — это плотная модель, не MoE. Параллельно вышел Qwen3.8-2.4T-A95B — смесь экспертов с 2,4 трлн параметров и 95 млрд активных, но разговор сегодня про компактную версию.
Что поменялось в архитектуре
Главное архитектурное решение — гибридное внимание. Из 64 слоёв 48 используют linear attention, 16 — full attention. Паттерн повторяется каждые четыре слоя: три линейных, одно полное. Линейное внимание работает дешевле и держит длинный контекст без квадратичного роста памяти. Полное внимание в каждом четвёртом слое сохраняет качество на сложных фрагментах, где нужен полный доступ к контексту.
Модель нативно работает с изображениями и видео — это не отдельная надстройка, а встроенный vision encoder. Поддерживаются STEM-диаграммы, документы и видео длительностью до часа.
Контекст — 262 144 токена из коробки. Через облачный сервис Qwen Cloud обещают расширение до одного миллиона токенов. Словарь — 248 320 токенов, что заметно больше типичных 128K у предшественников.
Ещё одна деталь: модель обучена с multi-token prediction — предсказанием нескольких токенов одновременно. Это должно ускорять генерацию и улучшать планирование текста.
Бенчмарки: где реальный скачок
Цифры сравнивают с Qwen3.6-27B — предыдущей плотной версией того же размера. Приросты неоднородны: на стандартных задачах — скромные, на агентных — большие.
- SWE-bench Pro (агентный кодинг): 61,7 против 53,5 — плюс 8,2 пункта.
- QwenSWEBench (software engineering): 79,0 против 49,3 — плюс 29,7 пункта. Почти тридцать пунктов.
- Terminal Bench 2.1 (агент в терминале): 73,0 против 63,4.
- OSWorld (computer use): 84,3 против 63,9 — плюс 20,4 пункта.
- WebArena (browser use): 64,8 против 48,8.
- LiveCodeBench v6 (соревновательное программирование): 90,3 против 83,9.
GPQA Diamond — научный reasoning — вырос всего на 1,4 пункта (89,2 против 87,8). HLE — междисциплинарный reasoning — на 6,8 пункта. Общий паттерн: на рассуждениях прирост умеренный, на автономном выполнении — значительный.
Thinking mode и агентные сценарии
Thinking mode включён по умолчанию. Его можно отключать per-request через API, а глубину reasoning настраивать параметром reasoning_effort. Предыдущие сообщения с reasoning сохраняются через preserve_thinking — агент не теряет контекст рассуждения между шагами.
Это важно для многошаговых задач. Когда агент работает в три-пять шагов, каждый раз начинать reasoning с нуля — дорого и неточно. Сохранение цепочки рассуждения делает длинные агентные маршруты стабильнее.
Важно: бенчмарки показывают заявленные разработчиком результаты. Независимых тестов на момент публикации немного. Цифры на своих задачах — не гарантия результата на ваших.
Что это значит на практике
Плотная 27B-модель с Apache 2.0 — это категория, где конкуренция за последние месяцы сильно выросла. Модель можно крутить локально на одной видеокарте с 24 ГБ памяти в FP8, а GGUF-квантизации от unsloth и bartowski уже доступны.
Главный вопрос — не «умнее ли она», а «где она надёжнее в агентной цепочке». Бенчмарки намекают на ответ: автономный кодинг и работа с интерфейсами — интерфейс компьютера, браузер, мобильные устройства. Если у вас есть агентный процесс, где модель регулярно падает на длинных маршрутах, Qwen3.8-27B — кандидат на проверку.
Я бы начал с одной задачи: выберите процесс, где текущая модель делает 3-5 шагов и срывается на четвёртом. Прогоните его на Qwen3.8-27B и сравните долю успешных завершений. Не переносите весь конвейер — проверьте на одном маршруте.
Совет: для первого теста берите задачу с измеримым результатом — исправленный баг, найденный файл, выполненный API-вызов. Не «оценку качества текста», а конкретный pass/fail.
Ограничения
Ограничения
Модель свежая. Экосистемная поддержка — vLLM и SGLang заявлены в README, но реальные инструкции развёртывания ещё наполняются. Cloud-версия с контекстом до миллиона токенов объявлена как coming soon — её пока нет.
Vision-часть — native, но без отдельных бенчмарков по видео на момент релиза. Если видео — ваш основной сценарий, стоит дождаться независимых тестов.
Qwen3.8-27B — не «ещё одна большая модель». Это попытка сдвинуть плотную архитектуру в зону, где раньше правили только закрытые системы: автономный кодинг, computer use, browser use. Если бенчмарки подтвердятся на реальных задачах — открытые модели перешагнули планку, за которой их можно ставить в агентный контур без оговорок.
Ссылки
Ссылки
- Репозиторий: Qwen/Qwen3.8-27B — Hugging Face
- Сайт: Qwen Cloud — Qwen3.8-27B