Open-source LLM прошли за три года путь от curiosum до инфраструктуры. В 2023 году Llama показала, что открытые модели могут соревноваться с проприетарными. К 2026 году поле стало тесным: Llama, Mistral, Qwen, DeepSeek, Yi — каждый со своей стратегией.

Qwen отличается от остальных одним ходом: не текст, а модальности. Текст, изображения, аудио, видео — в едином конвейере, без склейки из отдельных моделей. Плюс 201 язык, более 100 открытых моделей и свыше 40 миллионов скачиваний на Hugging Face.

Это не очередная модельная карточка. Это экосистема, в которой есть всё: от 0.6-миллиардной модели для телефона до 397-миллиардного флагмана с архитектурой MoE. Кодинг-агенты, reasoning, генерация изображений, голос в реальном времени, embedding и reranker для RAG, world models для симуляции агентных сред.

Разберём, как устроена эта экосистема, какие семейства в неё входят, что в каждом реально работает, и где граница между open-source и open-weights, которую Qwen проходит осторожно.

Что это

Qwen, полное имя Tongyi Qianwen (по-китайски — «всеобъемлющее понимание письменности»), — линейка нейросетей от Alibaba Cloud, охватывающая текст, зрение, звук и видео. Разработка началась весной 2023 года, и за три года проект превратился в одну из крупнейших открытых ML-экосистем.

Цифры дают масштаб: более 100 открытых моделей, свыше 40 миллионов скачиваний, поддержка 201 языка. Но за цифрами стоит прагматичная архитектурная стратегия: не одна модель на все случаи, а семейства, каждое из которых заточено под конкретный контур работы.

Экосистема Qwen охватывает двенадцать основных направлений. Каждое закрывает свою задачу:

СемействоНазначениеАктуальная версия
Qwen3.6 / Qwen3.5Основные текстовые LLM (dense и MoE), фокус на coding и reasoningQwen3.6-27B, Qwen3.6-35B-A3B, Qwen3.5-397B-A17B
Qwen3Базовые текстовые LLM с thinking/instruct режимамиQwen3-235B-A22B, Qwen3-Instruct-2507, Qwen3-Thinking-2507
Qwen3-VLВизуальные языковые модели (понимание изображений и видео)Qwen3-VL-235B-A22B, Qwen3-VL-2B/4B/8B/32B
Qwen3-OmniНативная мультимодальность: текст + изображения + аудио + видеоQwen3-Omni-30B-A3B-Instruct, Qwen3-Omni-30B-A3B-Thinking
Qwen2.5-OmniМультимодальность предыдущего поколенияQwen2.5-Omni-7B, Qwen2.5-Omni-3B
QwQМодели с усиленным рассуждением (аналог o1)QwQ-32B
Qwen3-CoderСпециализированные модели для кода и агентного программированияQwen3-Coder-480B-A35B, Qwen3-Coder-30B-A3B, Qwen3-Coder-Next
Qwen3-TTSСинтез речи (text-to-speech)Qwen3-TTS-1.7B, Qwen3-TTS-0.6B (CustomVoice, VoiceDesign)
Qwen3-ASRРаспознавание речи (automatic speech recognition)Qwen3-ASR-0.6B, Qwen3-ASR-1.7B
Qwen-ImageГенерация и редактирование изображенийQwen-Image-2512, Qwen-Image-Edit-2511, Qwen-Image-2.0
Qwen3-Embedding / RerankerВекторные представления и ререйтинг для RAGQwen3-Embedding-0.6B/4B/8B, Qwen3-Reranker-0.6B/4B/8B
Qwen-AgentWorldLanguage world model для симуляции агентных средQwen-AgentWorld-35B-A3B

Каждое семейство — не просто ребрендинг базовой модели. Qwen3-Coder проходит обучение на реальных coding-задачах с запуском кода в песочницах, обратной связью от среды и reinforcement learning. QwQ заточена под усиленное рассуждение — аналог подхода o1 от OpenAI, где модель тратит больше вычислений на обдумывание сложных вопросов. Qwen3-VL работает с изображениями и видео как с равноправными модальностями. Qwen-AgentWorld симулирует целые среды, в которых агенты действуют.

Зачем нужно

Открытые модели решают три задачи, которые закрытые (GPT, Claude, Gemini) закрывают плохо или дорого: локальный запуск без отправки данных наружу, кастомный fine-tuning под домен, и контроль над стоимостью инференса.

Qwen закрывает все три, но с разной эффективностью. Dense-модели от 0.6B до 14B работают на одном GPU или даже на CPU — для edge-сценариев, on-device приложений, встраивания в продукты. MoE-варианты дают качество крупных моделей при стоимости, сопоставимой с моделями в 10-20 раз меньше.

Мультимодальность Omni — отдельный кейс. Если ваш продукт работает с голосом, изображениями и видео, вам не нужно склеивать три разные модели и orchestrate между ними. Одна модель принимает все модальности в едином контексте. Это упрощает архитектуру и снижает задержку.

Агентные сценарии — третий контур. Qwen3-Coder-Next заточена под работу в coding-агентах: модель обучена вызывать инструменты, взаимодействовать со средой и писать исполняемый код. Qwen Code — терминальный CLI-агент, аналог Claude Code, но на моделях Qwen. Qwen-AgentWorld идёт дальше: не просто агент, а симулятор среды, в которой агент действует.

RAG-инфраструктура — четвёртый контур. Qwen3-Embedding и Qwen3-Reranker покрывают оба звена векторного поиска: embedding для индексации и reranker для уточнения результатов. VL-версии работают с визуальным контентом — можно строить мультимодальный RAG.

Как устроено

Dense и MoE: два архитектурных подхода

Qwen выпускает модели в двух архитектурных вариантах, и разница между ними принципиальная.

Dense (плотные) — все параметры активны при каждом запросе. Это классическая архитектура: каждый токен проходит через всю нейросеть целиком. Версии Qwen3: 0.6B, 1.7B, 4B, 8B, 14B, 32B. Версии Qwen3.5: 0.8B, 2B, 4B, 9B, 27B. Чем больше параметров, тем выше качество, но и тем больше вычислений на каждый токен ответа.

MoE (Mixture of Experts — смесь экспертов) — при каждом запросе активируется только часть параметров. Внутри модели находятся несколько «экспертов» — подсетей, каждая из которых специализируется на определённых типах задач. Маршрутизатор определяет, какого эксперта задействовать для каждого токена. Версии Qwen3: 30B-A3B (активны 3B), 235B-A22B (активны 22B). Версии Qwen3.5: 35B-A3B (активны 3B), 122B-A10B (активны 10B), 397B-A17B (активны 17B). Версии Qwen3.6: 35B-A3B (активны 3B).

У флагмана Qwen3.5-397B-A17B в работе задействованы лишь 17 из 397 миллиардов параметров. Остальные 380 миллиардов покоятся в памяти без вычислений на каждый токен — их роль в том, чтобы давать качество большого MoE по цене маленькой dense-модели. Чем меньше активных параметров, тем дешевле каждый ответ.

Инсайт: MoE-архитектура — это не компромисс между качеством и стоимостью, а способ разорвать связь между размером модели и ценой инференса. 397B-модель с 17B активными параметрами работает по стоимости как 17B-модель, но с качеством 397B.

Thinking и Instruct: два режима работы

Начиная с Qwen3, модели поддерживают два режима работы. Qwen3.5 и Qwen3.6 унаследовали этот подход.

Instruct (он же non-thinking) — режим быстрого ответа. Модель генерирует ответ напрямую, без промежуточного рассуждения. Подходит для чата, простой генерации текста, инструкций, перевода. Qwen3-Instruct-2507 — обновлённая версия с улучшениями в инструкциях, логике, коде и tool use, контекст 256K (расширяемый до 1M).

Thinking — режим рассуждения. Модель тратит дополнительные токены на «обдумывание» перед ответом, аналогично подходу o1 от OpenAI. Qwen3-Thinking-2507 показала state-of-the-art результаты среди open-weight thinking-моделей на бенчмарках reasoning, математики, науки и кода. Thinking-режим доступен и в визуальных моделях — Qwen3-VL-Thinking, и в мультимодальных — Qwen3-Omni-30B-A3B-Thinking.

В Qwen3 (первый релиз, апрель 2025) переключение между режимами делалось через параметр `enable_thinking` в `tokenizer.apply_chat_template`. Начиная с Qwen3-2507 модели разделены на отдельные чекпойнты: Instruct-2507 поддерживает только non-thinking, Thinking-2507 — только thinking. Это упрощает деплой: не нужно настраивать режим в рантайме.

Qwen3-Omni: нативная мультимодальность

Qwen3-Omni — флагманская мультимодальная модель, выпущенная в сентябре 2025 года. Обрабатывает текст, изображения, аудио и видео в едином вычислительном конвейере. Ключевое слово — «едином»: это не склейка из отдельных моделей-энкодеров, а end-to-end архитектура, где все модальности проходят через общую систему внимания.

Ключевые возможности:

  • SOTA по модальностям — SOTA на 22 из 36 аудио/видео бенчмарков, open-source SOTA на 32 из 36. Распознавание речи, понимание аудио и голосовые диалоги на уровне Gemini 2.5 Pro.
  • Многоязычность — 119 текстовых языков, 19 языков речевого ввода, 10 языков речевого вывода. Речевой ввод: английский, китайский, корейский, японский, немецкий, русский, итальянский, французский, испанский, португальский, малайский, нидерландский, индонезийский, турецкий, вьетнамский, кантонский, арабский, урду. Речевой вывод: английский, китайский, французский, немецкий, русский, итальянский, испанский, португальский, японский, корейский.
  • Архитектура Thinker-Talker — MoE-дизайн с двумя компонентами. Thinker отвечает за понимание и формирование ответа, Talker — за речевой вывод. Предобучение AuT даёт сильные общие представления, multi-codebook дизайн снижает задержку до минимума.
  • Real-time взаимодействие — низкая задержка стриминга с естественной сменой ходов. Можно перебить модель mid-sentence, и она корректно обработает прерывание.
  • Гибкое управление — поведение настраивается через system prompts, без необходимости fine-tuning. Лёгкая адаптация под конкретные сценарии.
  • Audio Captioner — Qwen3-Omni-30B-A3B-Captioner: отдельная open-source модель для детального описания аудио с низкой галлюцинацией. Заполняет пробел в open-source сообществе по аудио-описанию.

Qwen2.5-Omni — предыдущее поколение, выпущенное в марте 2025. Доступно в размерах 3B и 7B. Та же концепция Thinker-Talker, TMRoPE-позиционное кодирование для синхронизации видео и аудио. Qwen2.5-Omni-7B заняла первое место среди open-source моделей в бенчмарках MMAU и MMSU.

Qwen3-VL: визуальное понимание

Qwen3-VL — новейшее поколение визуальных языковых моделей Qwen, выпущенное в сентябре-октябре 2025. Самая мощная vision-language модель в серии Qwen на данный момент. Доступна в Dense и MoE архитектурах, от edge до cloud, в Instruct и Thinking редакциях.

Размеры: 2B, 4B, 8B, 30B-A3B, 32B, 235B-A22B. Ключевые возможности:

  • Visual Agent — управляет GUI ПК и мобильных устройств: распознаёт элементы, понимает функции, вызывает инструменты, выполняет задачи.
  • Visual Coding — генерирует Draw.io/HTML/CSS/JS из изображений и видео.
  • Контекст 256K (расширяемый до 1M) — обрабатывает книги и многочасовые видео с полным recall и секундной индексацией.
  • 3D-пространственное восприятие — оценивает позиции объектов, точки обзора, перекрытия. 2D и 3D grounding для пространственного reasoning и embodied AI.
  • OCR на 32 языках — расширено с 10 до 32 языков. Устойчив к плохому освещению, размытию, наклону. Работает с редкими и древними символами, лучше парсит длинные документы.
  • Архитектурные обновления — Interleaved-MRoPE для long-horizon видео reasoning, DeepStack для multi-level ViT features, Text-Timestamp Alignment для точной локализации событий в видео.

Qwen3-Coder: агентный кодинг

Qwen3-Coder — линейка моделей, заточенных под кодинг и агентные сценарии. Доступна в трёх размерах: Qwen3-Coder-480B-A35B-Instruct (флагман), Qwen3-Coder-30B-A3B-Instruct (компактный), Qwen3-Coder-Next (на базе Qwen3-Next-80B-A3B).

Qwen3-Coder-Next построена на гибридной архитектуре с attention и MoE. Обучена на масштабных задачах с исполняемым кодом, взаимодействием со средой и обучением с подкреплением. Результат — сильные кодинг и агентные способности при значительно меньшей стоимости инференса.

Ключевые характеристики:

  • 358 языков программирования — от ABAP до Zig. Полный список доступен в репозитории.
  • Контекст 256K (расширяемый до 1M через YaRN) — оптимизирован для понимания репозитория целиком.
  • Интеграция с платформами — Qwen Code (собственный CLI), CLINE, Claude Code. Специальный формат function calling для совместимости.
  • Agentic Coding на уровне Claude Sonnet — результаты сопоставимы с Claude Sonnet на бенчмарках Agentic Coding, Agentic Browser-Use и других задачах кодинга.

Qwen Code — отдельный open-source CLI-агент для терминала, оптимизированный под модели Qwen. Аналог Claude Code, но с моделями Qwen. Поддерживает OpenAI, Anthropic, Gemini и Qwen API, а также локальные модели через Ollama и vLLM. Доступен через npm, Homebrew и инсталлятор.

# Установка Qwen Code
# Linux / macOS:
curl -fsSL https://qwen-code-assets.oss-cn-hangzhou.aliyuncs.com/installation/install-qwen-standalone.sh | bash

# NPM (требуется Node.js 22+):
npm install -g @qwen-code/qwen-code@latest

# Запуск:
qwen          # интерактивный терминальный UI
/auth         # настройка провайдера и API-ключа

QwQ: усиленное рассуждение

QwQ-32B — модель с усиленным рассуждением в серии Qwen, выпущенная в ноябре 2024 года. В отличие от instruction-tuned моделей, QwQ использует продвинутое рассуждение и критическое мышление для решения сложных задач. Mid-sized модель, которая конкурирует с DeepSeek-R1 и o1-mini.

QwQ основана на Qwen2.5 и работает через HuggingFace transformers. С выходом Qwen3 и разделением на Instruct/Thinking-режимы, функциональность QwQ частично перешла в Qwen3-Thinking-2507. Но QwQ-32B остаётся доступной и используется в проектах, где нужен чистый reasoning без мультимодальности.

Qwen-Image: генерация и редактирование изображений

Qwen-Image — 20B MMDiT image foundation model, выпущенная в августе 2025. Достигла значительных успехов в сложном рендеринге текста и точном редактировании изображений. Сильна в текст-рендеринге, особенно для китайского языка.

Линейка Qwen-Image включает:

  • Qwen-Image-2512 (декабрь 2025) — декабрьское обновление: более реалистичные люди, тоньше текстуры природы, сильнее рендеринг текста. Заняла первое место среди open-source моделей на AI Arena в 10 000+ blind rounds.
  • Qwen-Image-Edit-2511 (декабрь 2025) — редактирование изображений: style transfer, вставка/удаление объектов, улучшение деталей, редактирование текста на изображениях, позы людей.
  • Qwen-Image-Layered (декабрь 2025) — многослойная генерация, работает с композицией.
  • Qwen-Image-2.0 (февраль 2026) — next-generation: профессиональный рендеринг типографики для инфографики, PPT, постеров, комиксов. Нативное разрешение 2K. Единый режим генерации и редактирования.

Qwen-Image поддерживает LoRA-модели (например, MajicBeauty для реалистичных портретов), нативно работает в ComfyUI, поддерживается vLLM-Omni и SGLang-Diffusion для инференса.

Qwen3-TTS и Qwen3-ASR: аудио-модели

Qwen3-TTS — синтез речи (text-to-speech). Доступна в размерах 0.6B и 1.7B, в трёх вариантах: Base, CustomVoice (клонирование голоса по образцу), VoiceDesign (дизайн голоса). Qwen3-ASR — распознавание речи (automatic speech recognition). Размеры 0.6B и 1.7B. Qwen3-ForcedAligner-0.6B — forced alignment для точной синхронизации звука и текста. Эти модели закрывают полный цикл работы с речью: от распознавания до синтеза.

Qwen2-Audio-7B — предыдущее поколение аудио-языковых моделей. Поддерживает voice chat (свободное голосовое взаимодействие без текстового ввода) и audio analysis (анализ аудио по текстовым инструкциям). Лучше всего работает с аудио до 30 секунд.

Embedding и Reranker: RAG-инфраструктура

Qwen3-Embedding — векторные представления для семантического поиска и индексации. Размеры: 0.6B, 4B, 8B. Самая скачиваемая модель в экосистеме — Qwen3-Embedding-0.6B (более 10 миллионов скачиваний). Qwen3-VL-Embedding — версия для визуального контента, размеры 2B и 8B. Позволяет строить мультимодальный RAG: поиск по тексту и изображениям.

Qwen3-Reranker — реранжировщик для уточнения результатов поиска. Размеры: 0.6B, 4B, 8B. Qwen3-VL-Reranker — версии для визуального контента (2B, 8B). Reranker работает после embedding-поиска: берёт топ-K кандидатов и переупорядочивает их по релевантности, улучшая точность поиска.

Qwen-AgentWorld: language world model для агентов

Qwen-AgentWorld-35B-A3B, выпущенная в июне 2026, — native language world model для симуляции агентных сред. Не просто агент, а симулятор среды, в которой агент действует. Покрывает семь доменов: MCP, Search, Terminal, SWE, Android, Web, OS.

Обучена через трёхстадийный pipeline: CPT внедряет знания среды, SFT активирует next-state-prediction reasoning, RL оттачивает точность симуляции. Более 10 миллионов реальных траекторий взаимодействия.

Ключевые особенности:

  • Семь доменов в одной модели — первая language world model, покрывающая семь доменов агентного взаимодействия в единой модели: MCP, Search, Terminal, SWE, Android, Web, OS.
  • Native world model — моделирование среды — основная цель обучения с этапа CPT, не post-hoc адаптация.
  • Обобщаемость и масштабируемость — zero-shot обобщение на OOD-среды. Контролируемые возмущения и конструирование вымышленных миров превосходят обучение на реальных средах. Sim RL с Qwen-AgentWorld-397B-A17B на 4k out-of-distribution сред показал прирост +4.3 на Claw-Eval и +7.1 на QwenClawBench.
  • Agent Foundation Model — RL warm-up на single-turn неагентных траекториях переносится на multi-turn tool-calling агентные задачи. Прирост до +12.79 на WideSearch F1 Item.

Qwen-AgentWorld-397B-A17B набрала на AgentWorldBench общий балл 58.71, обойдя все frontier-модели, включая GPT-5.4 (58.25).

Qwen-WebWorld: веб-агенты

Qwen-WebWorld — линейка моделей для веб-агентов: 8B, 14B, 32B. Выпущены в мае 2026. Заточены под навигацию и взаимодействие с веб-средой.

Qwen-Agent: фреймворк для агентных приложений

Qwen-Agent — open-source фреймворк для построения LLM-приложений на базе моделей Qwen. Использует instruction following, tool usage, planning и memory capabilities моделей. Отдельный репозиторий от моделей — это инструмент для разработчиков.

Лицензии: open-source или open-weights?

Все open-weight модели Qwen3.5 и Qwen3.6 лицензированы под Apache 2.0. Qwen3 — под Apache 2.0 (модели 0.6B–32B). Это щедрая лицензия: можно использовать в коммерческих проектах без ограничений.

Исключения:

  • Qwen3-Omni-30B-A3B — лицензия ‘other’ (не Apache 2.0). Перед коммерческим использованием проверьте условия в модельной карточке на Hugging Face.
  • Некоторые крупные модели предыдущих поколений (Qwen2.5-VL-72B) используют Qwen Research License с дополнительными условиями — обычно ограничения на коммерческое использование или требования к атрибуции.
  • Проприетарные модели (Qwen3.5-Plus, Qwen3-Max, Qwen3.6-Plus) доступны только через API Alibaba Cloud Model Studio — их веса не публикуются.

Важно: Qwen открывает доступ к весам, но держит в закрытом виде обучающий код и корпус данных. По стандарту Open Source AI от Linux Foundation этого недостаточно — там требуется открытость всего цикла: код, данные, веса. На практике модель называют open-source, хотя корректнее говорить open-weights: веса есть, воспроизвести обучение нельзя.

Когда использовать

Qwen не закрывает все задачи — у каждой экосистемы своя зона силы. Сравнение с ближайшими конкурентами даёт практическую картину.

ПараметрQwen3.5Llama 4 (Meta)Mistral (Small 4)
АрхитектураDense + MoEDense + MoEDense + MoE
Максимальный размер397B (A17B)Maverick 400B+Large 2 (123B)
МультимодальностьТекст, изображения, аудио, видео (нативная)Текст, изображенияТекст, изображения
Контекст256K (до 1M)128K-1M128K
Языки201~100~12
Tool useДа (адаптивный)ДаДа
ЛицензияApache 2.0 (большинство)Llama LicenseApache 2.0
Стоимость API (вход/1M)~$0.39~$0.19-0.49~$0.10
Стоимость API (выход/1M)~$2.34~$0.19-0.49~$0.30

Главное преимущество Qwen — нативная мультимодальность и самая широкая языковая поддержка. Если ваш продукт работает с голосом, изображениями или видео — Qwen экономит архитектурную сложность. Llama сильнее в соотношении цена/качество для чисто текстовых задач. Mistral — самый доступный по цене вариант для задач, не требующих мультимодальности.

Совет: Если нужен только текст на английском — Mistral или Llama дешевле. Если нужны 201 язык, голос, видео и агентный tool use в одном контуре — Qwen. Парадокс в том, что Qwen не дешевле всех, но даёт больше модальностей за свою цену.

Пример

Где попробовать Qwen на практике, без настройки инфраструктуры:

  • Qwen Studio: chat.qwen.ai — бесплатный веб-интерфейс (ранее Qwen Chat). Доступ ко всем модальностям, deep research, web dev, adaptive tool use. Есть desktop и mobile приложения.
  • API: Alibaba Cloud Model Studio — официальный API с оплатой по токенам. Совместим с OpenAI и Anthropic API. Здесь доступны проприетарные модели Qwen3.5-Plus, Qwen3-Max, Qwen3.6-Plus.
  • OpenRouter: openrouter.ai/qwen — доступ к 60+ моделям Qwen через единый API. Удобно для тестирования разных версий без переключения провайдеров.
  • Hugging Face: huggingface.co/Qwen — загрузка весов для локального запуска. Все открытые модели, от 0.6B до 397B-A17B, с модельными карточками.
  • GitHub: github.com/QwenLM — репозитории кода, документация, примеры. Основные репозитории: Qwen3 (текст), Qwen3-VL (визуальные), Qwen3-Omni (мультимодальные), Qwen3-Coder (код), Qwen-Image (генерация), Qwen-AgentWorld (агенты).
  • Qwen Code: github.com/QwenLM/qwen-code — open-source CLI-агент для терминала. Аналог Claude Code на моделях Qwen.

Qwen — это не «ещё одна LLM». Это экосистема из двенадцати семейств, где модальности не склеены, а встроены в архитектуру. 201 язык, более 100 моделей, кодинг-агенты, генерация изображений, синтез речи, world models для симуляции сред. Если вам нужна не просто модель, а рабочий контур для продукта — стоит разобраться.

Ограничения

Ограничения

Open-weights, не open-source — Qwen публикует веса моделей, но не код обучения и не описание обучающих данных.

По определению Open Source AI от Linux Foundation, открытость требует доступности обучающего кода и данных для воспроизведения. Qwen проходит по весам, но не по полному циклу. Для большинства прикладных задач это не критично — веса дают возможность fine-tuning и деплоя. Но для research-задач, где важна воспроизводимость, это ограничение.

MoE-модели требуют много VRAM — Хотя MoE активирует только часть параметров при инференсе, вся модель должна поместиться в память.

Qwen3.5-397B-A17B с 17B активных параметров всё ещё требует GPU с достаточным объёмом VRAM для хранения 397B весов. Это означает, что локальный запуск флагмана доступен только на серверах с несколькими high-end GPU. Dense-модели до 14B можно запускать на одной видеокарте. FP8 и GPTQ-Int4 квантованные версии снижают требования к памяти.

Проприетарные модели недоступны локально — Qwen3.5-Plus, Qwen3-Max, Qwen3.6-Plus — лучшие модели в линейке по качеству — доступны только через API Alibaba Cloud.

Веса не публикуются. Если нужен максимальный quality и локальный запуск — придётся довольствоваться open-weights версиями или платить за API.

Qwen3-Omni — не Apache 2.0 — Qwen3-Omni-30B-A3B-Instruct распространяется под лицензией ‘other’, не Apache 2.0.

Перед коммерческим использованием необходимо проверить условия в модельной карточке на Hugging Face. Это единственная модель в актуальной линейке с не-Apache лицензией, кроме моделей предыдущих поколений с Qwen Research License.

Стоимость API выше конкурентов — По данным сравнения, стоимость API Qwen примерно $0.39 за вход и $2.34 за выход на 1M токенов.

Mistral предлагает $0.10 за вход и $0.30 за выход — в 3-8 раз дешевле. Для high-volume задач, где не нужна мультимодальность, Qwen может быть экономически невыгоден по сравнению с Mistral или Llama.

Антипаттерны

Антипаттерны

Использовать флагман для простой задачи — Qwen3.5-397B-A17B — это инструмент для сложных мультимодальных и reasoning-задач, не для чат-бота на сайте.

Если нужна модель для генерации ответов в FAQ, подойдёт Qwen3-0.6B или Qwen3.5-0.8B — в сотни раз дешевле и быстрее. Запуск флагмана там, где хватит 8B — перерасход ресурсов. MoE-модели вроде 35B-A3B дают компромисс: качество близкое к флагману, стоимость как у 3B.

Склеивать модальности вручную — Если использовать Qwen3-VL для картинок, Qwen3-ASR для голоса и Qwen3.5 для текста как три отдельные модели с ручной оркестрацией — это лишняя работа.

Qwen3-Omni существует именно для этого: единый конвейер, единый контекст, одно API-назначение. Раздельный запуск имеет смысл только если нужна максимальная специализация одной модальности или если Omni-размер 30B-A3B избыточен для задачи.

Игнорировать разделение Instruct/Thinking — Начиная с Qwen3-2507, Instruct и Thinking — отдельные чекпойнты.

Instruct-2507 не генерирует thinking-блоки, Thinking-2507 работает только в thinking-режиме. Если использовать Instruct для задачи, требующей рассуждения (математика, сложная логика) — результат будет хуже. Если использовать Thinking для простого чата — лишний расход токенов на рассуждение. Выбор режима = выбор чекпойнта, не параметр в API.

Игнорировать лицензию — Большинство моделей под Apache 2.0, но Qwen3-Omni — под ‘other’, а некоторые крупные модели предыдущих поколений (Qwen2.5-VL-72B) — под Qwen Research License с дополнительными условиями.

Перед использованием в коммерческом продукте проверьте лицензию конкретной модели на Hugging Face. Apache 2.0 на одних моделях не означает «все модели Qwen под Apache 2.0».

Чеклист

Чеклист

Проверьте лицензию конкретной модели — Откройте модельную карточку на Hugging Face и найдите раздел License.

Apache 2.0 — можно использовать в коммерческом продукте. Qwen Research License или ‘other’ — читайте условия, возможно ограничение на коммерческое использование или требование атрибуции. Проприетарные модели (Qwen3.5-Plus, Qwen3-Max, Qwen3.6-Plus) — только через API, не для локального деплоя. Qwen3-Omni — лицензия ‘other’, проверьте перед использованием.

Сопоставьте размер модели с железом — Dense-модели до 14B работают на одном consumer GPU (16-24 GB VRAM).

MoE-модели требуют больше памяти для хранения весов, даже если активных параметров мало. Qwen3.5-397B-A17B при инференсе активирует 17B, но для хранения нужно место под 397B. FP8-версии (например, Qwen3.5-397B-A17B-FP8) и GPTQ-Int4 снижают требования к VRAM. Qwen3.5-122B-A10B-FP8 — компромиссный вариант: качество близкое к флагману, требования к железу ниже. Перед локальным запуском проверьте требования к VRAM в модельной карточке.

Определите, нужна ли мультимодальность — Если задача только текстовая — Qwen3-Omni избыточна.

Если нужны изображения и голос — не собирайте связку из трёх моделей, используйте Omni. Если нужен только код — берите Qwen3-Coder, а не универсальную модель. Если нужен RAG — берите Qwen3-Embedding + Reranker. Выбор семейства под задачу экономит и деньги, и время.

Выберите правильный режим: Instruct или Thinking — Для простого чата, генерации текста, перевода — Instruct.

Для математики, сложной логики, coding-задач — Thinking. Начиная с Qwen3-2507 это разные чекпойнты, не параметр в API. Qwen3-VL и Qwen3-Omni также имеют Thinking-версии. Проверьте, какой режим нужен, перед скачиванием.

Сравните стоимость API с альтернативами — Для high-volume текстовых задач Qwen может быть дороже Mistral в 3-8 раз.

Перед commit к Alibaba Cloud Model Studio — посчитайте ожидаемый расход токенов и сравните с Mistral и Llama через OpenRouter. Мультимодальность — аргумент за Qwen, но если она не нужна, переплата не оправдана.

Ссылки

Ссылки