Open-source LLM прошли за три года путь от curiosum до инфраструктуры. В 2023 году Llama показала, что открытые модели могут соревноваться с проприетарными. К 2026 году поле стало тесным: Llama, Mistral, Qwen, DeepSeek, Yi — каждый со своей стратегией.
Qwen отличается от остальных одним ходом: не текст, а модальности. Текст, изображения, аудио, видео — в едином конвейере, без склейки из отдельных моделей. Плюс 201 язык, более 100 открытых моделей и свыше 40 миллионов скачиваний на Hugging Face.
Это не очередная модельная карточка. Это экосистема, в которой есть всё: от 0.6-миллиардной модели для телефона до 397-миллиардного флагмана с архитектурой MoE. Кодинг-агенты, reasoning, генерация изображений, голос в реальном времени, embedding и reranker для RAG, world models для симуляции агентных сред.
Разберём, как устроена эта экосистема, какие семейства в неё входят, что в каждом реально работает, и где граница между open-source и open-weights, которую Qwen проходит осторожно.
Что это
Qwen, полное имя Tongyi Qianwen (по-китайски — «всеобъемлющее понимание письменности»), — линейка нейросетей от Alibaba Cloud, охватывающая текст, зрение, звук и видео. Разработка началась весной 2023 года, и за три года проект превратился в одну из крупнейших открытых ML-экосистем.
Цифры дают масштаб: более 100 открытых моделей, свыше 40 миллионов скачиваний, поддержка 201 языка. Но за цифрами стоит прагматичная архитектурная стратегия: не одна модель на все случаи, а семейства, каждое из которых заточено под конкретный контур работы.
Экосистема Qwen охватывает двенадцать основных направлений. Каждое закрывает свою задачу:
| Семейство | Назначение | Актуальная версия |
|---|---|---|
| Qwen3.6 / Qwen3.5 | Основные текстовые LLM (dense и MoE), фокус на coding и reasoning | Qwen3.6-27B, Qwen3.6-35B-A3B, Qwen3.5-397B-A17B |
| Qwen3 | Базовые текстовые LLM с thinking/instruct режимами | Qwen3-235B-A22B, Qwen3-Instruct-2507, Qwen3-Thinking-2507 |
| Qwen3-VL | Визуальные языковые модели (понимание изображений и видео) | Qwen3-VL-235B-A22B, Qwen3-VL-2B/4B/8B/32B |
| Qwen3-Omni | Нативная мультимодальность: текст + изображения + аудио + видео | Qwen3-Omni-30B-A3B-Instruct, Qwen3-Omni-30B-A3B-Thinking |
| Qwen2.5-Omni | Мультимодальность предыдущего поколения | Qwen2.5-Omni-7B, Qwen2.5-Omni-3B |
| QwQ | Модели с усиленным рассуждением (аналог o1) | QwQ-32B |
| Qwen3-Coder | Специализированные модели для кода и агентного программирования | Qwen3-Coder-480B-A35B, Qwen3-Coder-30B-A3B, Qwen3-Coder-Next |
| Qwen3-TTS | Синтез речи (text-to-speech) | Qwen3-TTS-1.7B, Qwen3-TTS-0.6B (CustomVoice, VoiceDesign) |
| Qwen3-ASR | Распознавание речи (automatic speech recognition) | Qwen3-ASR-0.6B, Qwen3-ASR-1.7B |
| Qwen-Image | Генерация и редактирование изображений | Qwen-Image-2512, Qwen-Image-Edit-2511, Qwen-Image-2.0 |
| Qwen3-Embedding / Reranker | Векторные представления и ререйтинг для RAG | Qwen3-Embedding-0.6B/4B/8B, Qwen3-Reranker-0.6B/4B/8B |
| Qwen-AgentWorld | Language world model для симуляции агентных сред | Qwen-AgentWorld-35B-A3B |
Каждое семейство — не просто ребрендинг базовой модели. Qwen3-Coder проходит обучение на реальных coding-задачах с запуском кода в песочницах, обратной связью от среды и reinforcement learning. QwQ заточена под усиленное рассуждение — аналог подхода o1 от OpenAI, где модель тратит больше вычислений на обдумывание сложных вопросов. Qwen3-VL работает с изображениями и видео как с равноправными модальностями. Qwen-AgentWorld симулирует целые среды, в которых агенты действуют.
Зачем нужно
Открытые модели решают три задачи, которые закрытые (GPT, Claude, Gemini) закрывают плохо или дорого: локальный запуск без отправки данных наружу, кастомный fine-tuning под домен, и контроль над стоимостью инференса.
Qwen закрывает все три, но с разной эффективностью. Dense-модели от 0.6B до 14B работают на одном GPU или даже на CPU — для edge-сценариев, on-device приложений, встраивания в продукты. MoE-варианты дают качество крупных моделей при стоимости, сопоставимой с моделями в 10-20 раз меньше.
Мультимодальность Omni — отдельный кейс. Если ваш продукт работает с голосом, изображениями и видео, вам не нужно склеивать три разные модели и orchestrate между ними. Одна модель принимает все модальности в едином контексте. Это упрощает архитектуру и снижает задержку.
Агентные сценарии — третий контур. Qwen3-Coder-Next заточена под работу в coding-агентах: модель обучена вызывать инструменты, взаимодействовать со средой и писать исполняемый код. Qwen Code — терминальный CLI-агент, аналог Claude Code, но на моделях Qwen. Qwen-AgentWorld идёт дальше: не просто агент, а симулятор среды, в которой агент действует.
RAG-инфраструктура — четвёртый контур. Qwen3-Embedding и Qwen3-Reranker покрывают оба звена векторного поиска: embedding для индексации и reranker для уточнения результатов. VL-версии работают с визуальным контентом — можно строить мультимодальный RAG.
Как устроено
Dense и MoE: два архитектурных подхода
Qwen выпускает модели в двух архитектурных вариантах, и разница между ними принципиальная.
Dense (плотные) — все параметры активны при каждом запросе. Это классическая архитектура: каждый токен проходит через всю нейросеть целиком. Версии Qwen3: 0.6B, 1.7B, 4B, 8B, 14B, 32B. Версии Qwen3.5: 0.8B, 2B, 4B, 9B, 27B. Чем больше параметров, тем выше качество, но и тем больше вычислений на каждый токен ответа.
MoE (Mixture of Experts — смесь экспертов) — при каждом запросе активируется только часть параметров. Внутри модели находятся несколько «экспертов» — подсетей, каждая из которых специализируется на определённых типах задач. Маршрутизатор определяет, какого эксперта задействовать для каждого токена. Версии Qwen3: 30B-A3B (активны 3B), 235B-A22B (активны 22B). Версии Qwen3.5: 35B-A3B (активны 3B), 122B-A10B (активны 10B), 397B-A17B (активны 17B). Версии Qwen3.6: 35B-A3B (активны 3B).
У флагмана Qwen3.5-397B-A17B в работе задействованы лишь 17 из 397 миллиардов параметров. Остальные 380 миллиардов покоятся в памяти без вычислений на каждый токен — их роль в том, чтобы давать качество большого MoE по цене маленькой dense-модели. Чем меньше активных параметров, тем дешевле каждый ответ.
Инсайт: MoE-архитектура — это не компромисс между качеством и стоимостью, а способ разорвать связь между размером модели и ценой инференса. 397B-модель с 17B активными параметрами работает по стоимости как 17B-модель, но с качеством 397B.
Thinking и Instruct: два режима работы
Начиная с Qwen3, модели поддерживают два режима работы. Qwen3.5 и Qwen3.6 унаследовали этот подход.
Instruct (он же non-thinking) — режим быстрого ответа. Модель генерирует ответ напрямую, без промежуточного рассуждения. Подходит для чата, простой генерации текста, инструкций, перевода. Qwen3-Instruct-2507 — обновлённая версия с улучшениями в инструкциях, логике, коде и tool use, контекст 256K (расширяемый до 1M).
Thinking — режим рассуждения. Модель тратит дополнительные токены на «обдумывание» перед ответом, аналогично подходу o1 от OpenAI. Qwen3-Thinking-2507 показала state-of-the-art результаты среди open-weight thinking-моделей на бенчмарках reasoning, математики, науки и кода. Thinking-режим доступен и в визуальных моделях — Qwen3-VL-Thinking, и в мультимодальных — Qwen3-Omni-30B-A3B-Thinking.
В Qwen3 (первый релиз, апрель 2025) переключение между режимами делалось через параметр `enable_thinking` в `tokenizer.apply_chat_template`. Начиная с Qwen3-2507 модели разделены на отдельные чекпойнты: Instruct-2507 поддерживает только non-thinking, Thinking-2507 — только thinking. Это упрощает деплой: не нужно настраивать режим в рантайме.
Qwen3-Omni: нативная мультимодальность
Qwen3-Omni — флагманская мультимодальная модель, выпущенная в сентябре 2025 года. Обрабатывает текст, изображения, аудио и видео в едином вычислительном конвейере. Ключевое слово — «едином»: это не склейка из отдельных моделей-энкодеров, а end-to-end архитектура, где все модальности проходят через общую систему внимания.
Ключевые возможности:
- SOTA по модальностям — SOTA на 22 из 36 аудио/видео бенчмарков, open-source SOTA на 32 из 36. Распознавание речи, понимание аудио и голосовые диалоги на уровне Gemini 2.5 Pro.
- Многоязычность — 119 текстовых языков, 19 языков речевого ввода, 10 языков речевого вывода. Речевой ввод: английский, китайский, корейский, японский, немецкий, русский, итальянский, французский, испанский, португальский, малайский, нидерландский, индонезийский, турецкий, вьетнамский, кантонский, арабский, урду. Речевой вывод: английский, китайский, французский, немецкий, русский, итальянский, испанский, португальский, японский, корейский.
- Архитектура Thinker-Talker — MoE-дизайн с двумя компонентами. Thinker отвечает за понимание и формирование ответа, Talker — за речевой вывод. Предобучение AuT даёт сильные общие представления, multi-codebook дизайн снижает задержку до минимума.
- Real-time взаимодействие — низкая задержка стриминга с естественной сменой ходов. Можно перебить модель mid-sentence, и она корректно обработает прерывание.
- Гибкое управление — поведение настраивается через system prompts, без необходимости fine-tuning. Лёгкая адаптация под конкретные сценарии.
- Audio Captioner — Qwen3-Omni-30B-A3B-Captioner: отдельная open-source модель для детального описания аудио с низкой галлюцинацией. Заполняет пробел в open-source сообществе по аудио-описанию.
Qwen2.5-Omni — предыдущее поколение, выпущенное в марте 2025. Доступно в размерах 3B и 7B. Та же концепция Thinker-Talker, TMRoPE-позиционное кодирование для синхронизации видео и аудио. Qwen2.5-Omni-7B заняла первое место среди open-source моделей в бенчмарках MMAU и MMSU.
Qwen3-VL: визуальное понимание
Qwen3-VL — новейшее поколение визуальных языковых моделей Qwen, выпущенное в сентябре-октябре 2025. Самая мощная vision-language модель в серии Qwen на данный момент. Доступна в Dense и MoE архитектурах, от edge до cloud, в Instruct и Thinking редакциях.
Размеры: 2B, 4B, 8B, 30B-A3B, 32B, 235B-A22B. Ключевые возможности:
- Visual Agent — управляет GUI ПК и мобильных устройств: распознаёт элементы, понимает функции, вызывает инструменты, выполняет задачи.
- Visual Coding — генерирует Draw.io/HTML/CSS/JS из изображений и видео.
- Контекст 256K (расширяемый до 1M) — обрабатывает книги и многочасовые видео с полным recall и секундной индексацией.
- 3D-пространственное восприятие — оценивает позиции объектов, точки обзора, перекрытия. 2D и 3D grounding для пространственного reasoning и embodied AI.
- OCR на 32 языках — расширено с 10 до 32 языков. Устойчив к плохому освещению, размытию, наклону. Работает с редкими и древними символами, лучше парсит длинные документы.
- Архитектурные обновления — Interleaved-MRoPE для long-horizon видео reasoning, DeepStack для multi-level ViT features, Text-Timestamp Alignment для точной локализации событий в видео.
Qwen3-Coder: агентный кодинг
Qwen3-Coder — линейка моделей, заточенных под кодинг и агентные сценарии. Доступна в трёх размерах: Qwen3-Coder-480B-A35B-Instruct (флагман), Qwen3-Coder-30B-A3B-Instruct (компактный), Qwen3-Coder-Next (на базе Qwen3-Next-80B-A3B).
Qwen3-Coder-Next построена на гибридной архитектуре с attention и MoE. Обучена на масштабных задачах с исполняемым кодом, взаимодействием со средой и обучением с подкреплением. Результат — сильные кодинг и агентные способности при значительно меньшей стоимости инференса.
Ключевые характеристики:
- 358 языков программирования — от ABAP до Zig. Полный список доступен в репозитории.
- Контекст 256K (расширяемый до 1M через YaRN) — оптимизирован для понимания репозитория целиком.
- Интеграция с платформами — Qwen Code (собственный CLI), CLINE, Claude Code. Специальный формат function calling для совместимости.
- Agentic Coding на уровне Claude Sonnet — результаты сопоставимы с Claude Sonnet на бенчмарках Agentic Coding, Agentic Browser-Use и других задачах кодинга.
Qwen Code — отдельный open-source CLI-агент для терминала, оптимизированный под модели Qwen. Аналог Claude Code, но с моделями Qwen. Поддерживает OpenAI, Anthropic, Gemini и Qwen API, а также локальные модели через Ollama и vLLM. Доступен через npm, Homebrew и инсталлятор.
# Установка Qwen Code
# Linux / macOS:
curl -fsSL https://qwen-code-assets.oss-cn-hangzhou.aliyuncs.com/installation/install-qwen-standalone.sh | bash
# NPM (требуется Node.js 22+):
npm install -g @qwen-code/qwen-code@latest
# Запуск:
qwen # интерактивный терминальный UI
/auth # настройка провайдера и API-ключа
QwQ: усиленное рассуждение
QwQ-32B — модель с усиленным рассуждением в серии Qwen, выпущенная в ноябре 2024 года. В отличие от instruction-tuned моделей, QwQ использует продвинутое рассуждение и критическое мышление для решения сложных задач. Mid-sized модель, которая конкурирует с DeepSeek-R1 и o1-mini.
QwQ основана на Qwen2.5 и работает через HuggingFace transformers. С выходом Qwen3 и разделением на Instruct/Thinking-режимы, функциональность QwQ частично перешла в Qwen3-Thinking-2507. Но QwQ-32B остаётся доступной и используется в проектах, где нужен чистый reasoning без мультимодальности.
Qwen-Image: генерация и редактирование изображений
Qwen-Image — 20B MMDiT image foundation model, выпущенная в августе 2025. Достигла значительных успехов в сложном рендеринге текста и точном редактировании изображений. Сильна в текст-рендеринге, особенно для китайского языка.
Линейка Qwen-Image включает:
- Qwen-Image-2512 (декабрь 2025) — декабрьское обновление: более реалистичные люди, тоньше текстуры природы, сильнее рендеринг текста. Заняла первое место среди open-source моделей на AI Arena в 10 000+ blind rounds.
- Qwen-Image-Edit-2511 (декабрь 2025) — редактирование изображений: style transfer, вставка/удаление объектов, улучшение деталей, редактирование текста на изображениях, позы людей.
- Qwen-Image-Layered (декабрь 2025) — многослойная генерация, работает с композицией.
- Qwen-Image-2.0 (февраль 2026) — next-generation: профессиональный рендеринг типографики для инфографики, PPT, постеров, комиксов. Нативное разрешение 2K. Единый режим генерации и редактирования.
Qwen-Image поддерживает LoRA-модели (например, MajicBeauty для реалистичных портретов), нативно работает в ComfyUI, поддерживается vLLM-Omni и SGLang-Diffusion для инференса.
Qwen3-TTS и Qwen3-ASR: аудио-модели
Qwen3-TTS — синтез речи (text-to-speech). Доступна в размерах 0.6B и 1.7B, в трёх вариантах: Base, CustomVoice (клонирование голоса по образцу), VoiceDesign (дизайн голоса). Qwen3-ASR — распознавание речи (automatic speech recognition). Размеры 0.6B и 1.7B. Qwen3-ForcedAligner-0.6B — forced alignment для точной синхронизации звука и текста. Эти модели закрывают полный цикл работы с речью: от распознавания до синтеза.
Qwen2-Audio-7B — предыдущее поколение аудио-языковых моделей. Поддерживает voice chat (свободное голосовое взаимодействие без текстового ввода) и audio analysis (анализ аудио по текстовым инструкциям). Лучше всего работает с аудио до 30 секунд.
Embedding и Reranker: RAG-инфраструктура
Qwen3-Embedding — векторные представления для семантического поиска и индексации. Размеры: 0.6B, 4B, 8B. Самая скачиваемая модель в экосистеме — Qwen3-Embedding-0.6B (более 10 миллионов скачиваний). Qwen3-VL-Embedding — версия для визуального контента, размеры 2B и 8B. Позволяет строить мультимодальный RAG: поиск по тексту и изображениям.
Qwen3-Reranker — реранжировщик для уточнения результатов поиска. Размеры: 0.6B, 4B, 8B. Qwen3-VL-Reranker — версии для визуального контента (2B, 8B). Reranker работает после embedding-поиска: берёт топ-K кандидатов и переупорядочивает их по релевантности, улучшая точность поиска.
Qwen-AgentWorld: language world model для агентов
Qwen-AgentWorld-35B-A3B, выпущенная в июне 2026, — native language world model для симуляции агентных сред. Не просто агент, а симулятор среды, в которой агент действует. Покрывает семь доменов: MCP, Search, Terminal, SWE, Android, Web, OS.
Обучена через трёхстадийный pipeline: CPT внедряет знания среды, SFT активирует next-state-prediction reasoning, RL оттачивает точность симуляции. Более 10 миллионов реальных траекторий взаимодействия.
Ключевые особенности:
- Семь доменов в одной модели — первая language world model, покрывающая семь доменов агентного взаимодействия в единой модели: MCP, Search, Terminal, SWE, Android, Web, OS.
- Native world model — моделирование среды — основная цель обучения с этапа CPT, не post-hoc адаптация.
- Обобщаемость и масштабируемость — zero-shot обобщение на OOD-среды. Контролируемые возмущения и конструирование вымышленных миров превосходят обучение на реальных средах. Sim RL с Qwen-AgentWorld-397B-A17B на 4k out-of-distribution сред показал прирост +4.3 на Claw-Eval и +7.1 на QwenClawBench.
- Agent Foundation Model — RL warm-up на single-turn неагентных траекториях переносится на multi-turn tool-calling агентные задачи. Прирост до +12.79 на WideSearch F1 Item.
Qwen-AgentWorld-397B-A17B набрала на AgentWorldBench общий балл 58.71, обойдя все frontier-модели, включая GPT-5.4 (58.25).
Qwen-WebWorld: веб-агенты
Qwen-WebWorld — линейка моделей для веб-агентов: 8B, 14B, 32B. Выпущены в мае 2026. Заточены под навигацию и взаимодействие с веб-средой.
Qwen-Agent: фреймворк для агентных приложений
Qwen-Agent — open-source фреймворк для построения LLM-приложений на базе моделей Qwen. Использует instruction following, tool usage, planning и memory capabilities моделей. Отдельный репозиторий от моделей — это инструмент для разработчиков.
Лицензии: open-source или open-weights?
Все open-weight модели Qwen3.5 и Qwen3.6 лицензированы под Apache 2.0. Qwen3 — под Apache 2.0 (модели 0.6B–32B). Это щедрая лицензия: можно использовать в коммерческих проектах без ограничений.
Исключения:
- Qwen3-Omni-30B-A3B — лицензия ‘other’ (не Apache 2.0). Перед коммерческим использованием проверьте условия в модельной карточке на Hugging Face.
- Некоторые крупные модели предыдущих поколений (Qwen2.5-VL-72B) используют Qwen Research License с дополнительными условиями — обычно ограничения на коммерческое использование или требования к атрибуции.
- Проприетарные модели (Qwen3.5-Plus, Qwen3-Max, Qwen3.6-Plus) доступны только через API Alibaba Cloud Model Studio — их веса не публикуются.
Важно: Qwen открывает доступ к весам, но держит в закрытом виде обучающий код и корпус данных. По стандарту Open Source AI от Linux Foundation этого недостаточно — там требуется открытость всего цикла: код, данные, веса. На практике модель называют open-source, хотя корректнее говорить open-weights: веса есть, воспроизвести обучение нельзя.
Когда использовать
Qwen не закрывает все задачи — у каждой экосистемы своя зона силы. Сравнение с ближайшими конкурентами даёт практическую картину.
| Параметр | Qwen3.5 | Llama 4 (Meta) | Mistral (Small 4) |
|---|---|---|---|
| Архитектура | Dense + MoE | Dense + MoE | Dense + MoE |
| Максимальный размер | 397B (A17B) | Maverick 400B+ | Large 2 (123B) |
| Мультимодальность | Текст, изображения, аудио, видео (нативная) | Текст, изображения | Текст, изображения |
| Контекст | 256K (до 1M) | 128K-1M | 128K |
| Языки | 201 | ~100 | ~12 |
| Tool use | Да (адаптивный) | Да | Да |
| Лицензия | Apache 2.0 (большинство) | Llama License | Apache 2.0 |
| Стоимость API (вход/1M) | ~$0.39 | ~$0.19-0.49 | ~$0.10 |
| Стоимость API (выход/1M) | ~$2.34 | ~$0.19-0.49 | ~$0.30 |
Главное преимущество Qwen — нативная мультимодальность и самая широкая языковая поддержка. Если ваш продукт работает с голосом, изображениями или видео — Qwen экономит архитектурную сложность. Llama сильнее в соотношении цена/качество для чисто текстовых задач. Mistral — самый доступный по цене вариант для задач, не требующих мультимодальности.
Совет: Если нужен только текст на английском — Mistral или Llama дешевле. Если нужны 201 язык, голос, видео и агентный tool use в одном контуре — Qwen. Парадокс в том, что Qwen не дешевле всех, но даёт больше модальностей за свою цену.
Пример
Где попробовать Qwen на практике, без настройки инфраструктуры:
- Qwen Studio: chat.qwen.ai — бесплатный веб-интерфейс (ранее Qwen Chat). Доступ ко всем модальностям, deep research, web dev, adaptive tool use. Есть desktop и mobile приложения.
- API: Alibaba Cloud Model Studio — официальный API с оплатой по токенам. Совместим с OpenAI и Anthropic API. Здесь доступны проприетарные модели Qwen3.5-Plus, Qwen3-Max, Qwen3.6-Plus.
- OpenRouter: openrouter.ai/qwen — доступ к 60+ моделям Qwen через единый API. Удобно для тестирования разных версий без переключения провайдеров.
- Hugging Face: huggingface.co/Qwen — загрузка весов для локального запуска. Все открытые модели, от 0.6B до 397B-A17B, с модельными карточками.
- GitHub: github.com/QwenLM — репозитории кода, документация, примеры. Основные репозитории: Qwen3 (текст), Qwen3-VL (визуальные), Qwen3-Omni (мультимодальные), Qwen3-Coder (код), Qwen-Image (генерация), Qwen-AgentWorld (агенты).
- Qwen Code: github.com/QwenLM/qwen-code — open-source CLI-агент для терминала. Аналог Claude Code на моделях Qwen.
Qwen — это не «ещё одна LLM». Это экосистема из двенадцати семейств, где модальности не склеены, а встроены в архитектуру. 201 язык, более 100 моделей, кодинг-агенты, генерация изображений, синтез речи, world models для симуляции сред. Если вам нужна не просто модель, а рабочий контур для продукта — стоит разобраться.
Ограничения
Ограничения
Open-weights, не open-source — Qwen публикует веса моделей, но не код обучения и не описание обучающих данных.
По определению Open Source AI от Linux Foundation, открытость требует доступности обучающего кода и данных для воспроизведения. Qwen проходит по весам, но не по полному циклу. Для большинства прикладных задач это не критично — веса дают возможность fine-tuning и деплоя. Но для research-задач, где важна воспроизводимость, это ограничение.
MoE-модели требуют много VRAM — Хотя MoE активирует только часть параметров при инференсе, вся модель должна поместиться в память.
Qwen3.5-397B-A17B с 17B активных параметров всё ещё требует GPU с достаточным объёмом VRAM для хранения 397B весов. Это означает, что локальный запуск флагмана доступен только на серверах с несколькими high-end GPU. Dense-модели до 14B можно запускать на одной видеокарте. FP8 и GPTQ-Int4 квантованные версии снижают требования к памяти.
Проприетарные модели недоступны локально — Qwen3.5-Plus, Qwen3-Max, Qwen3.6-Plus — лучшие модели в линейке по качеству — доступны только через API Alibaba Cloud.
Веса не публикуются. Если нужен максимальный quality и локальный запуск — придётся довольствоваться open-weights версиями или платить за API.
Qwen3-Omni — не Apache 2.0 — Qwen3-Omni-30B-A3B-Instruct распространяется под лицензией ‘other’, не Apache 2.0.
Перед коммерческим использованием необходимо проверить условия в модельной карточке на Hugging Face. Это единственная модель в актуальной линейке с не-Apache лицензией, кроме моделей предыдущих поколений с Qwen Research License.
Стоимость API выше конкурентов — По данным сравнения, стоимость API Qwen примерно $0.39 за вход и $2.34 за выход на 1M токенов.
Mistral предлагает $0.10 за вход и $0.30 за выход — в 3-8 раз дешевле. Для high-volume задач, где не нужна мультимодальность, Qwen может быть экономически невыгоден по сравнению с Mistral или Llama.
Антипаттерны
Антипаттерны
Использовать флагман для простой задачи — Qwen3.5-397B-A17B — это инструмент для сложных мультимодальных и reasoning-задач, не для чат-бота на сайте.
Если нужна модель для генерации ответов в FAQ, подойдёт Qwen3-0.6B или Qwen3.5-0.8B — в сотни раз дешевле и быстрее. Запуск флагмана там, где хватит 8B — перерасход ресурсов. MoE-модели вроде 35B-A3B дают компромисс: качество близкое к флагману, стоимость как у 3B.
Склеивать модальности вручную — Если использовать Qwen3-VL для картинок, Qwen3-ASR для голоса и Qwen3.5 для текста как три отдельные модели с ручной оркестрацией — это лишняя работа.
Qwen3-Omni существует именно для этого: единый конвейер, единый контекст, одно API-назначение. Раздельный запуск имеет смысл только если нужна максимальная специализация одной модальности или если Omni-размер 30B-A3B избыточен для задачи.
Игнорировать разделение Instruct/Thinking — Начиная с Qwen3-2507, Instruct и Thinking — отдельные чекпойнты.
Instruct-2507 не генерирует thinking-блоки, Thinking-2507 работает только в thinking-режиме. Если использовать Instruct для задачи, требующей рассуждения (математика, сложная логика) — результат будет хуже. Если использовать Thinking для простого чата — лишний расход токенов на рассуждение. Выбор режима = выбор чекпойнта, не параметр в API.
Игнорировать лицензию — Большинство моделей под Apache 2.0, но Qwen3-Omni — под ‘other’, а некоторые крупные модели предыдущих поколений (Qwen2.5-VL-72B) — под Qwen Research License с дополнительными условиями.
Перед использованием в коммерческом продукте проверьте лицензию конкретной модели на Hugging Face. Apache 2.0 на одних моделях не означает «все модели Qwen под Apache 2.0».
Чеклист
Чеклист
Проверьте лицензию конкретной модели — Откройте модельную карточку на Hugging Face и найдите раздел License.
Apache 2.0 — можно использовать в коммерческом продукте. Qwen Research License или ‘other’ — читайте условия, возможно ограничение на коммерческое использование или требование атрибуции. Проприетарные модели (Qwen3.5-Plus, Qwen3-Max, Qwen3.6-Plus) — только через API, не для локального деплоя. Qwen3-Omni — лицензия ‘other’, проверьте перед использованием.
Сопоставьте размер модели с железом — Dense-модели до 14B работают на одном consumer GPU (16-24 GB VRAM).
MoE-модели требуют больше памяти для хранения весов, даже если активных параметров мало. Qwen3.5-397B-A17B при инференсе активирует 17B, но для хранения нужно место под 397B. FP8-версии (например, Qwen3.5-397B-A17B-FP8) и GPTQ-Int4 снижают требования к VRAM. Qwen3.5-122B-A10B-FP8 — компромиссный вариант: качество близкое к флагману, требования к железу ниже. Перед локальным запуском проверьте требования к VRAM в модельной карточке.
Определите, нужна ли мультимодальность — Если задача только текстовая — Qwen3-Omni избыточна.
Если нужны изображения и голос — не собирайте связку из трёх моделей, используйте Omni. Если нужен только код — берите Qwen3-Coder, а не универсальную модель. Если нужен RAG — берите Qwen3-Embedding + Reranker. Выбор семейства под задачу экономит и деньги, и время.
Выберите правильный режим: Instruct или Thinking — Для простого чата, генерации текста, перевода — Instruct.
Для математики, сложной логики, coding-задач — Thinking. Начиная с Qwen3-2507 это разные чекпойнты, не параметр в API. Qwen3-VL и Qwen3-Omni также имеют Thinking-версии. Проверьте, какой режим нужен, перед скачиванием.
Сравните стоимость API с альтернативами — Для high-volume текстовых задач Qwen может быть дороже Mistral в 3-8 раз.
Перед commit к Alibaba Cloud Model Studio — посчитайте ожидаемый расход токенов и сравните с Mistral и Llama через OpenRouter. Мультимодальность — аргумент за Qwen, но если она не нужна, переплата не оправдана.
Ссылки
Ссылки
- Сайт: Qwen Studio (чат)
- Сайт: Alibaba Cloud Model Studio — API
- Сайт: OpenRouter — Qwen models
- Репозиторий: QwenLM — GitHub организация
- Сайт: Qwen — Hugging Face
- Документация: Qwen Documentation