Переход на официальный сайт продукта.
Крупнейшая модель под Apache 2.0: 2.5T параметров MoE, 256K контекст, мультимодальность. Свобода коммерческого использования без ограничений.
Qwen 3.8 Max — крупнейшая open-source AI-модель от Alibaba Cloud, выпущенная в июле 2026 под лицензией Apache 2.0. Архитектура Mixture-of-Experts: 2.5 триллиона параметров, из которых 32 миллиарда активны на токен. Это ответ Alibaba на Llama 4 от Meta — и по всем ключевым бенчмаркам Qwen побеждает.
Контекстное окно 256K с нативной мультимодальностью (текст + изображения). Лицензия Apache 2.0 разрешает коммерческое использование, модификацию и деплой без ограничений. Доступна через Hugging Face, ModelScope, Alibaba Cloud API и партнёрские облака: Together AI, Groq, Fireworks AI, Replicate.
Massive Mixture-of-Experts: 256 экспертных подсетей, 8 активны на токен. Load-balanced Top-K gating с auxiliary loss. Каждый эксперт — полноценный transformer block на 8B параметров.
Qwen Attention 3.0 (QA3): Multi-Query Attention с квантованным KV-кэшем (INT4). Снижает потребление VRAM на 65% по сравнению со стандартным MHA при контексте 256K.
Multimodal Fusion via Qwen-VL Bridge: изображения → SigLIP-2 энкодер (768M) → проекция в текстовое пространство. Модульный подход: vision отдельно, текст отдельно. Проще файнтюнинг — можно дообучать только текстовую часть.
Training Recipe: 18T токенов (40% англ, 30% кит, 30% остальные), SFT на 5M инструкций, DPO на 2M пар, RLHF с reward-моделью 70B.
Коммерческое использование, модификация, деплой где угодно. Никаких ограничений Llama Community License. Идеально для стартапов и enterprise.
MMLU-Pro: 92.1%. HumanEval: 91.5%. MATH-500: 94.3%. Обходит Llama 4 на 8-12 п.п. и приближается к GPT 5.6 Sol.
4% тренировочного корпуса — русский. Качество на уровне GPT 5.6 Sol, выше чем у Llama 4.
Изображения: диаграммы, скриншоты, фото, документы. OCR, анализ графиков, описание визуального контента.
AWQ 4-bit: 4×H100 (80GB), 25-35 токенов/сек. GGUF Q4_K_M для llama.cpp. vLLM с continuous batching.
OpenAI-совместимый API. Совместимость с LangChain, CrewAI, AutoGen.
| Конфигурация | VRAM | Токенов/сек | Качество | Стоимость/мес |
|---|---|---|---|---|
| BF16 (8×H100) | 640 GB | 45-55 | 100% | $4,800 |
| AWQ 4-bit (4×H100) | 320 GB | 25-35 | 91% | $2,400 |
| GGUF Q4_K_M (4×A100) | 320 GB | 20-30 | 90% | $2,200 |
| API Alibaba Cloud | — | 30-40 | 100% | $1.50/1M tok |
Порог окупаемости self-hosted: >15M токенов/день. До этого объёма выгоднее API.
Qwen 3.8 Max — идеальный выбор для тех, кому нужна open-source модель без компромиссов. Apache 2.0 открывает дорогу в enterprise без vendor lock-in. Модель особенно хороша для русскоязычных проектов и файнтюнинга на своих данных. Компромисс — контекст «всего» 256K. Для сверхдлинных документов — GPT 5.6 Sol (2M). Для максимального reasoning — Claude Opus 8. Для всего остального — Qwen 3.8 Max даёт 90% качества флагманов за 0% лицензионных отчислений.