Qwen 3.8-Max: 2.4T параметров, 16 дней автономной работы и open-веса от Alibaba
Alibaba 3 августа 2026 года официально выпустила Qwen 3.8-Max — самую мощную модель в семействе Qwen и первую модель класса Qwen-Max, чьи веса будут опубликованы в открытый доступ. На API модель уже доступна через QwenCloud, open weights обещаны «на следующей неделе» на Hugging Face и ModelScope.
Главное в этой новости — не размер (хотя он впечатляет: 2.4 триллиона параметров, из них активных 95 миллиардов). Главное — это первая модель такого масштаба, которая в трёх независимых тестах полностью автономно отработала 10–16 дней без единого вмешательства человека и выдала ship-ready результат. Это уже не «AI-помощник пишет функцию по запросу», это «AI наняли на полноценную должность middle-разработчика».
Цифры
Краткая сводка того, что Alibaba показывает в официальном блог-посте (3 августа 2026):
| Параметр | Значение |
|---|---|
| Общее число параметров | 2.4 триллиона |
| Активных на токен | 95 миллиардов (архитектура MoE — Mixture of Experts, где для каждого запроса задействуется лишь часть параметров модели, остальные «спят») |
| Архитектурная база | Qwen 3.5 |
| Контекст | до 256K токенов |
| Поддерживаемые протоколы API | OpenAI-compatible, Anthropic-compatible, нативный QwenCloud |
| Reasoning effort | xhigh (по умолчанию) / medium / low |
| Open weights | «на следующей неделе» |
Подход reasoning_effort — это способ управлять тем, как глубоко модель думает над задачей. «xhigh» (по умолчанию) даёт максимальное качество, «low» — быстрые дешёвые ответы для тривиальных задач. Это позволяет держать один и тот же API и для простых чатов, и для серьёзной аналитики.
Три кейса автономной работы
Alibaba приводит три задачи, где модель реально работала часы и дни без участия человека. Все три зарегистрированы на GitHub, чтобы любой мог проверить трассировку.
Кейс 1: 16 дней самоэволюционирующего разработчика
Модель получила задание: «с нуля создать проект oh-my-cli и за 10+ дней построить самоэволюционирующую среду разработки». Без единого человеческого вмешательства Qwen 3.8-Max:
- построил state machine для issue (состояние задачи в GitHub — «готова» (ready), «взята в работу» (leased), «активна» (active)),
- запустил агентов-исполнителей,
- на каждый коммит прогонял Build, Unit Tests, E2E (end-to-end, сквозные тесты, проверяющие весь пользовательский путь) и Desktop Lifecycle,
- обновлял CLI-команды
/goal,/resume, Dynamic Workflow, Session Replay, Desktop на основе обратной связи.
На 30 июля 2026 года, после примерно 16 дней полностью автономной работы, в репозитории было 265 коммитов, 127 PR (запросов на слияние изменений в основную ветку) и 151 issue. Это публично — посмотреть можно здесь: qwen-code-dev-bot/oh-my-cli.
Кейс 2: 88 часов исследовательской петли
Задача — придумать новый метод для соревновательного математического бенчмарка AIME24 (American Invitational Mathematics Examination — престижная американская олимпиада по математике). Модель запустила петлю «гипотеза → код → запуск на GPU (видеокарты, на которых обучают и запускают нейросети) → анализ → повтор». За 88 часов она сгенерировала 18 собственных идей улучшений в 4 раундах, тестируя каждую. В итоге нашла метод, который обыгрывает подход из исходной статьи на +2.7 пункта на AIME24.
Кейс 3: победа на 526 человеческих команд
Qwen 3.8-Max зарегистрировали на реальном онлайн-соревновании WWW2025 Multimodal Dialogue Intent Recognition Challenge на Alibaba Cloud Tianchi. Задача: понять, что хочет клиент, по тексту чата и скриншотам. 526 живых команд-людей.
За 24 часа модель:
- прочитала правила и собрала полный пайплайн сама,
- обучила три BERT-подобные модели для текста (BERT, MacBERT, RoBERTa — популярные семейства нейросетей для понимания текста) и vision-language модель Qwen2.5-VL-7B для скриншотов,
- объединила всё в единый ансамбль со взвешенным голосованием,
- за 45 итераций подняла точность с 0.60 до 0.853, обойдя 458 из 526 человеческих команд (87% поля).
Это не «AI помог разработчику выиграть». Это AI зарегистрировался сам и выиграл.
Кейс 4: самостоятельный дизайн кремниевого чипа
Самый впечатляющий тест — физический. Qwen 3.8-Max автономно спроектировал аппаратный ускоритель для криптографии GCD/RSA (алгоритмы для вычисления наибольшего общего делителя и шифрования). Это RTL-проект (Register Transfer Level — описание схемы на уровне регистров и логики, из которого синтезируется реальная микросхема), который синтезируется через Yosys, проверяется через cocotb (фреймворк для тестирования цифровых схем), а физическая реализация делается через OpenROAD.
Модель прошла ~500 ходов и 71 оценку через 13 ключевых этапов, автономно оптимизируя дизайн от начальной реализации (8298 логических вентилей — базовых элементов цифровой схемы) до 678 вентилей. Это лучший результат среди всех моделей, участвовавших в тесте. Физическая реализация (place-and-route, то есть размещение транзисторов на площади кристалла и прокладка соединений) дала 81% сокращение площади кристалла (со 106×106 мкм² до 46×46 мкм²), при этом тайминг (задержка сигнала) успешно закрылся на 500 МГц с положительным slack (запас по времени, чтобы сигнал успел дойти до получателя без опоздания).
Это не «AI написал текстовое описание дизайна». Это AI сделал реальный hardware-дизайн, который синтезируется в реальный кремний.
Кейс 5: год управления электронной коммерцией
На симуляторе E-Commerce Bench (365-дневная симуляция работы реального Taobao/Tmall) модель с капиталом ¥100 000 управляла магазинами весь год, включая сезонные скачки, тайфуны, дефицит материалов, 152 зашитых мошеннических поставщика. Итог: ¥416 252 (4.16x возврат), что на 38% обогнало второй место (GLM 5.2) и на 152% — собственную предыдущую модель Qwen 3.7-Max.
Сравнение с конкурентами
Alibaba опубликовала полную таблицу сравнений с Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol и предыдущей Qwen 3.7-Max. Главные результаты (по Coding Agent — агенту-кодеру):
| Бенчмарк | Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen 3.7-Max | Qwen 3.8-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 84.6 | 84.6 | 88.8 | 74.5 | 86.6 |
| SWE-bench Pro | 69.2 | 80.0 | 64.6 | 60.6 | 67.7 |
| DeepSWE 1.1 | 59.0 | 70.0 | 73.0 | 21.6 | 56.6 |
| FrontierSWE | 70.0 | 88.8 | — | 40.7 | 73.5 |
| PaperBench | 80.3 | 88.8 | 90.5 | 64.8 | 93.0 |
| AndroidBench | 69.8 | 84.5 | 74.0 | 56.5 | 75.1 |
| QwenSWEBench | 84.0 | 86.3 | 73.5 | 63.4 | 80.7 |
По General Agent (агенту-универсалу, решающему задачи в широком спектре профессий):
| Бенчмарк | Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen 3.7-Max | Qwen 3.8-Max |
|---|---|---|---|---|---|
| CoWorkBench | 72.3 | 75.9 | 71.5 | 64.6 | 74.8 |
| WorkSpaceBench | 66.8 | 68.7 | 65.6 | 61.4 | 67.7 |
| JobBench | 48.4 | 57.4 | 45.4 | 31.3 | 53.4 |
| SkillsBench | 65.1 | 70.9 | 73.5 | 61.2 | 70.2 |
| Toolathlon Verified (Pass@1) | 76.2 | 77.9 | 74.9 | 49.7 | 72.5 |
| WideSearch | 72.9 | 81.2 | — | 75.2 | 81.9 |
| IFBench | 62.2 | 63.5 | 72.7 | 79.1 | 82.8 |
И самое интересное — мультимодальные агенты (модели, которые одновременно работают с текстом, картинками и видео):
| Бенчмарк | Opus 4.8 | Fable 5 | Gemini 3.1-Pro | GPT-5.6 Sol | Qwen 3.7-Plus | Qwen 3.8-Max |
|---|---|---|---|---|---|---|
| MMMU-Pro | 75.6 | 81.2 | 80.5 | 83.0 | 79.0 | 82.3 |
| OSWorld-Verified | 83.4 | 85.0 | 76.2 | 83.2 | 73.3 | 86.1 |
| ScreenSpot Pro | 82.3 | 87.3 | 68.1 | 81.3 | 79.0 | 84.5 |
| AndroidWorld | 75.0 | 88.8 | 70.7 | 77.6 | 81.0 | 85.3 |
| Parametric CAD Bench | 85.1 | 87.5 | 73.5 | 86.2 | 73.8 | 91.5 |
| OCR-Bench-V2 (EN/ZH) | 53.9/55.3 | 65.3/58.1 | 64.6/58.2 | 69.0/57.3 | 70.7/67.1 | 74.2/68.3 |
| RealWorldQA | 76.6 | 85.9 | 83.5 | 83.7 | 86.9 | 88.0 |
| VideoMME (w/ Sub.) | 85.4 | — | 86.7 | 89.5 | 88.0 | 90.4 |
| Dense200 | 20.8 | 31.1 | 69.7 | 55.3 | 60.7 | 87.0 |
| VLMsAreBiased | 43.8 | 61.2 | 74.1 | 59.8 | 36.6 | 88.3 |
Если короткое summary: Qwen 3.8-Max не выигрывает у Fable 5 на каждом бенчмарке (там Anthropic сильнее в чистом «кодинг по запросу»), но на автономной работе, агентских задачах и мультимодальных интерфейсах — бьёт всех, включая GPT-5.6 Sol и Gemini 3.1-Pro. Особенно впечатляет разрыв на Dense200 (87.0 vs 31.1 у Fable 5) и VLMsAreBiased (88.3 vs 61.2 у Fable 5) — это значит, что Qwen 3.8-Max видит и интерпретирует визуальные сцены намного точнее.
Что это значит для индустрии
Тут несколько слоёв.
Первая front-tier модель с open-весами от Alibaba
Это первый случай, когда Alibaba публикует в открытый доступ модель уровня Max. До этого open-weights были только у младших версий (Qwen-Plus, Qwen-Turbo). 2.4T параметров с 95B активных — это серьёзный вес, который можно запустить локально на крупном кластере, но не на домашнем компьютере. Тем не менее, для компаний и исследовательских лабораторий это возможность взять топовую модель и дообучать под свои задачи без отправки данных в Alibaba.
Конец эпохи «помощников», начало эпохи «сотрудников»
Когда модель автономно работает 16 дней, синтезирует чип, побеждает 87% человеческих команд и управляет магазином целый год — это уже не «помощник, который пишет функцию по запросу». Это цифровой сотрудник, который берёт задачу целиком и доводит до результата без присмотра. Это качественный скачок: с L2 (инструмент) на L4 (автономный исполнитель) по нашей внутренней классификации автономности.
MoE как новая норма
2.4T параметров, из которых активных только 95B — это типичная Mixture of Experts архитектура. Идея: модель состоит из множества «экспертов», но для каждого конкретного токена активируется только небольшая часть из них. Это позволяет масштабировать общую ёмкость модели (больше «знаний») без квадратичного роста вычислительных затрат (платите только за активных экспертов). В 2026 году MoE — это уже не эксперимент, а индустриальный стандарт для top-tier моделей.
Цена доступа
API уже доступен, цены Alibaba пока не публиковала для Max-уровня. Скорее всего, стоимость будет выше, чем у GPT-5.6 или Claude Opus 4.8 (где Anthropic и OpenAI уже вышли на массовый рынок). Но зато это первый открытый Max-уровень — для исследователей и стартапов это значит, что можно строить продукты на топовой модели без привязки к одному вендору.
Что я думаю по этому поводу
Qwen 3.8-Max — это не «ещё одна большая модель». Это конкретный сигнал, что Alibaba вышла на уровень, где можно соревноваться с Anthropic и OpenAI не только по бенчмаркам, но и по реальным долгим автономным задачам. Кейс с дизайном кремниевого чипа особенно впечатляет: AI спроектировал hardware, который синтезируется в реальный кремний и проходит timing closure (то есть сигналы успевают прийти вовремя на заданной частоте) — это уровень, на котором инженеры работают месяцами.
Что меня настораживает: Alibaba активно показывает задачи, где модель работает автономно дни и недели. Это сильный продающий аргумент, но это же и серьёзный этический вопрос. Если AI может работать 16 дней без присмотра и при этом написать 265 коммитов в публичный репозиторий — кто несёт ответственность, если в одном из этих коммитов окажется уязвимость? Кто отвечает, если AI-разработанный чип содержит аппаратный баг, который проявится через год в продакшене? Пока что ни Alibaba, ни OpenAI, ни Anthropic не дают внятного ответа. Юридически модель — это «инструмент», но инструмент, который 16 дней работает без человека, это уже что-то другое.
Мой прогноз: в ближайшие полгода все front-tier модели (Claude, GPT, Gemini, Qwen) будут демонстрировать именно такие «автономные кейсы». Это станет новым стандартом презентации — не «наша модель сдала экзамен», а «наша модель автономно выполнила X-часовую задачу». Соревнование смещается с «у кого больше параметров» на «у кого длиннее автономный горизонт».
Что делать разработчикам
Если вы интегрируете LLM в свой продукт:
- Тестируйте на реальных длинных задачах. Бенчмарки типа HumanEval (классический тест на короткие задачи по программированию) уже не показывают реальной картины. Прогоняйте модель на собственных задачах длиной в часы и дни — это то, что сейчас отличает топовые модели от всех остальных.
- Думайте про автономные сценарии. Не «как AI поможет разработчику написать функцию», а «как AI может взять на себя рутинный процесс целиком». Это сдвиг парадигмы для архитектуры продукта.
- Если важна приватность данных — ждите open-weights. Вес Qwen 3.8-Max обещаны на следующей неделе. После релиза можно будет развернуть модель в своём облаке или даже на своём железе и не отправлять данные в Alibaba.
- reasoning_effort — это полезная идея. Возможность переключать «глубину размышлений» модели — это способ контролировать и качество, и стоимость. Используйте low для дешёвых рутинных задач и xhigh для важных и редких.
Источники
- Официальный блог Qwen, «Qwen3.8-Max: A New Bar for Coding and Cowork» (3 августа 2026, 5068 слов)
- GitHub с трассировкой автономной работы — qwen-code-dev-bot/oh-my-cli
- API и pricing — QwenCloud (доступен с 3 августа 2026)
Комментарии ()