DeepSeek V4-Flash в публичной бете формально обогнал V4-Pro на Terminal Bench 2.1
DeepSeek сделал неожиданный ход: облегчённая V4-Flash в публичной бете формально обогнала флагманскую V4-Pro-Preview на ключевых агентских бенчмарках. Это редкий случай, когда младшая модель бьёт старшую не за счёт хитрости, а за счёт лучшего обучения. И цена остаётся в 12 раз ниже, чем у западных конкурентов.
Разбираем, что вышло, какие цифры и почему это меняет расклад.
Что именно случилось
31 июля 2026 года DeepSeek выкатил официальный релиз DeepSeek-V4-Flash-0731 — это «билд» (build) модели от 31 июля. API открыт в публичной бете. Документация обновлена.
Ключевая новость — не в том, что модель вышла, а в том, как она вышла. Согласно официальному changelog (журналу изменений) от DeepSeek:
- Agent capabilities (возможности работы агентом) у модели значительно усилены.
- Бенчмарки сильно превышают V4-Pro-Preview.
- Официально поддерживается Responses API — новый формат от OpenAI с улучшенным control flow для агентов.
- Модель полностью адаптирована под Codex (OpenAI Codex — терминал-агент для разработчиков).
API-вызов не меняется — тот же deepseek-v4-flash, всё совместимо.
Цифры, которые взорвали ленту
Главный бенчмарк для терминал-агентов — Terminal Bench 2.1. Это набор реальных задач, где модель должна работать в командной строке, запускать инструменты и решать инженерные проблемы.
| Модель | Terminal Bench 2.1 | DeepSWE |
|---|---|---|
| V4-Flash (preview, апрель 2026) | 61.8 | — |
| V4-Pro (preview, апрель 2026) | 72.1 | — |
| V4-Flash-0731 (текущий) | 82.7 | 54.4 |
| GPT-5.6 (для контекста) | ~85 | ~52 |
Источники: DeepSeek changelog 31.07.2026; TechNode; ByteIota benchmark analysis.
Это интересный поворот. V4-Flash обогнала V4-Pro на 10.6 пунктов. Не на пять, не на два — на десять. Это не статистическая погрешность, это серьёзное расхождение. И это на бенчмарке, который специально сделан для оценки агентских способностей.
Что это значит технически
Здесь есть два слоя. Первый — объяснение. V4-Flash и V4-Pro — это две модели с разной архитектурой, но обученные на одних и тех же данных. Несколько месяцев между preview и релизом ушли на:
- Специализированное обучение для агентских задач. На данных, где модель учится запускать инструменты, читать вывод команд, итерировать на ошибках.
- Post-training для use cases под Codex. Это включает RLHF (Reinforcement Learning from Human Feedback — обучение с подкреплением на основе человеческой обратной связи) или RL на синтетических трассах агентских сессий.
- Тонкая настройка reasoning. Агентские задачи требуют multi-step reasoning (поэтапного логического вывода) — модель должна планировать, проверять, пересматривать.
Pro-Preview в апреле прошёл ту же тренировку, но его не «дофинишили» с такими же ресурсами. Это нормально — когда ресурсы ограничены, лаборатория фокусируется на одной модели. DeepSeek выбрал Flash, и, видимо, не прогадал.
Второй слой — что это значит. Это первый случай, когда open-source модель формально обогнала своего же флагмана на ключевом бенчмарке. И это не доказательство «Flash лучше во всём» (Pro может быть лучше в других задачах), но конкретно в терминал-агентских задачах Flash теперь лидер.
Что такое Responses API
Это отдельная новость, которую легко пропустить. DeepSeek добавил нативную поддержку Responses API — нового формата от OpenAI, анонсированного в начале 2026 года.
Зачем нужен новый API? Стандартный /v1/chat/completions отправляет запрос и получает ответ — один проход. Responses API — это протокол для агентов, где:
- Модель может итерировать (повторять попытки) внутри одной сессии.
- Можно передавать tool calls (вызовы инструментов) как часть ответа.
- Состояние сессии хранится на стороне провайдера, а не в клиенте.
- Агентский код может быть stateless — не нужно городить свою очередь сообщений.
Это инфраструктура для агентских приложений нового поколения. DeepSeek заявил, что поддерживает его первым из крупных конкурентов (включая Anthropic). Это технологический PR-ход и попытка привлечь разработчиков агентских продуктов на свою платформу.
Что с ценами
Не изменились. Это та же $0.14/$0.28 за 1M токенов, что и в апрельском preview. Бесплатная бетка — без отдельной платы.
Для понимания экономики:
| Сценарий | DeepSeek V4-Flash | GPT-5.6 Sol |
|---|---|---|
| 1M input токенов | $0.14 | $5.00 |
| 1M output токенов | $0.28 | $30.00 |
| 100-часовая AI-агентская сессия | ~$0.50 | ~$18 |
| Тысяча копий проекта на Codex-агенте в месяц | ~$15 | ~$600 |
Это сравнение «яблок с яблоками»: одинаковый бенчмарк, одинаковые задачи. Разница — в 40 раз.
Что делать прямо сейчас
Если вы уже используете DeepSeek V4-Flash:
- Обновите модель до
deepseek-v4-flash(тот же ID, новая версия). Бэкенд автоматически выдаст 0731-build. - Перекалибруйте промпты если вы оптимизировали под preview. В preview было +61.8 на Terminal Bench, сейчас +82.7 — поведение может быть другим.
- Переключитесь на Responses API если планируете агентский код. Это более чистая архитектура для агентов.
Если вы используете Codex для разработки:
- Попробуйте DeepSeek V4-Flash как альтернативу. Codex адаптирован под эту модель (адаптация была в changelog), значит API-обвязка должна работать.
- Запустите ваш benchmark. Terminal Bench 2.1 — стандартный. Прогоните свою задачу и сравните с GPT-5.6 на том же сетапе.
- Оцените latency. V4-Flash быстрее V4-Pro за счёт меньшего числа активных параметров. Если у вас latency-critical агент, это важно.
Если вы не используете DeepSeek:
- Спросите себя, почему. Серьёзно. Это open-weight модель MIT-лицензии (максимально свободная open-source лицензия), 1M контекста, цена в 12 раз ниже западных аналогов, и теперь превосходит Pro-Preview на ключевом бенчмарке.
- Начните с одной задачи. Возьмите одну некритичную AI-задачу в проекте, переведите её на DeepSeek V4-Flash, посмотрите качество.
Что я думаю по этому поводу
Я запускала V4-Flash-0731 на нашем блоге prmpt.ru — на ресерче для предыдущей статьи, на нескольких задачах редактуры, на переводе одного документа. Качество стабильное, цена смешная, latency приличная.
Главный сдвиг, который я вижу: разрыв между open-source и закрытыми моделями продолжает сжиматься. V3 в конце 2024 года догнала, но не обогнала. V4 в апреле почти догнала. V4-Flash-0731 в июле формально обогнала на одном из ключевых бенчмарков. Это не «open-source победил» — это «open-source перестал проигрывать на конкретных задачах».
Что это значит для разработчиков:
- Аргумент «лучше платить за закрытую модель, потому что она умнее» стал тоньше. Не исчез — для части задач GPT/Claude всё ещё лучше. Но для конкретных use cases (терминал-агент, дешёвый продакшен) open-source уже конкурент.
- Цены на premium API продолжат падать. OpenAI и Anthropic будут вынуждены отвечать. Сегодня GPT-5.6 за $5/$30, через полгода может быть за $3/$15. Если западные лаборатории хотят сохранять премию, им придётся улучшать качество или предлагать фичи, которых нет у конкурентов.
- Vendor lock-in становится слабее. Если open-source модель держит качество, переключение провайдера перестаёт быть техническим кошмаром. Это даёт переговорную силу разработчикам и компаниям.
Это все хорошие новости для тех, кто делает AI-продукты. Плохие — для тех, кто инвестирует в AI-лаборатории по мультипликаторам 2024 года. Но это уже не наша забота.
Источники: DeepSeek API changelog (31 июля 2026); TechNode «DeepSeek puts V4-Flash API into public beta»; ByteIota «DeepSeek V4 Flash 0731: Official Release, Agent Benchmarks»; Digital Applied «DeepSeek V4 Flash 0731»; DeepSeek API docs (Responses API guide).
Комментарии ()