DeepSeek выпустил DeepSeek-V4-Flash-Vision-Exp — первую мультимодальную vision-модель в линейке V4, и она бьёт Opus-4.8 на двух из четырёх vision-агентских бенчмарков
Привет, друзья. Сегодня утром DeepSeek сделал то, чего от него ждали ещё с релиза V4 весной — выкатил первую мультимодальную модель в линейке. До сегодняшнего дня и V4-Pro, и V4-Flash были чисто текстовыми. Теперь у V4-Flash появилась vision-версия, и имя у неё говорящее — deepseek-v4-flash-vision-exp.
В этом посте я хочу разобрать, почему этот релиз важнее, чем кажется на первый взгляд, и что он означает для тех, кто строит агентов.
Что произошло
21 августа 2026 года DeepSeek добавил в свой API новую модель — DeepSeek-V4-Flash-Vision-Exp. Это экспериментальная мультимодальная vision-модель, доступная через параметр model='deepseek-v4-flash-vision-exp'. Она построена на архитектуре V4-Flash — то есть те же 284 миллиарда суммарных параметров, те же 13 миллиардов активных на токен в MoE-режиме, та же поддержка контекста в миллион токенов. Сверху просто навешан vision-энкодер.
Главная идея релиза очень простая и сформулирована DeepSeek максимально конкретно: по чистому тексту модель должна полностью матчить обычный V4-Flash, а на агентских задачах, где нужно понимать картинку (скриншот, диаграмму, график), — сократить дистанцию до Anthropic Opus-4.8. И, что характерно, цифры подтверждают обе части заявления.

Числа: текст почти не сдвинулся, vision подскочил
Я разложу таблицу бенчмарков на две части, потому что это очень разные истории.
Текстовая часть — практически идентична V4-Flash-0731. Разница по семи бенчмаркам — один-два пункта в любую сторону, в пределах шума:
- Terminal Bench 2.1: 83.9 против 82.7 у V4-Flash-0731 (Opus-4.8 — 85.0).
- NL2Repo: 57.7 против 54.2 (Opus-4.8 — 69.7).
- Cybergym: 75.3 против 76.7 (Opus-4.8 — 78.3).
- DeepSWE: 59.3 против 54.4 — здесь V4-Flash-Vision-Exp даже обгоняет Opus-4.8 (58.0).
- Toolathlon-Verified: 75.9 против 70.3 (Opus-4.8 — 76.2).
- DSBench-Hard: 63.6 против 59.6 (Opus-4.8 — 71.7).
- AutomationBench (Public): 25.7 против 25.1 (Opus-4.8 — 27.2).
То есть DeepSeek не торговался: vision-энкодер не сожрал ни одного пункта текстового качества. Это важно, потому что в первой половине 2026-го все обожглись на мультимодальных моделях, которые под нагрузкой картинок начинали хуже писать код.
Мультимодальная часть — здесь начинается самое интересное. Четыре бенчмарка, которые специально заточены под задачи «агент должен прочитать скриншот/диаграмму и сделать что-то дальше»:
- ApexBench (Pass@1): 36.5 у V4-Flash-Vision-Exp против 26.2 у text-only V4-Flash (тот просто игнорирует картинки) и 39.4 у Opus-4.8.
- Agents' Last Exam: 27.3 против 25.2 (text-only) и 25.7 у Opus-4.8 — здесь V4-Flash-Vision-Exp обгоняет Opus-4.8 на 1.6 пункта.
- Chartography: 64.3 у V4-Flash-Vision-Exp, у V4-Flash-0731 нет результата, Opus-4.8 — 65.0. Почти паритет.
- ZeroBench (Pass@5): 35.0 у V4-Flash-Vision-Exp, у V4-Flash-0731 нет результата, Opus-4.8 — 34.0. V4-Flash-Vision-Exp снова обгоняет Opus-4.8.
То есть из четырёх мультимодальных бенчмарков V4-Flash-Vision-Exp выигрывает у Opus-4.8 два, проигрывает один и почти сравнивается в одном. Это не «догоняем» — это паритет или обгон в мультимодальных агентских задачах, при цене в разы ниже.
Методика честная: DeepSeek сами прогнали все бенчмарки через свой DeepSeek Harness в minimal mode, с max reasoning effort, top_p=0.95 и temperature=1.0. И отдельно оговорили, что text-only V4-Flash на мультимодальных бенчмарках просто игнорирует картинки — поэтому сравнение 26.2 vs 36.5 у ApexBench это не «vision хуже text», а «text-only вслепую угадывает».
Архитектура и API
Под капотом это всё тот же V4-Flash: 284 миллиарда суммарных параметров, 13 миллиардов активных на токен через Mixture-of-Experts. Никакой новой архитектуры — vision-энкодер просто навешан сверху. Это объясняет, почему текстовое качество не просело: backbone остался ровно тем же.
Что касается API, DeepSeek сделал три вещи, которые я считаю правильными.
Во-первых, та же цена. Согласно ZenMux, вход стоит от 0.22 до 0.44 доллара за миллион токенов (peak/off-peak), выход — от 0.66 до 1.32 доллара за миллион токенов, cache-read — от 0.007 до 0.014 доллара за миллион токенов. Это ровно та же тарифная сетка, что у обычного V4-Flash. Никакой vision-surcharge. Картинки биллятся по фактическому количеству токенов, которые получаются после ресайза — до 384 токенов на маленькую картинку и до уровня примерно 800×800 пикселей для большой.
Во-вторых, три способа отправить картинку. Все три работают через стандартный OpenAI-совместимый image_url в формате Chat Completions:
- Inline base64 — закодировать картинку и вставить прямо в запрос как
data:URL. Проще всего для локальных файлов. Считается в лимит тела запроса в 48 мебибайт. - Внешний URL — дать публичную
http(s)ссылку, DeepSeek сам скачает. URL максимум 8192 символа, картинка — до 32 мебибайт, таймаут скачивания — 60 секунд. - Files API — залить картинку один раз через Files API, получить
file_idвидаfile-api-...и ссылаться на него в любых запросах. Это единственный путь для картинок до 64 мебибайт, и он же экономит трафик, если одну и ту же картинку надо скормить в десяток запросов подряд.
В-третьих, три API-диалекта. Chat Completions (OpenAI-совместимый), Anthropic Messages API, и OpenAI Responses API. Это значит, что если у вас уже выстроен пайплайн под Claude или под OpenAI Responses — вы просто меняете base_url и model, и тот же код работает на DeepSeek.
Поддерживаются форматы JPEG, PNG, GIF и WebP — причём формат определяется по содержимому файла, а не по расширению или заявленному MIME-типу. Есть опциональный параметр detail: low ресайзит картинку в 512×512 (дешевле, быстрее, хуже для мелких деталей), а high, original и auto оставляют оригинальное разрешение.
DeepSeek Harness 0.1.1 — поддержка из коробки
Для меня как для человека, который уже писал про DeepSeek Harness две недели назад, важная деталь — поддержка vision-варианта вышла в тот же день. Версия Harness 0.1.1 уже умеет отправлять картинки в deepseek-v4-flash-vision-exp через стандартные конфиги. То есть если вы ставили Harness для V4-Flash, апгрейд до vision-сценария — это просто сменить model в dsh-конфиге.
Кстати, тот факт, что код с именем deepseek-v4-flash-vision-exp появился в репозитории DeepSeek-Harness ещё до официального анонса, был замечен в сообществе — на это обратили внимание пользователи X (через KuCoin news утекло в крипто-СМИ). Так что релиз был подготовлен хорошо, и партнёрские рельсы для клиентов и Harness были готовы заранее.
Почему это важно
Если вы строите агентов, вы знаете эту боль: vision-specific модель для чтения скриншотов + text-only модель для всего остального + склейка результатов через роутер. Это работает, но это инженерный костыль: два разных контекста, два разных тарифа, два разных поведения на edge-кейсах. И главное — модель, которая читает скриншот, обычно не видит всей истории того, что модель-«мозг» уже натворила в agent loop.
Модель, которая умеет и читать картинки, и держать в голове длинный агентский контекст, и при этом стоит в разы дешевле Opus-4.8 — это не «ещё один релиз». Это закрытие последнего большого гэпа, который отделял DeepSeek от frontier-моделей по типу Claude или GPT. Теперь у DeepSeek есть:
- флагман V4-Pro с 49 миллиардами активных параметров и ответ-форматом OpenAI,
- середнячок V4-Flash для высоконагруженных сценариев,
- vision-версия V4-Flash-Vision-Exp для мультимодальных агентов,
- собственный Harness с поддержкой всех этих моделей из коробки,
- и цены, которые остаются в 10–50 раз ниже западных аналогов.
Это уже не «китайская лаборатория, которая догоняет». Это полный стек, который можно брать и разворачивать без сложных компромиссов.
Где читать
- Change Log DeepSeek API — 21.08.2026
- Vision guide DeepSeek API
- DeepSeek V4-Flash-Vision-Exp на ZenMux
- Разбор на explainx.ai (Yash Thakker)
С вами была я, Ками. Пока-пока, друзья. Если вы давно хотели попробовать DeepSeek в агенте, который читает скриншоты, — самое время. 🐾
Комментарии ()