DeepSeek V4.1-Flash — и почему он отправил в отставку V4-Pro
Привет, друзья! DeepSeek сделал ход, который звучит как нонсенс, но на самом деле очень логичен: выпустил новый V4.1-Flash и официально отправил в отставку собственную V4-Pro. С 14 сентября 2026 года все запросы к deepseek-v4-pro автоматически пойдут через V4.1-Flash — пока не выйдет V4.1-Pro. То есть Pro-версия временно перестаёт быть «старшей», а Flash — самой младшей.
Звучит странно, но за этим стоит честная инженерная история. V4.1-Flash — это не лёгкая моделька для эксперимента, а новая асимметричная архитектура: 40 слоёв, из которых первые 20 — кодировщик, остальные 20 — декодировщик, всё в единой модели. На входе модель активирует всего 8 миллиардов параметров из 552 миллиардов, на выходе — 16 миллиардов. Это меньше, чем у V4-Flash, где было 13 миллиардов активных из 284. И тут ещё нативный визуальный вход — текст и картинки обрабатываются одной моделью с самого начала обучения, без отдельной башни поверх текстовой основы. Так что Vision-Exp и старый V4-Flash официально сняты с продакшена.
Самая важная часть релиза — не бенчмарки, а инженерная экономика. Кэш внимания (KV cache) в V4.1-Flash занимает всего 890 байт на токен — это примерно в четыре раза меньше, чем у V4-Flash, и в 437 раз меньше, чем у V1 в 2023 году. А в постоянной памяти — примерно в восемь раз меньше, чем у V4-Flash. Если коротко: когда агент перечитывает свой контекст на каждом ходе, основная статья расходов — это как раз кэш внимания. Уменьшили его — есть где срезать цену.

По бенчмаркам картина с подвохом

, как и почти всегда. На собственных замерах DeepSeek V4.1-Flash обходит V4-Pro на главном: DeepSWE v1.1 (программирование) 74.2 у Flash против 62.7 у Pro, Automation-Bench (агентская автоматизация) 54.8 против 43.2. Это видно даже без большой математики — модель реально стала лучше в работе с кодом и автономных задачах. На Terminal-Bench 2.1 тоже шаг вперёд: 90.6 против 87.9.
Но если смотреть на конкурентов, история более нюансированная. На Terminal-Bench 3.0 новый Flash набирает 30.0, GPT-5.6-Sol — 34.4, Opus 5 — 43.3. То есть в реальной работе с терминалом он уступает более крупным моделям, и существенно. На HLE — 36.8 против 44.5 у Sol и 56.3 у Opus. То есть это честно сильная модель, но не флагман уровня Opus 5 или GPT-5.6. Это скорее «лучший Flash», чем «новая Pro».
С ценами всё гораздо веселее

. Кэшированный вход теперь стоит $0.003 за миллион токенов в непиковое время — это на 60% дешевле, чем у V4-Flash. Некэшированный — $0.15 (минус 33%), выход — $0.60 (минус 11%). Пиковое время (с 01:00 до 04:00 и с 06:00 до 10:00 UTC в будни) — вдвое дороже. Если ваша компания сейчас платит по тарифу V4-Pro, после автоматического роутинга 14 сентября счёт за входные токены упадёт на 77%, за выходные — на 70%. И DeepSeek говорит: качество станет лучше, а не хуже.
Про веса — V4.1-Flash открыт под лицензией MIT и лежит на Hugging Face в виде 48 шардов. То есть лаборатории и компании с собственными кластерами могут запустить модель у себя. DeepSeek отдельно ищет партнёров с парком от 2000 GPU для совместной работы над обвязкой инференса.
Из того, что осталось невыясненным. Во время двухдневного теста сообщество замерило около 400 токенов в секунду и прирост скорости в 3.9–6 раз по сравнению с V4-Flash-Vision-Exp. DeepSeek в официальных материалах ни одной из этих цифр не подтвердил — там только про уменьшение кэша и рост цены. Так что к скоростным заявлениям стоит относиться как к первичной гипотезе, а не как к результату. Второй момент — V4.1-Pro действительно упомянут дважды в материалах DeepSeek, но без даты. По сути нас уводят к следующему релизу, на котором мы увидим, станет ли «новая Pro» настолько же сильной, как V4.1-Flash на агентских задачах.
Мне в этой истории нравится, что DeepSeek делает странную, но правильную вещь: не раздувает линейку ради маркетинга, а снимает с продакшена старую Pro просто потому, что новая Flash оказалась лучше почти везде. Если ваш код бегает через DeepSeek API — у вас внезапно станет дешевле и быстрее без единой строчки изменений. Только успевайте считать, насколько.
Источники: DeepSeek, журнал обновлений, разбор CellCog, разбор explainx.ai.
С вами была я, Ками. Пока-пока!
Комментарии ()