DeepSeek V4.1 Flash: тихий релиз, громкие вопросы
Привет, друзья! У DeepSeek вышло что-то очень странное. В начале сентября они два дня прятали новую модель внутри живого API под именем с датой истечения прямо в названии, потом выпустили её официально, отозвали собственный план по выводу старого флагмана, а через месяц технический отчёт к модели всё ещё вызывает горячие споры. Давайте разберёмся, что тут вообще произошло.
Коротко: DeepSeek V4.1 Flash вышла 10 сентября 2026 года. Судя по цифрам, это лучшая открытая модель компании на сегодня. Но вот «почему V4.1, а не V5» и «почему V4 Pro до сих пор не вывели» — на эти вопросы у DeepSeek нет прямых ответов. И это, по-моему, самая интересная часть истории.
Что за модель
V4.1 Flash построена на новой архитектуре Causal Encoder-Decoder. Упрощённо: модель разделена на два блока — двадцатислойный энкодер, который обрабатывает вход, и двадцатислойный декодер, который генерирует выход. Хитрость в том, что на этапе чтения длинного промпта активируется всего 8 миллиардов параметров, а на этапе генерации ответа — 16 миллиардов. Суммарно бэкбон — 552 миллиарда параметров, ещё 196 миллиардов отведено под блок условной памяти под названием Engram. Всего — около 763 миллиардов.
Модель нативно понимает изображения (не через отдельное дополнение, а внутри архитектуры), держит контекст до миллиона токенов и может выдать до 384 тысяч токенов на выходе. Обучение шло на мультимодальном корпусе из 45 триллионов токенов.
Самое интересное — с кешем. V4.1 Flash использует формат сжатия FP4 и механизм переиспользования кеша между слоями. Глобальный кеш ключей-значений получился 890 байт на токен — это в четыре раза меньше, чем у V4 Flash, и в 437 раз меньше, чем у самой первой DeepSeek. Для тех, кто разворачивает длинных агентов, это критично: кеш — главный пожиратель памяти и денег.
Веса модели выложены на Hugging Face под лицензией MIT: 48 файлов safetensors общим объёмом около 510 гигабайт. Технический отчёт появился на arXiv 17 сентября.
Тихий старт
Вот тут начинается самое вкусное. 8 сентября, примерно в 15:00 по пекинскому времени, DeepSeek написала в свои официальные сообщества, что «для ограниченного тестирования» открыт «промежуточный вариант» модели. Имя модели в API было довольно красноречивым: deepseek-v4.1-flash-expires-on-0910. То есть дата деактивации была вшита прямо в идентификатор — он перестал бы работать 10 сентября.
Ни карточки модели, ни технического отчёта, ни записи в журнале изменений. Только пост в сообществе и форма для обратной связи. Два дня желающие тестировали — потом тест закончился, и 10 сентября состоялся полноценный релиз.
По-моему, это один из самых забавных способов анонса, который я видела. По сути, DeepSeek показала модель через «окно с ограниченным сроком» прямо в продакшн-API, и всё это буквально читалось из имени модели. Креативно, да.
Громкий вопрос №1: почему V4.1, а не V5?
Когда компания выпускает модель с совершенно новой архитектурой, логично ожидать прыжок поколения. Но DeepSeek назвала это «V4.1». И вот тут пошли разговоры.
Одни аналитики читают это так: компания специально не стала пугать рынок «пятой версией», предпочитая подать всё как «обновление». Другие говорят, что V4.1 — это намеренно «самая маленькая модель нового семейства», и следом придёт V4.1 Pro на той же архитектуре. Третьи вспоминают, что в своём техническом отчёте DeepSeek прямо называет V4.1 Flash «отправной точкой для дальнейшего масштабирования».
Честный ответ: никто вне компании этого не знает. В самих материалах DeepSeek причина выбора номера не раскрывается. Это не утечка и не бета — это релиз, который сам не решил, каким он является.
Громкий вопрос №2: бенчмарки — победа или надувательство?
В официальной карточке V4.1 Flash действительно обгоняет топовые закрытые модели на нескольких агентских тестах. На максимальном уровне «рассуждений» (плавная настройка от 1 до 100) получаются такие цифры:
Terminal-Bench 2.1 — 90,6 против 89,1 у Claude Opus 5.0 и 88,8 у GPT-5.6 Sol. DeepSWE v1.1 (задачи по программированию) — 74,2 против 74,0 и 73,0. CyberGym (кибербезопасность) — 88,1 против 84,5. AutomationBench (автоматизация рабочих процессов) — 54,8 против 50,3 и 45,8. Экзамен для агентов — 31,8 против 28,6 и 26,7. Рейтинг Codeforces — 3471 против 3348 у старшей V4 Pro.
Но есть и проигрыши, и они тоже красноречивы. GPQA Diamond (сложные научные вопросы) — 90,9 против 94,1 у Sol. Человеческий последний экзамен без инструментов — 36,8 против 44,5 и 56,3. Terminal-Bench 3.0 и 4.0 — 30,0 и 31,2 против 43,3 и 51,8 у Opus. ProgramBench — 20,3 против 37,0.
Итог: V4.1 Flash — настоящий зверь в агентских задачах, кодинге и автоматизации. Но на сложных научных вопросах и новых версиях терминальных тестов топовые закрытые модели её пока обходят.
Громкий вопрос №3: почему цифры так прыгают от обвязки?
Это, пожалуй, самый неприятный для индустрии момент. В карточке модели есть таблица, где одна и та же V4.1 Flash тестируется в разных «обвязках» — то есть в разных инструментах, которые управляют моделью.
На DeepSWE v1.1 результат колеблется от 65,5 в OpenCode до 74,2 в mini-SWE-agent — разница почти в девять пунктов. На Terminal-Bench 2.1 — от 84,1 в Codex до 90,6 в DeepSeek Harness Minimal. Один и тот же мозг, одни и те же задачи, разная обвязка — и разброс в 6–9 пунктов.
В конце сентября независимая лаборатория опубликовала результаты на Exploit Bench от Университета Карнеги-Меллона. Там V4.1 Flash набирала в среднем 4,7 из 16 под своей штатной обвязкой и 9,3 под Claude Code. А GLM-5.3-Flash показывала 10,6 под Codex и падала до 6,2 под той обвязкой, которая лучше всего подходила DeepSeek.
Проще говоря: бенчмарк сегодня измеряет не только модель. Он измеряет пару «модель + инструмент». И если ты подбираешь инструмент под конкретную модель, цифры будут радовать. Если берёшь «что попало» — будешь разочарован.
Громкий вопрос №4: что случилось с V4 Pro?
Вот это настоящая драма. В день релиза DeepSeek объявила, что с 12:00 по пекинскому времени 14 сентября все запросы к старому флагману deepseek-v4-pro начнут автоматически маршрутизироваться на V4.1 Flash — с тарификацией Flash. Для тех, у кого имя модели жёстко зашито в продакшн-код, это означало бы тихую смену весов под тем же именем и экономию примерно 70% на стоимости вывода.
11 сентября DeepSeek опубликовала уведомление на своей открытой платформе: после многочисленных обращений разработчиков решение отменено. V4 Pro продолжает работать как прежде, тарификация не изменилась. DeepSeek обещала предупреждать до любых будущих изменений.
Причины понятные. Разработчики справедливо возмутились: нельзя молча подменять модель под одним и тем же именем в работающей интеграции. Плюс, по данным самой DeepSeek, на части реальных рабочих нагрузок V4 Pro сохраняла преимущество в качестве, даже если на публичных тестах её обгоняла новая модель.
Громкий вопрос №5: а где V4.1 Pro?
Это главный интригующий момент. V4.1 Flash прямо называет себя «самой маленькой моделью нового архитектурного семейства». Но старшая сестра, которая докажет, что семейство существует, пока не объявлена. Нет ни карточки, ни числа параметров, ни даты, ни весов, ни цен.
Один из трекеров предположил трёхуровневую линейку: Flash на 522 миллиарда, Pro на 2 триллиона и Ultra на 8 триллионов. Это осталось предположением — DeepSeek ничего подобного не подтверждала.
Что показывают сторонние оценки
На момент выпуска у модели не было ни одной независимой оценки. Потом Artificial Analysis опубликовала индекс интеллекта 40 на максимальных настройках рассуждений — против 36 у V4 Pro версии 0813. Это делает V4.1 Flash самой высокооценённой моделью DeepSeek, которую сайт когда-либо измерял.
25 сентября руководитель тестирования моделей фонда ARC Prize открыл запрос на добавление полноценного профиля V4.1 Flash в их обвязку для оценок. Фонд считается эталоном для проверки рассуждений, а не производительности. Пока результата нет.
7 октября проект vLLM (один из самых популярных движков для разворачивания моделей) опубликовал отчёт за три недели работы с V4.1 Flash. Текущая сборка в 1,9 раза быстрее при низкой параллельности, а пропускная способность при ограничении в 150 запросов в секунду — в 5,3 раза выше по сравнению с реализацией первого дня. Это сравнение движка с самим собой, а не сторонняя оценка — но тренд приятный.
Также модель уже доступна через Baseten, OrcaRouter и других провайдеров. В OrcaRouter она, например, стоит $0,15 за миллион входных токенов и $0,60 за миллион выходных — без наценки.
Цены и расписание
DeepSeek продолжает свою любимую систему пиковых и непиковых тарифов. В непиковые часы: $0,15 за миллион некэшированных входных токенов, $0,003 за попадание в кеш и $0,60 за миллион выходных. В пиковые (01:00–04:00 и 06:00–10:00 UTC по будням) — вдвое дороже.
То есть ночной пакетный прогон обойдётся вдвое дешевле, чем такой же запуск в будний день. Для тех, кто считает деньги на длинных агентах, это важно.
Практический вывод
Если у вас уже есть интеграция на DeepSeek V4 Flash или экспериментальное Vision-дополнение — автоматически поедете на V4.1 Flash, ничего менять не нужно. Если используете V4 Pro — вас не тронут, по крайней мере до выхода V4.1 Pro, и DeepSeek обещала предупредить.
Если выбираете модель для нового проекта — V4.1 Flash выглядит одним из самых сильных вариантов на рынке с открытыми весами. Особенно для задач, где много длинных входных данных, где нужны изображения и где важна стоимость запуска. Но обязательно тестируйте на своей обвязке — цифры с бенчмарков сильно зависят от того, в чём модель работает.
По-моему, главный урок этой истории даже не про модель. Он про то, как индустрия научилась тихо анонсировать важные вещи через ограниченные тестовые окна, отменять собственные планы под давлением сообщества и считать бенчмарки с настолько разными обвязками, что сравнение между моделями начинает терять смысл. Рынок взрослеет, и хаос в нём — уже не случайность, а рабочий инструмент.
С вами была я, Ками. Пока-пока!
Источники: официальный анонс DeepSeek (10.09.2026), технический отчёт на arXiv (17.09.2026), карточка модели на Hugging Face, OrcaRouter (анализ релиза), OrcaRouter RU (хроника беты), AI-Stat (открытые веса), техническое руководство по API, AshnaAI (бенчмарки).
Комментарии ()