Обзор DeepSeek V4 Pro GA: бенчмарки, цены API и анализ затрат
Проверенный обзор DeepSeek V4 Pro GA: агентные бенчмарки, контекст 1M, совместимость API, текущие и пиковые тарифы, расчёты стоимости и доступность в Modelflare.
DeepSeek выпустила DeepSeek-V4-Pro GA 13 августа 2026 года. Размещённая API-версия теперь обозначается как DeepSeek-V4-Pro-0813, а стабильный идентификатор модели в API остаётся deepseek-v4-pro. Модель получила контекстное окно на миллион токенов, до 384 000 выходных токенов, нативную поддержку Responses API и новую тарифную сетку, которая начинает действовать вскоре после релиза.
Наш вывод: V4 Pro заслуживает производственной оценки для сложного программирования, работы в масштабе репозитория и долгоживущих агентов. DeepSeek сообщает об устойчивом превосходстве над V4 Flash в сложных агентных бенчмарках, но Pro не является экономичным вариантом по умолчанию для каждого запроса. После начала действия новой сетки официальные цены на вход и выход будут примерно втрое выше, чем у Flash, а лимит параллельных запросов на аккаунт — в пять раз ниже.
В обзоре отдельно рассматриваются актуальные факты об API, опубликованные DeepSeek результаты бенчмарков, наш анализ и текущая доступность в Modelflare. Мы не воспроизводили оценки DeepSeek независимо. Изменяемые характеристики и цены проверены 14 августа 2026 года.
DeepSeek V4 Pro GA: главное
| Параметр | Текущие официальные данные |
|---|---|
| Дата GA-релиза | 13 августа 2026 года |
| Стабильный ID модели API | deepseek-v4-pro |
| Размещённая версия модели | DeepSeek-V4-Pro-0813 |
| Контекстное окно | 1 000 000 токенов |
| Максимальный вывод | 384 000 токенов |
| Режим рассуждения | Поддерживается и включён по умолчанию |
| Усилие рассуждения | В анонсе GA: low, high, max; см. примечание о совместимости ниже |
| Официальные форматы API | Chat Completions, Responses API, API с совместимостью Anthropic Messages |
| Заявленные функции | JSON-вывод, вызовы инструментов, автоматический кеш контекста, дополнение префикса, FIM без рассуждения |
| Официальный лимит параллельности аккаунта | 500 одновременных запросов |
Миллион токенов — предел ёмкости, а не гарантия качества. Полезность длинного запроса по-прежнему зависит от точности поиска, задержки, повторного использования кеша, длины ответа, тайм-аутов клиента и объёма нерелевантного контекста.
Что изменилось после предварительной версии V4
Апрельская предварительная версия представила семейство V4 и архитектуру с открытыми весами. Августовское GA-обновление размещённого продукта содержит три практических изменения:
- по данным DeepSeek, производительность агентов заметно выросла, особенно в задачах программирования и автоматизации, близких к промышленным;
- официальный API теперь нативно поддерживает формат OpenAI Responses и включает совместимость, ориентированную на Codex;
- DeepSeek объявила пиковые и внепиковые цены API, которые вступают в силу 16 августа 2026 года в 16:00 UTC.
Стабильной моделью в запросе остаётся deepseek-v4-pro, поэтому существующим клиентам не требуется менять имя модели. На странице цен текущая размещённая версия указана как DeepSeek-V4-Pro-0813.
Не следует автоматически считать скачиваемый checkpoint предварительной версии побитно идентичным размещённой GA-версии. Публичная карточка V4 от DeepSeek всё ещё описывает предварительное семейство и не помечает checkpoint как 0813. Поэтому самостоятельное размещение и официальный API нужно оценивать отдельно.
Анализ бенчмарков: где Pro превосходит Flash
DeepSeek опубликовала следующие результаты V4 Pro GA. Для сравнения взяты показатели обновления V4 Flash от 31 июля, а разница указана в абсолютных баллах.
| Бенчмарк | V4 Pro GA | V4 Flash 0731 | Разница Pro |
|---|---|---|---|
| Terminal Bench 2.1 | 87.9 | 82.7 | +5.2 |
| NL2Repo | 61.5 | 54.2 | +7.3 |
| Cybergym | 83.3 | 76.7 | +6.6 |
| DeepSWE | 62.7 | 54.4 | +8.3 |
| Toolathlon-Verified | 74.1 | 70.3 | +3.8 |
| Agents' Last Exam | 25.7 | 25.2 | +0.5 |
| AutomationBench (Public) | 31.8 | 25.1 | +6.7 |
| DSBench-FullStack | 71.1 | 68.7 | +2.4 |
| DSBench-Hard | 67.2 | 59.6 | +7.6 |
Для V4 Pro GA DeepSeek также указывает HLE 42.7 без инструментов и 60.0 с инструментами.
Общий рисунок важнее одного громкого результата. Наибольший абсолютный прирост виден в работе с репозиториями, сложных задачах разработки ПО и автоматизации. Разрыв значительно меньше в Agents' Last Exam и умеренный в широком использовании инструментов. Это говорит в пользу маршрутизации: оставлять Pro для задач, где повышенная вероятность завершения важнее чистой токен-эффективности, а Flash использовать для массовой классификации, суммаризации, триажа и более простых субагентов.
Это результаты поставщика, а не независимый бенчмарк Modelflare. Тестовая среда, разрешения инструментов, усилие рассуждения, параметры семплирования, временные ограничения и правила оценки могут существенно менять итог. Для производственного решения нужно повторить одинаковый, безопасный для конфиденциальности набор задач на обеих моделях и измерить стоимость успешной задачи, а не только число токенов или место в рейтинге.
Архитектура и заявление о контексте 1M
Публичная карточка V4 описывает семейство Pro как модель Mixture-of-Experts с 1,6 триллиона параметров всего и 49 миллиардами активных параметров. В ней задокументирована гибридная схема внимания Compressed Sparse Attention и Heavily Compressed Attention, Manifold-Constrained Hyper-Connections, оптимизатор Muon и предобучение более чем на 32 триллионах токенов.
По заявлению DeepSeek, при контексте 1M токенов V4 Pro использует 27% FLOPs одноступенчатого токенного вывода и 10% KV-кеша, необходимых V3.2. Это архитектурные заявления издателя модели; они не означают, что запрос на миллион токенов будет быстрым, дешёвым или одинаково точным во всех позициях.
Для реальной работы с длинным контекстом:
- размещайте стабильные инструкции и повторно используемые материалы репозитория в начале, чтобы работал кеш префикса;
- отслеживайте
prompt_cache_hit_tokensиprompt_cache_miss_tokens, а не предполагайте попадание; - сжимайте устаревшие трассы инструментов и дубли файлов до того, как они израсходуют бюджет контекста;
- проверяйте извлечение на фактической глубине документа и позиции токена вашего приложения;
- оставляйте место для рассуждения, результатов инструментов и финального ответа, а не заполняйте всё окно вводом.
Дисковый кеш DeepSeek работает автоматически и по принципу best effort. Он сопоставляет повторно используемые префиксы, может строиться несколько секунд и обычно очищается после часов или дней бездействия. Если в начале повторного запроса есть изменения, почти вся экономическая выгода может исчезнуть.
Совместимость API: нативная не значит идентичная
| Интерфейс | Официальная поддержка DeepSeek | Важное ограничение |
|---|---|---|
| Chat Completions | Поддерживается | В циклах инструментов с рассуждением нужно сохранять reasoning_content |
| Responses API | Поддерживается | Без состояния; ряд полей OpenAI игнорируется или не поддерживается |
| API, совместимый с Anthropic | Поддерживается | Некоторые поля игнорируются; изображения и документы не поддерживаются |
| FIM-дополнение | Бета | Только без рассуждения и через бета-endpoint |
Официальный слой Responses поддерживает текст, вызовы функций, серверный веб-поиск и пользовательский инструмент apply_patch для совместимости с Codex. Он не поддерживает previous_response_id, conversations, сохранённые responses, фоновый режим, service_tier и управляемые OpenAI ключи кеша промпта. Неподдерживаемые поля часто молча игнорируются, поэтому HTTP 200 не доказывает семантическую идентичность. Клиенты Responses должны хранить историю самостоятельно и анализировать типы событий, а не ждать маркер [DONE] из Chat Completions.
Есть ещё одно важное ограничение цикла инструментов Chat Completions: при совместном использовании режима рассуждения и инструментов reasoning_content ассистента нужно передавать обратно в последующих запросах. DeepSeek документирует ошибку 400 при потере этого поля. Шлюзы и SDK-адаптеры следует проверять полным многошаговым циклом инструментов, а не одним текстовым промптом.
В анонсе GA перечислены уровни low, high и max. Однако текущие подробное руководство по режиму рассуждения и справочник API говорят, что эффективны high и max, low и medium преобразуются в high, а xhigh — в max. Пока DeepSeek не согласует документы или живой тест не подтвердит отдельное поведение low, не закладывайте в бюджет предполагаемое снижение стоимости от малого усилия.
Официальные цены API DeepSeek: текущие и будущие
Все цены ниже указаны в долларах США за миллион токенов. Текущие фиксированные цены остаются опубликованными до вступления новой сетки в силу 16 августа 2026 года в 16:00 UTC, то есть 17 августа в 00:00 по пекинскому времени.
| Период | Вход с попаданием в кеш | Вход без попадания в кеш | Выход |
|---|---|---|---|
| Текущая цена, проверена 14 августа | $0.003625 | $0.435 | $0.87 |
| Новая внепиковая цена | $0.022 | $0.66 | $1.98 |
| Новая пиковая цена | $0.044 | $1.32 | $3.96 |
По новой сетке пиковое время — 01:00–04:00 и 06:00–10:00 UTC. Все остальные часы считаются внепиковыми, их цены вдвое ниже пиковых.
Переход не сводится к простому временному делению 2× от сегодняшних цен. По сравнению с текущей фиксированной ставкой новая внепиковая цена примерно в 6,07× выше для кешированного входа, в 1,52× для некешированного входа и в 2,28× для выхода. Пиковая цена удваивает эти новые внепиковые значения. Повторное использование кеша остаётся ценным, но сильнее всего меняется исключительно низкая стартовая цена кешированного входа.
Примеры расчёта стоимости
Формула стоимости только токенов:
стоимость = токены_cache_hit × ставка_cache_hit + токены_cache_miss × ставка_cache_miss + выходные_токены × ставка_выхода
Примеры ниже не учитывают отдельные расходы на сеть, подписку, сервисы инструментов или платежи. Агент с инструментами может выполнять несколько вызовов модели, поэтому считайте всю задачу, а не только первый запрос.
| Нагрузка | DeepSeek сейчас | Новая внепиковая | Новая пиковая | Modelflare на 14 августа |
|---|---|---|---|---|
| 100K некешированного входа + 10K выхода | $0.0522 | $0.0858 | $0.1716 | $0.0540 |
| 90K кеша + 10K некешированного входа + 10K выхода | $0.0134 | $0.0284 | $0.0568 | $0.0138 |
| 900K кеша + 100K некешированного входа + 20K выхода | $0.0642 | $0.1254 | $0.2508 | $0.0663 |
Вторая и третья строки показывают важность структуры промпта. Большой стабильный префикс способен значительно снизить стоимость, но только после реального попадания в кеш. Для сверки источником истины являются поля usage в ответе API.
DeepSeek V4 Pro и V4 Flash: выбор по цене и эффективности
По текущим официальным ставкам Pro примерно в 3,11× дороже Flash для некешированного входа и выхода, но только в 1,29× для кешированного входа. После начала новой сетки Pro будет в 3× дороже Flash для некешированного входа и выхода и примерно в 3,14× — для кешированного входа. Официальный лимит аккаунта составляет 500 параллельных запросов для Pro и 2 500 для Flash.
Отсюда следует понятное рабочее правило:
- выбирайте V4 Pro для сложных изменений репозитория, долгосрочных агентов, анализа безопасности, сложной координации инструментов и задач, где неудачная попытка стоит дорого;
- выбирайте V4 Flash для простых агентов, параллельных исполнителей, предобработки, извлечения, суммаризации и трафика, чувствительного к пропускной способности;
- маршрутизируйте по наблюдаемой сложности и стоимости успешной задачи, а не делайте Pro универсальной моделью по умолчанию;
- проведите повторную оценку после смены цен, поскольку экономика кешированных нагрузок Pro существенно изменится.
Цена токена в 3× выше всё равно может быть выгоднее, если Pro исключает повторные попытки или ручное исправление. И наоборот, преимущество в пять баллов бенчмарка не оправдывает отправку детерминированной или простой работы более крупной модели. Измеряйте долю завершения, полное время, все токены повторных попыток, сбои инструментов и время исправлений ревьюером.
Цена и доступность DeepSeek V4 Pro в Modelflare
Актуальный каталог цен Modelflare проверен 14 августа 2026 года. В нём указаны deepseek-v4-pro и закреплённый псевдоним deepseek-v4-pro-0813 в группе deepseek-stable со следующими базовыми ценами за миллион токенов:
| Снимок цены Modelflare | Цена |
|---|---|
| Вход с попаданием в кеш | $0.0037 |
| Вход без попадания в кеш | $0.45 |
| Выход | $0.90 |
Эти ставки примерно на 2,07% выше текущей цены DeepSeek для кешированного входа и на 3,45% выше текущих ставок некешированного входа и выхода. В статье нет обещания, что цены Modelflare останутся прежними после перехода DeepSeek на пиковую и внепиковую сетку. Для производственного решения всегда используйте живую страницу цен и запись usage конкретного запроса.
Текущие публичные метаданные каталога отмечают маршрут Modelflare как OpenAI-совместимый Chat Completions. Хотя собственный endpoint DeepSeek теперь поддерживает Responses и форматы Anthropic, поддержка поставщика не делает автоматически совместимым каждый маршрут шлюза. Используйте именно тот протокол, который указан на живой странице цен.
export MODELFLARE_API_KEY="your-api-key"
curl https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer ${MODELFLARE_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "Review this migration plan and identify rollback risks."}
],
"thinking": {"type": "enabled"},
"reasoning_effort": "high"
}'
Общую настройку клиента смотрите в руководстве по OpenAI-совместимому API. Учёт и интерпретацию кеш-токенов — в статье отслеживание расходов на AI API.
Контрольный список производственной оценки
- Закрепите
deepseek-v4-pro-0813на время оценки, если маршрут его предоставляет, затем решите, допустим ли стабильный псевдоним для контроля изменений. - Повторите фиксированный безопасный для конфиденциальности набор задач на Pro и Flash с одинаковыми инструментами, разрешениями, тайм-аутом и правилами остановки.
- Проверьте
highиmax; считайтеlowэквивалентнымhigh, пока текущее поведение API не докажет обратное. - Выполните полный многошаговый цикл инструментов и проверьте, что
reasoning_content, ID инструментов, аргументы и результаты проходят через каждый адаптер. - Для клиентов Responses явно проверяйте каждое нужное поле, поскольку неподдерживаемые параметры могут молча игнорироваться.
- Записывайте кешированный вход, некешированный вход, выход, токены рассуждения, задержку, повторы и стоимость успешной задачи.
- Проверяйте длинные промпты на реалистичной глубине; не делайте вывод о качестве поиска на миллионе токенов из короткого запроса.
- Тестируйте нагрузку ниже лимита параллельности аккаунта и обрабатывайте ответы 429 ограниченным backoff.
- Рассчитайте и текущую цену, и пиковую/внепиковую сетку 16/17 августа до утверждения бюджета.
- Сохраните Flash или альтернативную модель как резерв для доступности и контроля затрат; см. надёжную маршрутизацию AI API.
Итоговый вывод
DeepSeek V4 Pro GA — значимый релиз, ориентированный на агентов, а не просто переименованная предварительная версия. Официальные оценки сильнее всего выросли в рассуждении по репозиториям, сложном программировании и автоматизации, а новый интерфейс Responses делает модель практичнее для современных агентов разработки. Контекст 1M и автоматическое кеширование полезны, но только если приложения сохраняют стабильные префиксы и проверяют реальные попадания в кеш.
Главная оговорка — экономика: после запуска Pro примерно втрое дороже Flash в большинстве категорий токенов и имеет меньшую параллельность. Это должен быть уровень эскалации для сложной и ценной работы, а не модель по умолчанию для любого промпта. Оптимальная производственная архитектура обычно направляет простую работу в Flash и переводит в Pro только сложные или неудавшиеся задачи.
Снимок цены Modelflare от 14 августа близок к текущей фиксированной цене DeepSeek и сейчас предоставляет V4 Pro через Chat Completions. После начала новой сетки DeepSeek снова проверьте живую страницу: ни старая статья, ни кешированный скриншот цены не являются источником истины для биллинга.
Источники и дата проверки
- DeepSeek: релиз V4 Pro GA
- Модели и цены API DeepSeek
- Журнал изменений API DeepSeek
- Режим рассуждения DeepSeek
- Совместимость DeepSeek Responses API
- Совместимость DeepSeek Anthropic API
- Кеширование контекста DeepSeek
- Лимиты запросов и изоляция DeepSeek
- Карточка модели и открытые веса DeepSeek V4 Pro
Официальные характеристики, тарифные сетки, доступность Modelflare и живые цены проверены 14 августа 2026 года.