DeepSeek V4.1 Flash: архитектура, цены Modelflare и соперники
Разбор DeepSeek V4.1 Flash по источникам первой стороны: архитектура, контекст 1M, вывод до 384K, бенчмарки Agent, пределы API, сравнение с моделями OpenAI и Anthropic, а также текущая доступность и цены на Modelflare.

DeepSeek V4.1 Flash — недорогая мультимодальная модель с открытыми весами, собранная для длинных циклов Agent. Она вышла 10 сентября 2026 года и совмещает окно контекста в один миллион token, до 384K token на выходе, необычно дешёвый официальный API и архитектуру, которая снижает обработку prompt и давление на KV-cache. Её самое ясное преимущество не в том, что она выигрывает каждый бенчмарк. Оно в том, сколько работы Agent с длинным контекстом она может попытаться сделать на доллар, оставаясь конкурентной на оценках кода, терминала, автоматизации и использования инструментов.
Этому выводу нужны границы. Цифры бенчмарков ниже опубликованы DeepSeek, а не воспроизведены независимо Modelflare. Собственный отчёт DeepSeek говорит, что на самом трудном рассуждении и на краевых случаях модель всё ещё отстаёт от крупнейших закрытых систем. Верный ID модели в API первой стороны — deepseek-flash. DeepSeek V4.1 Flash уже работает на Modelflare под версионным ID модели deepseek-v4.1-flash-0910, и Chat Completions, и Responses доступны в публичной группе deepseek-stable.
Последняя проверка: 2026-09-10 UTC. Цены, псевдонимы и состояние каталога могут измениться.
Прямой ответ: что такое DeepSeek V4.1 Flash
Объявление DeepSeek о выпуске определяет DeepSeek V4.1 Flash как производственную замену прежней линейки Flash. Официальная конечная точка принимает deepseek-flash. Устаревшие имена deepseek-v4-flash и deepseek-v4-flash-vision-exp DeepSeek временно принимает и маршрутизирует на V4.1 Flash по тарифам Flash. Начиная с 14 сентября 2026 года в 04:00 UTC, DeepSeek говорит, что запросы к deepseek-v4-pro тоже пойдут на V4.1 Flash до более позднего выпуска V4.1 Pro.
Эта политика миграции принадлежит собственному API DeepSeek. Modelflare использует явный ID с печатью выпуска deepseek-v4.1-flash-0910, а не тихое переименование прежней записи deepseek-v4-flash. Оператор Modelflare подтвердил запуск, и модель появилась и в публичном, и в исходном каталогах цен в 2026-09-10 15:21 UTC. Клиентам следует использовать точный ID, который показывает их поставщик, а не предполагать, что псевдоним первой стороны проходит без изменений через каждый шлюз.
Практический состав модели состоит из пяти частей: мультимодальный ввод изображения и текста; текстовый вывод; магистраль MoE на 552B параметров; дополнительная память Engram на 196B параметров; и асимметричная активация 8B параметров на prompt-token против 16B на token декодирования. Последний пункт центральный: нагрузки Agent с тяжёлым вводом должны тратить меньше вычислений при повторном prefill, чем симметричная архитектура decoder-only сходного масштаба.
Спецификации с одного взгляда
Следующие значения взяты из официального выпуска, карточки модели и технического отчёта. «Параметры магистрали» и «параметры Engram» описывают разные хранилища; ни одно число не равно активным вычислениям на token.
| Пункт | DeepSeek V4.1 Flash |
|---|---|
| Официальный ID API | deepseek-flash |
| ID модели Modelflare | deepseek-v4.1-flash-0910 |
| Класс модели | Мультимодальный Transformer со смесью экспертов |
| Ввод / вывод | Текст и изображения внутрь; текст наружу |
| Раскладка Transformer | 40 слоёв: каузальный кодировщик на 20 слоёв + декодер на 20 слоёв |
| Хранилища параметров | Магистраль 552B + условная память Engram 196B |
| Активные параметры | 8B на token prefill; 16B на token decode |
| Контекст / максимальный вывод | 1M / 384K token |
| Предобучение | 45T token мультимодального корпуса; отношение только текста к мультимодальным token 7:1 |
| Основной замысел внимания и кэша | CED + CSA2 + глобальный KV в FP4; локальный SWA KV в FP8 |
| След глобального KV | 890 байт на token, по сообщению DeepSeek |
| Публичные предустановки рассуждения | low = 50, high = 75, max = 100 на внутренней шкале усилия |
| Предел одновременности официального API | 2,500 одновременных запросов |
| Лицензия | Лицензия MIT на checkpoint |
Потолок вывода 384K втрое выше максимума 128K, опубликованного для текущих моделей сравнения OpenAI и Anthropic в этой статье. Это предел, а не рекомендация: очень длинный вывод увеличивает задержку, цену и поверхность для сноса. Для длинных Agent более полезный вопрос — может ли модель удержать требования и пройти настоящие проверки приёмки после вызовов инструментов.
Почему архитектура собрана для длинных циклов Agent
Agent, пользующийся инструментами, снова и снова добавляет в историю наблюдения, результаты команд и правки. Каждый новый ход может потребовать prefill prompt, внимания по растущему контексту, хранения KV и нового вывода. DeepSeek V4.1 Flash бьёт по каждой цене отдельно, а не полагается на одну меньшую модель.
| Цена Agent | Механизм V4.1 Flash | Задуманный эффект |
|---|---|---|
| Повторная обработка длинных prompt | Causal Encoder-Decoder (CED) | Почти вдвое срезает асимптотическую работу prefill для длинных последовательностей в анализе DeepSeek |
| Удержание глобальной истории в HBM | Повторное использование CSA2 между слоями + FP4 | Уменьшает повторные глобальные записи KV и байты на запись |
| Сохранение локального состояния внимания | SWA Bounded Replay | Восстанавливает ограниченное локальное окно вместо хранения полного локального кэша каждого слоя |
| Вспоминание устойчивых шаблонов token | Engram | Переносит условную память n-gram в редко читаемые таблицы |
| Порождение token | Спекулятивное декодирование DSpark | Набрасывает несколько позиций-кандидатов и выбирает длину проверки по уверенности и нагрузке системы |
| Обработка изображений | DeepSeek-ViT + проектор | Превращает зрительный ввод во вложения, которые с предобучения обрабатываются вместе с текстом |
Эти механизмы в основном улучшают экономику обслуживания и пропускную способность. Сами по себе они не доказывают лучшее рассуждение. Качество модели также зависит от данных, пост-обучения, harness Agent и от того, сколько усилия вывода куплено.
CED: срезать обработку prompt до того, как трогать кэш
Технический отчёт делит 40 слоёв Transformer на каузальный кодировщик в 20 слоёв и декодер в 20 слоёв. Первые два слоя используют только скользящее окно в 128 token. Остальные слои соединяют локальное внимание скользящего окна со сжатым глобальным контекстом.
Для глобального внимания декодер не строит независимую полную историю KV на каждом слое. Его глобальные ключи и значения проецируются из конечного скрытого состояния кодировщика. Локальные состояния скользящего окна остаются своими у слоя. DeepSeek оценивает сложность prefill длинной последовательности примерно в половину соответствующего пути по всем слоям: доминирующий член меняется с обработки каждого token через все слои L на обработку глобального контекста примерно через L/2, плюс ограниченная работа локального окна.
Это объясняет раскол активации 8B/16B. Prompt-token активируют около 8B параметров магистрали во время prefill; вновь порождённые token активируют около 16B во время decode. Нагрузки с огромными документами и короткими ответами выигрывают больше, чем нагрузки, в которых господствуют сотни тысяч порождённых token. CED снижает первую половину этого счёта; декодирование он бесплатным не делает.
CSA2, FP4 и SWA Bounded Replay: история памяти
Compressed Sparse Attention 2 сжимает кэш вдоль последовательности, слоя и точности. Каждому слою CSA2 статически назначен один из трёх режимов. Full считает основной KV, ключи индексатора и свежие позиции Top-K. Reindex повторно использует основной KV и ключи индексатора, но заново сканирует их собственным запросом. Reuse повторно использует и общий KV, и предыдущий разреженный выбор. У каждого слоя всё ещё есть собственный запрос и локальный KV скользящего окна.
Первый слой Full декодера выбирает записи Top-512 и строит пул кандидатов; поздние слои Reindex выбирают свои позиции Top-512 из этого уменьшенного пула. Основной глобальный KV использует представление E2M1 примерно в четыре бита с масштабом E4M3 на 16 каналов. Для более чувствительного к квантованию локального кэша SWA DeepSeek сохраняет FP8.
| Слой кэша | Точность / время жизни | Сообщённый результат | Чего это не гарантирует |
|---|---|---|---|
| Глобальный KV во время выполнения | FP4, резидентный в HBM | 890 байт/token; около 1/4 от V4 Flash и в 437× меньше, чем V1 | Совершенный разреженный выбор на каждом краевом случае |
| Локальный SWA KV во время выполнения | FP8 | Сохраняет локальное окно слоя в 128 token | Пренебрежимую память при любой одновременности |
| Постоянный глобальный KV | Память хоста или SSD в замысле развёртывания DeepSeek | Долгоживущее повторно используемое глобальное состояние | Фиксированный срок хранения в публичном API |
| Постоянное локальное состояние SWA | Восстанавливается через Bounded Replay | Около 1/8 всего постоянного следа кэша V4 Flash при равной длине последовательности | Точное воспроизведение каждого отброшенного локального состояния |
Отчёт говорит, что его развёртывание держит глобальный постоянный KV не меньше 72 часов и использует распределённый короткоживущий пул SWA. Публичное руководство по кэшу контекста описывает создание кэша как автоматическое и по возможности, говорит, что построение может занять секунды, и говорит, что записи обычно очищаются через часы или дни. Производственным клиентам следует считать публичный контракт авторитетным: смотреть поля token попадания и промаха, а не строить бюджет вокруг гарантированного попадания на 72 часа.
DeepSeek сам называет две границы устойчивости: CSA2 может выбрать неверные разреженные позиции, а Bounded Replay приближает отброшенное локальное состояние. Его тесты не нашли систематической деградации в оценённых условиях, но крайние контексты и границы возобновления кэша остаются областями для дальнейшей нагрузочной проверки.
Engram, DSpark и мультимодальный путь
Engram отделяет часть запоминания от плотного вычисления модели. V4.1 Flash размещает 196B параметров в двух модулях условной памяти на слоях с нулевой нумерацией 1 и 14. Каждый использует n-gram token длин два, три и четыре, восемь хеш-голов, гейтинг с учётом контекста и предвыборку из памяти хоста по RDMA. Это хранимые параметры, а не ещё 196B параметров, активируемых на каждый token.
DSpark — отдельно обученный спекулятивный декодер. Три блока Transformer смотрят через скользящее окно в 128 token и предлагают пять позиций параллельно. Лёгкая голова зависимости связывает черновые token; голова уверенности оценивает, какая часть черновика переживёт проверку. Планировщик использует эти вероятности и измеренную пропускную способность движка, чтобы выбрать длину проверки при текущей нагрузке. Это может улучшить пропускную способность token системы, не меняя конечной роли проверки у магистрали.
Зрительный путь использует отдельно обученный DeepSeek-ViT с двумерным поворотным кодированием позиции. Шаг pixel-unshuffle 3×3 уменьшает число зрительных token в девять раз до проекции в языковую модель. У зрительного кодировщика 32 слоя, скрытый размер 1,024 и 16 голов внимания в сообщённой конфигурации. Его авторегрессионная стадия обучения использует изображения, масштабированные между 544×544 и 1,344×1,344, после более ранней контрастивной стадии примерно на 47B парах изображение-текст.
Обучение и пост-обучение
DeepSeek сообщает 45T token предобучения, и мультимодальные данные встроены в обучение языковой модели. Конвейеры только текста и мультимодальные сливаются в отношении token 7:1 после замены перекрытий и дедупликации. Разреженное внимание обучается с нуля при длине последовательности 64K, без разогрева плотным вниманием; контекст расширяется до 1M в точке 34T token.
| Стадия | Опубликованная деталь | Почему это важно |
|---|---|---|
| Контрастивное предобучение зрения | Около 47B пар изображение-текст, фаза низкого разрешения | Учит широкие зрительные представления до интеграции с языком |
| Авторегрессионная настройка зрения | 236B token с подписями, диаграммами, OCR и родственными данными | Добавляет мелкое понимание зрения и документов |
| Предобучение LLM | 45T token; мультимодальные данные включены с начала | Избегает того, чтобы зрение было только поздним адаптером prompt |
| Обучение контекста | Разреженное внимание с 64K; расширено до 1M на 34T token | Обучает развёрнутый рисунок внимания, а не преобразует его только после обучения |
| Пост-обучение | SFT, обучение с подкреплением и дистилляция on-policy | Выравнивает рассуждение, инструменты и поведение Agent |
Отчёт не заявляет новый алгоритм пост-обучения. Приросты он относит к созданию синтетических задач и сред, улучшенной фильтрации данных, проверяемым наградам и масштабу архитектуры и данных. Это важно, когда сравнивают заявления об «архитектуре модели»: CED и CSA2 объясняют эффективность, а наблюдаемая работа Agent — продукт всего стека обучения и каркаса.
Усилие рассуждения: у качества есть видимый счёт в token
DeepSeek открывает внутренний континуум усилия от 1 до 100 и отображает публичные предустановки API low, high и max на 50, 75 и 100. Входы совместимости отображают minimal и low на low; medium, high и xhigh на high; а max или ultra на max. Мышление по умолчанию — high.
В сообщённом DeepSeek проходе поднятие усилия с 25 до 100 увеличило средний результат по восьми оценкам рассуждения с 67.1% до 76.3%, DeepSWE с 66.0% до 74.2% и Terminal-Bench 2.1 с 82.4% до 90.6%. Token вывода выросли примерно в 2.5×. Диапазон 60–80 захватил большую часть качества меньше чем на половине максимального бюджета token; последний ход к 100 удлинил траектории Agent в 1.6–1.8× ради меньших приростов.
Это один из самых полезных регуляторов модели. Используйте low для классификации, извлечения и разведки, которую можно повторить; high — для обычного кода и исследования; берегите max для задач, где ещё одна попытка или пропущенный краевой случай стоит дороже лишних token. Примите это как начальные гипотезы и меряйте цену принятой задачи.
В режиме мышления temperature и штрафы presence/frequency игнорируются, а у top_p минимум 0.95. С инструментами клиенты должны вернуть полный reasoning_content из сообщения ассистента вместе с результатами инструментов; пропуск вызывает ответ 400. Это правило состояния важнее, чем копировать знакомый набор параметров OpenAI.
Сравнение бенчмарков с OpenAI и Anthropic
Эта таблица воспроизводит выбранные результаты из таблицы 3 технического отчёта DeepSeek. Все модели показаны при установке Max из отчёта. DeepSeek использовал разные требуемые или официальные каркасы для некоторых оценок, контекст DeepSeek Harness в 1M для кода и контекст Claude Code в 512K для задач зрительного Agent. Цифры — доказательства, сообщённые поставщиком, а не независимый очный тест и не производственный SLA.
| Оценка | V4 Flash | V4 Pro | V4.1 Flash | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|---|---|
| GPQA Diamond, Pass@1 | 89.9 | 92.4 | 90.9 | 94.1 | 93.4 |
| Terminal-Bench 2.1, Pass@1 | 82.7 | 87.9 | 90.6 | 88.8 | 89.1 |
| Terminal-Bench 3.0, Pass@1 | 7.6 | 11.8 | 30.0 | 34.4 | 43.3 |
| Terminal-Bench 4.0, Pass@1 | 7.0 | 12.4 | 31.2 | 39.9 | 51.8 |
| DeepSWE v1.1, resolved | 54.4 | 62.7 | 74.2 | 73.0 | 74.0 |
| CyberGym, Pass@1 | 76.7 | 83.3 | 88.1 | 84.5 | — |
| HLE with tools, Pass@1 | 51.5 | 60.0 | 63.9 | — | 63.6 |
| AutomationBench, Pass@1 | 37.7 | 43.2 | 54.8 | 45.8 | 50.3 |
| Agents' Last Exam, Pass@1 | 25.2 | 25.7 | 31.8 | 26.7 | 28.6 |
| Chartography with tools, Pass@1 | — | — | 78.9 | 79.9 | 84.0 |
Самое сильное чтение конкретно. V4.1 Flash делает большой шаг относительно V4 Flash на задачах Agent и конкурирует с GPT-5.6 Sol и Claude Opus 5 на DeepSWE, Terminal-Bench 2.1, автоматизации и HLE с инструментами. Он не лидирует в GPQA, поздних версиях Terminal-Bench или Chartography. Сам отчёт предупреждает, что близость к паритету на обычных задачах не значит паритет фронтира на самом трудном рассуждении и краевых случаях.
GPT-6 Astra и Claude Fable 5.1 опущены из этой таблицы баллов, потому что отчёт DeepSeek не публикует для них те же данные сравнения по строкам. Добавить баллы с отдельных страниц поставщиков значило бы создать ложный общий harness. Командам следует оценивать всех кандидатов на одних и тех же задачах репозитория, инструментах, таймаутах, сетевой политике и проверках приёмки.
Совместимость API широка, но не тождественна
Официальный сервис открывает OpenAI Chat Completions, OpenAI Responses и API, совместимый с Anthropic. Эта широта снижает работу миграции, но совместимость описывает форму запроса, а не тождественную семантику жизненного цикла.
| Поверхность | Поведение DeepSeek V4.1 Flash | Следствие для миграции |
|---|---|---|
| Chat Completions | Поток, вывод JSON, вызовы функций; prefix/FIM в режиме без мышления | Существующие клиенты OpenAI — самая простая точка старта |
| Responses | Без состояния; функции и изображения поддерживаются | Полный разговор сохраняйте сами |
| Поля состояния Responses | previous_response_id, conversations, store, background и управление контекстом не поддерживаются или игнорируются |
Ответ 200 не доказывает, что эти возможности вступили в силу |
| Размещённые инструменты | Встроенные web search, file search, code interpreter, computer use и MCP игнорируются; поддержка custom-tool ограничена | Исполняйте инструменты в приложении и проверяйте каждое запрошенное поле |
| Сводки рассуждения | Сводка и зашифрованное содержание рассуждения не поддерживаются | Не зависите от полей передачи рассуждения в стиле OpenAI |
| Формат Anthropic | Форма сообщения Anthropic принимается | Сохраняйте правила рассуждения и состояния инструментов DeepSeek, а не предполагайте семантику Claude |
| Зрение | Изображения принимаются во вводе пользователя и в выходах инструментов | Проверяйте размер полезной нагрузки, режим детализации и число изображений |
Руководство Responses у DeepSeek также перечисляет игнорируемые поля, такие как metadata, шаблоны prompt, truncation, service tier, safety identifier, ключ и срок prompt-cache и параметры потока. Тихое игнорирование — опасность совместимости: принятие схемы может спрятать отсутствующее поведение. Соберите запрос соответствия для каждой возможности, от которой зависит ваше приложение. Руководство по API, совместимому с OpenAI объясняет, почему форму конечной точки и способность надо проверять отдельно.
Текущие модели OpenAI дают более широкую родную экосистему инструментов Responses и управляемые возможности состояния. У родного API Anthropic свой зрелый контракт блока мышления и использования инструментов. Преимущество DeepSeek в том, что одна модель принимает все три обычных диалекта; цена в том, что пересечение меньше полной родной поверхности любого из соперников.
Пределы зрения и экономика изображений
Официальное руководство по зрению поддерживает JPEG, PNG, GIF и WebP через base64, внешние URL или Files API. Изображения автоматически меняют размер примерно к 1,300×1,300 и используют не больше 1,024 входных token каждое. Детализация low использует вид 512×512; high и original сохраняют больше деталей; auto сейчас ведёт себя как original.
| Предел | Официальное значение |
|---|---|
| Тело запроса | 48 MiB |
| Встроенное или внешне полученное изображение | 32 MiB каждое |
| Изображение по ссылке file ID | 64 MiB каждое |
| Изображений на запрос | 600 |
| Суммарные байты изображений | 64 MiB без file ID; 200 MiB с file ID |
| Длинное ребро | 8,192 px; 4,096 px, когда отправляют 15 или больше изображений |
| Потолок зрительных token | 1,024 token на изображение после обработки |
При максимуме 1,024 зрительных token одно некэшированное изображение даёт около $0.0001536 вне пика или $0.0003072 в пике по опубликованным тарифам ввода, до сопутствующего текста и вывода. Эта арифметика полезна для оценок масштаба, но изменение размера изображения, поведение кэша и фактическое использование зрительных token могут изменить плату. Больше изображений также съедает контекст, который иначе мог бы держать текст или историю инструментов.
V4.1 Flash подходит для снимков документов, диаграмм, OCR и зрительных наблюдений Agent. Это не модель генерации изображений. Для порождённых изображений используйте модель и конечную точку, сделанные так, чтобы возвращать пиксели, а не текст.
Сравнение цен официального API
Страница цен DeepSeek ввела следующие тарифы в 04:00 UTC 10 сентября. Пиковые окна будней — 01:00–04:00 и 06:00–10:00 UTC; всё остальное время будней и выходные используют тарифы вне пика. Кэш контекста DeepSeek автоматический, поэтому «кэшированный ввод» значит сообщённое попадание в кэш, а не флаг кэша, который принуждает попадание.
Тарифы OpenAI взяты из его текущего сравнения моделей; тарифы Anthropic — со страницы цен. Значения — USD за один миллион token. Anthropic также берёт плату за записи в кэш; здесь они опущены, потому что таблица сравнивает только новый ввод, чтения кэша и вывод.
| Модель | Контекст / макс. вывод | Новый ввод или промах | Кэшированный / прочитанный ввод | Вывод |
|---|---|---|---|---|
| DeepSeek V4.1 Flash, вне пика | 1M / 384K | $0.15 | $0.003 | $0.60 |
| DeepSeek V4.1 Flash, пик | 1M / 384K | $0.30 | $0.006 | $1.20 |
| DeepSeek V4.1 Flash на Modelflare | Предел модели 1M / 384K | $0.193548 | $0.003871 | $0.774194 |
| GPT-5.6 Luna | 1.05M / 128K | $0.20 | $0.02 | $1.20 |
| GPT-5.6 Terra | 1.05M / 128K | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Sol | 1.05M / 128K | $4.00 | $0.40 | $20.00 |
| GPT-6 Astra | 1.05M / 128K | $10.00 | $1.00 | $50.00 |
| Claude Sonnet 5 | 1M / 128K | $2.00 | $0.20 | $10.00 |
| Claude Opus 5 | 1M / 128K | $5.00 | $0.50 | $25.00 |
| Claude Fable 5.1 | 1M / 128K | $10.00 | $0.25 | $50.00 |
Цена сама по себе не ценность. Разные токенизаторы могут насчитать разное число token за один и тот же текст; Anthropic отмечает, что более новая токенизация может дать примерно на 30% больше token на некоторых нагрузках. Моделям также могут требоваться разная длина вывода, повторы и человеческие починки. Сравнивайте цену на принятую задачу, а не только строку с самым маленьким числом ввода.
Текущий публичный каталог Modelflare показывает один тариф между двумя временными полосами DeepSeek: это около 64.5% пикового тарифа первой стороны, или на 35.5% ниже в пиковые окна, и при этом около 29.0% выше тарифа DeepSeek вне пика. Поэтому выставленный тариф шлюза сегодня не имеет поправки на временную полосу; гибкие нагрузки, которые могут надёжно использовать окно DeepSeek вне пика, всё ещё могут заплатить меньше через API первой стороны.
OpenAI применяет более высокие тарифы, когда входной контекст превышает 272K: весь запрос использует цены ввода и кэшированного ввода 2× и цены вывода 1.5×. Эта граница важна в сценарии длинного контекста ниже. DeepSeek использует временные окна; у перечисленных моделей Anthropic на один миллион token в приведённой таблице цен нет той же границы 272K.
Два воспроизводимых сценария цены
Сценарий A — один запрос с 100K некэшированного ввода и 10K вывода. Формула — 0.1 × input rate + 0.01 × output rate. Она предполагает отсутствие кэшированного ввода, инструментов, повторов, налогов и добавок, специфичных для поставщика.
| Модель | Цена сценария A |
|---|---|
| DeepSeek V4.1 Flash, вне пика | $0.021 |
| DeepSeek V4.1 Flash на Modelflare | $0.0271 |
| GPT-5.6 Luna | $0.032 |
| DeepSeek V4.1 Flash, пик | $0.042 |
| Claude Sonnet 5 | $0.300 |
| GPT-5.6 Terra | $0.320 |
| GPT-5.6 Sol | $0.600 |
| Claude Opus 5 | $0.750 |
| GPT-6 Astra / Claude Fable 5.1 | $1.500 |
Сценарий B — предельная цена запроса с тёплым кэшем: 900K кэшированного ввода, 100K нового ввода и 20K вывода. Он намеренно исключает более ранний запрос, который создал кэш. Формула: 0.9 × cache-read rate + 0.1 × input rate + 0.02 × output rate. Модификаторы длинного контекста OpenAI на весь запрос применены, потому что входной контекст в сумме составляет один миллион token.
| Модель | Предельная цена сценария B |
|---|---|
| DeepSeek V4.1 Flash, вне пика | $0.0297 |
| DeepSeek V4.1 Flash на Modelflare | $0.0383 |
| DeepSeek V4.1 Flash, пик | $0.0594 |
| GPT-5.6 Luna | $0.1120 |
| Claude Sonnet 5 | $0.5800 |
| GPT-5.6 Terra | $1.1200 |
| Claude Opus 5 | $1.4500 |
| GPT-5.6 Sol | $2.1200 |
| Claude Fable 5.1 | $2.2250 |
| GPT-6 Astra | $5.3000 |
Сравнение держит количества token равными; оно не заявляет равное качество. Кэш DeepSeek — по возможности, а у создания кэша Anthropic своя цена записи и срок жизни. Честный тест нагрузки записывает token попадания и промаха кэша, все попытки, весь вывод, включая тарифицируемое рассуждение, прошедшее время, долю приёмки и минуты человеческой правки. Руководство по учёту цены даёт рамку учёта.
Открытые веса не делают самостоятельный хостинг маленьким
Выпуск на Hugging Face лицензирован MIT и документирует пути обслуживания vLLM и SGLang. В снимке, проверенном для этой статьи, репозиторий содержал 48 осколков safetensor и около 510.3 GB файлов Git-LFS на коммите dba1be0a40aa45a94ad051997016db3960a90277. Этот счёт байтов — артефакт загрузки, а не измеренная память GPU.
У системы всё ещё есть магистраль 552B, адресуемая хостом память Engram 196B, маршрутизация экспертов, пути кэша FP4/FP8, предвыборка RDMA и постоянное хранение KV. Выпуск DeepSeek приглашает команды, планирующие крупное развёртывание с 2,000 GPU плюс кластер хранения, связаться с компанией. Этот пример показывает масштаб полной системы обслуживания; это не заявленный минимум для каждого развёртывания. Меньшие исследовательские развёртывания могут использовать квантование или другой параллелизм, но их не следует выводить из экономики API поставщика.
Открытые веса дают командам доступ к checkpoint, проверяемость и контроль над политикой развёртывания. Они не воспроизводят автоматически слияние ядер DeepSeek, иерархию кэша, планирование DSpark, пакетирование или задержку публичного API. Сравнивайте план самостоятельного хостинга с измеренной пропускной способностью, восстановлением после сбоя, простаивающей ёмкостью, полосой хранения и трудом эксплуатации.
DeepSeek V4.1 Flash на Modelflare
DeepSeek V4.1 Flash работает на Modelflare. Запуск, подтверждённый оператором, независимо виден в публичном каталоге цен Modelflare и в исходном каталоге. В 2026-09-10 15:21 UTC оба показали новую запись deepseek-v4.1-flash-0910; производственная конфигурация показала включённую способность deepseek-stable и включённый маршрут, объявляющий ту же модель.
| Пункт Modelflare | Живое значение |
|---|---|
| ID модели, который посылать | deepseek-v4.1-flash-0910 |
| Доступность | Живая в публичном каталоге и во включённой группе маршрутизации |
| Публичная группа | deepseek-stable |
| Цена ввода | $0.193548 / 1M token |
| Цена кэшированного ввода | $0.003871 / 1M token |
| Цена вывода | $0.774194 / 1M token |
| Типы конечных точек | /v1/chat/completions и /v1/responses |
Цены выведены из живой записи: базовый коэффициент ввода $0.322580645, отношение публичной группы 0.6, отношение кэша 0.02 и отношение завершения 4×. Для двух разобранных выше нагрузок Modelflare стоит около $0.0271 и $0.0383 соответственно. Используйте живую страницу цен DeepSeek V4.1 Flash для текущего ID модели и тарифа.
Уровни доказательств всё ещё важны. Публичный каталог и включённый производственный маршрут устанавливают доступность продукта, и оператор явно подтвердил запуск. К 15:30 UTC производственные записи содержали шесть завершённых вызовов Chat Completions под точным новым ID модели, всего 216 prompt-token и 173 token завершения. Это проверяет аутентифицированную отправку Chat Completions и тарифицируемый вывод. Это всё ещё слишком маленькая выборка запуска, чтобы мерить задержку или доступность, и она независимо не доказывает поведение Responses или мультимодальность через этот маршрут. Командам следует прогнать собственный маленький запрос приёмки на точной конечной точке, прежде чем переносить производственную работу.
Где у DeepSeek V4.1 Flash настоящее преимущество
У модели связное преимущество, когда важны длинные вводы, частые ходы инструментов и бюджет. Архитектура снижает давление prefill и кэша; цена API превращает эту экономию в необычно низкий публичный тариф; потолок вывода 384K оставляет запас для длинных патчей или отчётов; и checkpoint держит открытым путь самостоятельного хостинга.
| Нагрузка | Почему V4.1 Flash — сильный кандидат | Что мерить |
|---|---|---|
| Agent репозитория | Сильные сообщённые издателем результаты DeepSWE и терминала при низких тарифах token | Принятые изменения, доля прохождения тестов, повторы и время починки |
| Длинный синтез исследования | Ввод 1M, дешёвые попадания в кэш и вывод 384K | Верность цитат, удержание требований и весь вывод |
| Зрительные Agent документов | Родные изображения, обучение OCR и диаграммам и обычные API Agent | Точность полей, чувствительность к кадру и детализации и использование зрительных token |
| Автоматизация большого объёма | Низкие цены пика и вне пика; потолок одновременности 2,500 запросов | Время очереди, доля 429, сбои инструментов и цена на успех |
| Управляемое развёртывание | Checkpoint MIT и документированные пути vLLM/SGLang | Использование оборудования, полоса кэша и хранения и эксплуатационная цена |
Поэтому самое сильное производственное заявление — экономичная работа Agent на длинном контексте, а не «лучшая модель в целом». Если модель завершает настоящую задачу за один принятый прогон там, где более дешёвой маленькой модели нужно несколько починок, V4.1 выигрывает по исходу. Если закрытая модель фронтира предотвращает дорогой сбой, её более высокая цена token всё ещё может быть экономной.
Где OpenAI или Anthropic остаётся более безопасным выбором
Выбирайте модель OpenAI, когда приложение зависит от полной экосистемы Responses, управляемого состояния, размещённых инструментов или контракта, специфичного для OpenAI, который DeepSeek игнорирует. GPT-5.6 Luna — особенно близкий ценовой конкурент для более коротких некэшированных нагрузок; Terra, Sol и Astra меняют гораздо более высокие прейскурантные цены на другие ярусы способности и родные возможности платформы.
Выбирайте модель Anthropic, когда родной контракт инструментов и мышления Claude, управление кэшем или измеренная работа на вашей самой трудной работе Agent важнее прейскурантной цены token. В собственной таблице DeepSeek Claude Opus 5 лидирует в Terminal-Bench 3/4 и Chartography; Claude Fable 5.1 поставлен для самой требовательной работы на длинном горизонте, хотя он существенно дороже на новый token и на token вывода.
Для действий, критичных по безопасности или дорогих, выбор маршрута должен опираться на оценённые режимы отказа и границы разрешений, а не на марку или средние бенчмарков. Используйте руководство по маршрутизации, чтобы разделить работу, которую можно повторить, запасные пути и действия с побочными эффектами.
Список проверки развёртывания
- Используйте
deepseek-flashдля API первой стороны и отдельно запишите любое отображение, специфичное для шлюза. - Начните с усилия high, потом измерьте low и max на том же наборе принятых задач; не приравнивайте имена у поставщиков к равным вычислениям.
- Когда инструменты используются в режиме мышления, верните полный
reasoning_contentровно так, как требуется. - Проверьте каждое поле Responses, от которого вы зависите; отклонённые и тихо игнорируемые параметры требуют разной обработки.
- Записывайте token попадания и промаха кэша, token вывода и рассуждения, повторы, задержку и конечную приёмку.
- Проектируйте экономику кэша вокруг наблюдаемых попаданий, а не вокруг предположения о фиксированном сроке хранения.
- Принуждайте пределы байтов, числа, размера и детализации изображения до отправки мультимодальных запросов.
- Держите авторизацию на стороне приложения, идемпотентность инструментов и проверку вывода независимыми от качества модели.
- Перед запуском заново проверьте цены временных окон, псевдонимы моделей и пределы одновременности.
- Прогоните настоящий аутентифицированный запрос по точному маршруту; каталог моделей или один HTTP 200 — не доказательство способности.
Часто задаваемые вопросы
DeepSeek V4.1 Flash лучше, чем GPT-6 Astra или Claude Fable 5.1? Не как всеобщее заявление. У V4.1 Flash большое преимущество цены и открытых весов и сильные баллы Agent, сообщённые поставщиком. Сам DeepSeek говорит, что крупнейшие закрытые модели сохраняют край на самом трудном рассуждении и краевых случаях. В отчёте V4.1 нет сравнения Astra/Fable на одном harness.
Сколько параметров у DeepSeek V4.1 Flash? Отчёт перечисляет магистраль на 552B параметров плюс параметры Engram на 196B. Она активирует около 8B параметров магистрали на token prefill и 16B на декодированный token. Сказать только «552B всего» опускает Engram; сказать «748B активных» тоже неверно.
Каковы её пределы контекста и вывода? Официальные пределы — один миллион token контекста и до 384K token вывода. Вложения изображений, текст, история инструментов и рассуждение все потребляют соответствующие бюджеты.
Почему её называют Flash? Замысел сосредоточен на более низкой цене обслуживания: асимметричная активация prefill/decode, сжатое разреженное внимание, глобальный KV в FP4, ограниченное постоянное воспроизведение и спекулятивное декодирование. «Flash» не обещает самую низкую задержку для каждого prompt или условия очереди.
Держится ли публичный кэш 72 часа? Не предполагайте этого. Технический отчёт описывает замысел развёртывания с постоянством глобального KV не меньше 72 часов. Руководство публичного API называет кэширование по возможности и говорит, что записи обычно очищаются через часы или дни. Тарификация должна использовать наблюдаемые поля попадания и промаха.
Responses API — это замена OpenAI Responses без переделки? Он принимает знакомую форму, но он без состояния и игнорирует несколько полей OpenAI и размещённые инструменты. Проверьте точный контракт способности, который вам нужен.
Может ли он порождать изображения? Он понимает ввод изображения и возвращает текст. Это не модель генерации изображений.
Могу ли я вызвать V4.1 Flash через Modelflare сегодня? Да. Используйте deepseek-v4.1-flash-0910 в группе deepseek-stable с Chat Completions или Responses. Это ID Modelflare с печатью выпуска; псевдоним первой стороны deepseek-flash — отдельный контракт поставщика.
Источники, метод и журнал обновлений
Эта статья ставит на первое место источники первой стороны и разделяет задокументированные факты, оценки, сообщённые DeepSeek, посчитанные примеры и наблюдаемое состояние каталога Modelflare. Независимого бенчмарка модели не запускали. Математика цены сохранена в сопутствующем исходном артефакте, и каждый сценарий называет свой вектор token и исключения. Обложка без слов — редакционная иллюстрация, порождённая ИИ, в существующем зрительном стиле Modelflare.
Основные ссылки: выпуск DeepSeek V4.1 Flash, технический отчёт, карточка модели, цены, мышление, Responses, совместимость с Anthropic, зрение, кэширование контекста, сравнение моделей OpenAI, цены Anthropic и публичный каталог Modelflare.
Обновление 2026-09-10: обзор в день первой публикации. Он записывает ID модели первой стороны, действующие цены пика и вне пика, уведомление о миграции псевдонима 14 сентября, текущие пределы API, архитектуру технического отчёта и данные бенчмарков. Более позднее обновление того же дня добавляет подтверждённый запуск Modelflare под deepseek-v4.1-flash-0910, живые цены шлюза и посчитанные цены шлюза. Перед внедрением заново проверьте факты, которые могут измениться.