Qwen3.8-Max: MoE 2.4T и настройка в Modelflare

Практическое руководство по Qwen3.8-Max: MoE 2.4T/95B, мультимодальный контекст 1M tokens, параметры рассуждения, актуальные цены и настройка запуска.

Команда Qwen официально выпустила Qwen3.8-Max 3 августа 2026 года. Это не старая модель Qwen3-8B, с которой ее легко спутать, и уже не только июльская preview qwen3.8-max-preview: текущий официальный ID модели в API — qwen3.8-max, и Modelflare использует тот же ID.

Это крупнейшая на данный момент флагманская модель Max от Qwen, предназначенная для программирования, профессиональных workflows, длительной работы Agents и нативных мультимодальных задач. Qwen также объявила, что открытые веса Qwen3.8-Max и Qwen3.8-27B появятся на следующей неделе. Пока репозитории и лицензии фактически не опубликованы, корректная формулировка — «открытые веса анонсированы», а не «уже доступна для локального развертывания».

Основные характеристики

Параметр Qwen3.8-Max
ID модели в Modelflare qwen3.8-max
Архитектура Mixture-of-Experts (MoE)
Общее число параметров 2.4T
Активные параметры на Token 95B
Длина контекста 1M tokens
Максимальный ввод без режима рассуждения 991K tokens
Максимальный ввод в режиме рассуждения 983K tokens
Максимальный вывод 131K tokens
Максимум Token рассуждения 262K tokens
Входные модальности Текст, изображения и видео
Выходная модальность Текст
Глубина рассуждения low, medium или xhigh; по умолчанию xhigh
Официальные функции Prefix Completion, Function Calling, Context Cache, Structured Outputs, Batch и встроенные инструменты Responses

2.4T — это общий размер модели, а не число параметров, исполняемых для генерации каждого Token. В официальном анонсе указано 95B активных параметров; эта величина лучше отражает объем вычислений, фактически задействованный в MoE-инференсе. Контекст 1M tokens также не означает, что каждый запрос нужно заполнять до предела: с ростом ввода и бюджета рассуждения требуется отдельно проектировать задержку, кэш и стоимость.

На какие задачи ориентирован Qwen3.8-Max

Qwen позиционирует выпуск как широкое обновление для программирования и Cowork и выделяет три типа работы:

  • выполнение многодневного программного проекта с пустого каталога вместо генерации отдельных функций;
  • подготовка многоэтапных результатов для исследований, анализа данных, Office, дизайна и других профессиональных workflows;
  • использование понимания изображений и видео на этапах планирования, выполнения и проверки, а не только для однократного статического распознавания.

Qwen демонстрирует примеры поставщика, включая более десяти дней автономного программирования и сотни итераций оптимизации дизайна микросхем. Это системные примеры, зависящие от Harness, инструментов, окружения, prompts и метода оценки. Они не гарантируют такой же результат в вашем приложении. Для производственного выбора следует использовать собственные репозитории, документы, разрешения инструментов и критерии приемки в фиксированном наборе задач.

Как выбирать глубину рассуждения

Qwen3.8-Max поддерживает reasoning_effort:

  • low для коротких ответов, простых объяснений кода и задач, чувствительных к стоимости;
  • medium как отправную точку для повседневной разработки, анализа и многошаговых задач;
  • xhigh для сложного рассуждения, длительной работы Agents и комплексной профессиональной работы; это также значение по умолчанию.

По данным Qwen, preserve_thinking включен по умолчанию, чтобы многошаговая работа могла продолжаться из предыдущего состояния рассуждения. Если клиент самостоятельно восстанавливает историю сообщений, он должен сохранять возвращенные поставщиком поля рассуждения и состояние инструментов, а не объединять только финальный текст. Модель допускает до 262K tokens рассуждения, однако доступный максимум не является рекомендуемым значением по умолчанию. Выбирайте effort по успешности задач и удельной стоимости.

Текущая доступность в Modelflare

По состоянию на 4 августа 2026 года Modelflare указывает qwen3.8-max для:

  • OpenAI Chat Completions;
  • OpenAI Responses;
  • Anthropic-Messages-совместимого маршрута.

Метка протокола доказывает наличие маршрута, но не автоматическую передачу всех частных функций QwenCloud. QwenCloud перечисляет web_search, code_interpreter, web_extractor, t2i_search и i2i_search как встроенные инструменты Responses. Пока каждая функция не проверена через точный целевой маршрут Modelflare, отдавайте предпочтение Function Calling, определенному клиентом, а встроенные инструменты считайте непроверенными.

Текущий публичный снимок цен для группы qwen-award приведен ниже, в долларах США за 1 миллион tokens:

Позиция тарификации Цена
Ввод $1.239
Вывод $3.71
Чтение кэша $0.161
Явное создание кэша $1.547
Явное создание кэша на один час $2.4752

Группа доступна только подходящим API Keys. Цены, право доступа и диапазон протоколов могут меняться; используйте Модели и цены и журналы использования отдельных запросов как актуальные источники.

Рекомендуемая настройка Chat Completions

Сначала сохраните Modelflare API Key в переменной окружения:

export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'

Начните с текстового запроса, чтобы проверить базовый маршрут:

curl -N -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "Design a safe rollout plan for this service and include validation and rollback gates."
      }
    ],
    "reasoning_effort": "medium",
    "stream": true
  }'

С помощью medium сначала получите базовые показатели качества, задержки и стоимости, затем повышайте до xhigh только те задачи, которым действительно требуется более глубокое рассуждение. Значение xhigh по умолчанию на upstream не означает, что каждому пакетному запросу нужен максимальный бюджет рассуждения.

Как вводить мультимодальные данные

Официальная модель принимает текст, изображения и видео, однако формат мультимодального содержимого зависит от протокола и реализации upstream. Вводите его в три этапа:

  1. Сначала проверьте аутентификацию, доступ к модели, streaming и тарификацию только на тексте.
  2. Используйте одно фиксированное тестовое изображение для проверки формата содержимого, лимитов размера и ответа.
  3. Затем добавьте длинное видео, инструменты или многошаговую визуальную обратную связь и проверьте, не дублируют ли повторные попытки оплачиваемую работу.

Не считайте URL изображений, Base64-payloads, загрузку файлов и объектное хранилище поставщика взаимозаменяемыми протоколами. Проверьте end-to-end именно тот блок содержимого, который будет отправлять клиент.

Рекомендуемая конфигурация платформы

  1. Используйте отдельный API Key для каждого приложения и убедитесь, что основная группа действительно содержит qwen3.8-max.
  2. Начинайте повседневную разработку и анализ с medium, короткие задачи снижайте до low, а xhigh оставляйте сложной длительной работе.
  3. Проектируйте сегментацию и кэш для длинного контекста, вместо того чтобы помещать всю базу знаний в каждый контекст 1M tokens.
  4. Отдельно проверяйте wire contracts Chat Completions, Responses и Anthropic.
  5. Не делайте встроенные инструменты поставщика производственной зависимостью, пока они не пройдут реальный запрос через целевой маршрут Modelflare.
  6. Сравнивайте успешность, первую выдачу, общую задержку, Token рассуждения, попадания в кэш и стоимость запроса на фиксированном наборе задач.
  7. При переходе с preview на окончательную модель повторно запускайте регрессионные примеры и не считайте, что название семейства гарантирует идентичный вывод.

Подходящие сценарии и ограничения

Qwen3.8-Max подходит для сложной программной инженерии, многоэтапных профессиональных workflows, понимания длинных документов и видео, Agents с мультимодальной обратной связью и команд, желающих объединить рассуждение и оркестрацию в одной флагманской модели. Для простых текстовых преобразований с высокой пропускной способностью и низкой задержкой это может быть не самым экономичным стандартом. Сравните стоимость и задержку на одинаковом вводе с Qwen Flash, DeepSeek V4 Flash или другой меньшей моделью.

Источники и дата проверки

Статья проверена 4 августа 2026 года. Статус открытых весов, снимки модели, цены и поддержка протоколов могут меняться; для production используйте актуальные на момент вызова официальную страницу модели, лицензию репозитория весов и каталог Modelflare.