GLM-5.3, Kimi K3 и Qwen3.8-Max: возможности, цены и API

Проверенное руководство по GLM-5.3, Kimi K3 и Qwen3.8-Max: первичные сведения, цены и группы Modelflare, примеры Chat Completions, Responses, Anthropic Messages и проверки перед продакшеном.

Modelflare теперь предоставляет glm-5.3, kimi-k3 и qwen3.8-max через единый совместимый шлюз. В этом руководстве запуска разобраны подходящие задачи, текущий снимок цен в USD, три поддерживаемых контракта запросов и безопасный путь от создания API Key до производственной проверки.

Ниже отдельно указаны сведения из первичных документов поставщиков и факты каталога Modelflare. Заявленная поставщиком возможность не означает, что такая функция уже доступна через шлюз: проверяйте актуальную строку модели и тот endpoint, который вызывает ваш клиент.

Изменяемые данные о доступности, группах и ценах проверены 29 августа 2026 года. После этой даты источником истины является страница цен Modelflare.

Три модели в кратком виде

ID модели С чего начать Возможности по первичным источникам Контекст и рассуждение
glm-5.3 Сложное программирование и долгие agent-задачи Z.ai позиционирует GLM-5.3 для трудного кода и длинных задач агента; в API мышление остаётся включённым Мышление всегда включено; документированы уровни low, high, max, по умолчанию max
kimi-k3 Программирование с большим контекстом и работа со знаниями Kimi описывает нативное понимание изображений и сквозную работу с длинным горизонтом До 1M контекста; мышление всегда включено; low, high, max, по умолчанию max
qwen3.8-max Профессиональные процессы и долгие агенты Qwen документирует MoE с 2,4T общих и 95B активных параметров, кодом, визуальным вводом и инструментальными сценариями Контекст 1M; ввод текста, изображений и видео; текстовый вывод; набор инструментов зависит от региона и endpoint

Сверьте анонс GLM-5.3, выбор моделей Kimi и справочник Qwen3.8-Max с актуальными формулировками поставщиков. Их benchmark-показатели опубликованы самими поставщиками и не являются гарантией Modelflare.

Выбор по рабочей нагрузке

  • Используйте glm-5.3 для длительного планирования, сложных изменений кода или длинного цикла агента, если постоянное рассуждение укладывается в бюджет.
  • Используйте kimi-k3, когда критичны очень большой контекст, понимание изображений или сквозной процесс работы со знаниями.
  • Используйте qwen3.8-max, когда нужны окно в 1M токенов, мультимодальный ввод, структурированные инструменты или профессиональная автоматизация.

Это ориентиры, а не универсальный рейтинг. Воспроизведите на обезличенной выборке собственных задач и измерьте стоимость успешной задачи, повторы, задержку и время проверки. Большой предел контекста — это потолок, а не обещание одинаковой пользы или скорости для каждой позиции.

Снимок цен Modelflare

Ниже указаны USD за 1 миллион токенов для текущих публичных групп. Множитель группы равен 0.8x и соответствует формуле из объявления «официальная цена × 0.8».

Модель Группа Ввод Вывод Кэшированный ввод
glm-5.3 glm-stable $1.12 $3.52 около $0.21
kimi-k3 kimi-stable $2.40 $12.00 $0.24
qwen3.8-max qwen-stable $1.60 $4.80 $0.20

Значения рассчитаны по цене ввода, коэффициенту completion, коэффициенту кэша и множителю группы из живого каталога, затем округлены. Если на странице есть отдельное поле записи в кэш, используйте его для создания кэша и не выводите из цены чтения.

Сейчас все три группы показывают rpm: 0: фиксированный групповой лимит RPM на стороне платформы в каталоге не задан. Это не отменяет ограничений поставщика, аккаунта, сети или безопасности. Цены и доступность меняются; сверяйте живую страницу цен с записью использования.

Один шлюз, три API-контракта

В этом снимке каталог Modelflare отмечает все три ID для следующих публичных форматов:

Контракт Endpoint Аутентификация Подходящий сценарий
OpenAI Chat Completions POST /v1/chat/completions Authorization: Bearer Существующие чат-клиенты и совместимые SDK
OpenAI Responses POST /v1/responses Authorization: Bearer Клиенты, работающие с элементами и событиями Responses
Совместимый Anthropic Messages POST /v1/messages x-api-key или Bearer с anthropic-version Клиенты в форме Anthropic и потоки сообщений

Общий OpenAI-совместимый Base URL — https://modelflare.dev/v1. Anthropic SDK обычно используют https://modelflare.dev как базу и добавляют /v1/messages. Доступность endpoint не доказывает одинаковое поведение: отдельно проверяйте события streaming, инструменты, структурированный вывод, мультимодальный ввод и управление рассуждением.

Подключение через Modelflare

  1. В API Keys создайте или обновите ключ и выдайте ему группу с нужной моделью: glm-stable, kimi-stable или qwen-stable.
  2. Храните ключ в переменной окружения. Не помещайте его в репозиторий, браузерное хранилище или тикет поддержки.
  3. Проверьте ответ авторизованного /v1/models, затем отправьте небольшой запрос без streaming с точным ID.
  4. До переноса агента или пользовательского трафика отдельно проверьте streaming-контракт.

Chat Completions

export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "Суммируй риски миграции в трёх пунктах."}],
    "stream": false
  }'

Responses API

curl -sS https://modelflare.dev/v1/responses \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "input": "Верни короткий список проверок безопасной миграции базы данных.",
    "stream": false
  }'

Anthropic Messages

curl -sS https://modelflare.dev/v1/messages \
  -H "x-api-key: $MODELFLARE_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "max_tokens": 256,
    "messages": [{"role": "user", "content": "Назови первые три проверки перед rollout."}]
  }'

В примерах намеренно используется обычный текст и stream: false. Включайте streaming только после того, как клиент умеет обрабатывать события выбранного контракта. Сохраняйте явные значения 0 и false, если они семантически важны; не переносите поле поставщика между моделями без проверки контракта.

Проверка перед продакшеном

  1. Получите список моделей с тем же ключом и подтвердите точные ID и группу.
  2. Выполните по одной проверке без streaming и со streaming на фактическом endpoint приложения.
  3. Если нужны инструменты, структурированный вывод, изображения, видео или управление рассуждением, проверьте каждую функцию на выбранной модели; текстовый ответ ничего больше не доказывает.
  4. Сохраните в записи использования статус, выбранную группу, входные/выходные/кэш-токены, задержку, повторы и итоговое списание.
  5. Ограничьте повторы на стороне приложения и отличайте временную нехватку ёмкости от окончательной ошибки модели или политики.
  6. Перед большим объёмом снова откройте живые цены; страница и запись использования важнее скопированной таблицы.

Частые вопросы

Эти цены постоянны? Нет. Это датированный снимок каталога; источником истины остаётся живая страница цен.

Означает ли rpm: 0 неограниченный трафик? Нет. Для группы просто не задан потолок RPM на платформе. Ограничения поставщика, аккаунта, сети и безопасности всё равно возможны.

Можно ли отправить один payload во все три протокола? Нет. Сохраните ID модели, но адаптируйте оболочку, аутентификацию, разбор ответа и обработчик streaming под выбранный контракт.

Какие модели документируют контекст 1M? Kimi K3 и Qwen3.8-Max указывают 1M в связанных первичных источниках. Для GLM-5.3 эта страница не заявляет 1M.

Источники и актуальность

Запись обновления: 29 августа 2026 года — первая версия; первичные страницы, группы Modelflare, отметки endpoint и цены проверены в этот день.