GLM-5.3, Kimi K3 и Qwen3.8-Max: возможности, цены и API
Проверенное руководство по GLM-5.3, Kimi K3 и Qwen3.8-Max: первичные сведения, цены и группы Modelflare, примеры Chat Completions, Responses, Anthropic Messages и проверки перед продакшеном.
Modelflare теперь предоставляет glm-5.3, kimi-k3 и qwen3.8-max через единый совместимый шлюз. В этом руководстве запуска разобраны подходящие задачи, текущий снимок цен в USD, три поддерживаемых контракта запросов и безопасный путь от создания API Key до производственной проверки.
Ниже отдельно указаны сведения из первичных документов поставщиков и факты каталога Modelflare. Заявленная поставщиком возможность не означает, что такая функция уже доступна через шлюз: проверяйте актуальную строку модели и тот endpoint, который вызывает ваш клиент.
Изменяемые данные о доступности, группах и ценах проверены 29 августа 2026 года. После этой даты источником истины является страница цен Modelflare.
Три модели в кратком виде
| ID модели | С чего начать | Возможности по первичным источникам | Контекст и рассуждение |
|---|---|---|---|
| glm-5.3 | Сложное программирование и долгие agent-задачи | Z.ai позиционирует GLM-5.3 для трудного кода и длинных задач агента; в API мышление остаётся включённым | Мышление всегда включено; документированы уровни low, high, max, по умолчанию max |
| kimi-k3 | Программирование с большим контекстом и работа со знаниями | Kimi описывает нативное понимание изображений и сквозную работу с длинным горизонтом | До 1M контекста; мышление всегда включено; low, high, max, по умолчанию max |
| qwen3.8-max | Профессиональные процессы и долгие агенты | Qwen документирует MoE с 2,4T общих и 95B активных параметров, кодом, визуальным вводом и инструментальными сценариями | Контекст 1M; ввод текста, изображений и видео; текстовый вывод; набор инструментов зависит от региона и endpoint |
Сверьте анонс GLM-5.3, выбор моделей Kimi и справочник Qwen3.8-Max с актуальными формулировками поставщиков. Их benchmark-показатели опубликованы самими поставщиками и не являются гарантией Modelflare.
Выбор по рабочей нагрузке
- Используйте glm-5.3 для длительного планирования, сложных изменений кода или длинного цикла агента, если постоянное рассуждение укладывается в бюджет.
- Используйте kimi-k3, когда критичны очень большой контекст, понимание изображений или сквозной процесс работы со знаниями.
- Используйте qwen3.8-max, когда нужны окно в 1M токенов, мультимодальный ввод, структурированные инструменты или профессиональная автоматизация.
Это ориентиры, а не универсальный рейтинг. Воспроизведите на обезличенной выборке собственных задач и измерьте стоимость успешной задачи, повторы, задержку и время проверки. Большой предел контекста — это потолок, а не обещание одинаковой пользы или скорости для каждой позиции.
Снимок цен Modelflare
Ниже указаны USD за 1 миллион токенов для текущих публичных групп. Множитель группы равен 0.8x и соответствует формуле из объявления «официальная цена × 0.8».
| Модель | Группа | Ввод | Вывод | Кэшированный ввод |
|---|---|---|---|---|
| glm-5.3 | glm-stable | $1.12 | $3.52 | около $0.21 |
| kimi-k3 | kimi-stable | $2.40 | $12.00 | $0.24 |
| qwen3.8-max | qwen-stable | $1.60 | $4.80 | $0.20 |
Значения рассчитаны по цене ввода, коэффициенту completion, коэффициенту кэша и множителю группы из живого каталога, затем округлены. Если на странице есть отдельное поле записи в кэш, используйте его для создания кэша и не выводите из цены чтения.
Сейчас все три группы показывают rpm: 0: фиксированный групповой лимит RPM на стороне платформы в каталоге не задан. Это не отменяет ограничений поставщика, аккаунта, сети или безопасности. Цены и доступность меняются; сверяйте живую страницу цен с записью использования.
Один шлюз, три API-контракта
В этом снимке каталог Modelflare отмечает все три ID для следующих публичных форматов:
| Контракт | Endpoint | Аутентификация | Подходящий сценарий |
|---|---|---|---|
| OpenAI Chat Completions | POST /v1/chat/completions | Authorization: Bearer | Существующие чат-клиенты и совместимые SDK |
| OpenAI Responses | POST /v1/responses | Authorization: Bearer | Клиенты, работающие с элементами и событиями Responses |
| Совместимый Anthropic Messages | POST /v1/messages | x-api-key или Bearer с anthropic-version | Клиенты в форме Anthropic и потоки сообщений |
Общий OpenAI-совместимый Base URL — https://modelflare.dev/v1. Anthropic SDK обычно используют https://modelflare.dev как базу и добавляют /v1/messages. Доступность endpoint не доказывает одинаковое поведение: отдельно проверяйте события streaming, инструменты, структурированный вывод, мультимодальный ввод и управление рассуждением.
Подключение через Modelflare
- В API Keys создайте или обновите ключ и выдайте ему группу с нужной моделью: glm-stable, kimi-stable или qwen-stable.
- Храните ключ в переменной окружения. Не помещайте его в репозиторий, браузерное хранилище или тикет поддержки.
- Проверьте ответ авторизованного /v1/models, затем отправьте небольшой запрос без streaming с точным ID.
- До переноса агента или пользовательского трафика отдельно проверьте streaming-контракт.
Chat Completions
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "Суммируй риски миграции в трёх пунктах."}],
"stream": false
}'
Responses API
curl -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"input": "Верни короткий список проверок безопасной миграции базы данных.",
"stream": false
}'
Anthropic Messages
curl -sS https://modelflare.dev/v1/messages \
-H "x-api-key: $MODELFLARE_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Назови первые три проверки перед rollout."}]
}'
В примерах намеренно используется обычный текст и stream: false. Включайте streaming только после того, как клиент умеет обрабатывать события выбранного контракта. Сохраняйте явные значения 0 и false, если они семантически важны; не переносите поле поставщика между моделями без проверки контракта.
Проверка перед продакшеном
- Получите список моделей с тем же ключом и подтвердите точные ID и группу.
- Выполните по одной проверке без streaming и со streaming на фактическом endpoint приложения.
- Если нужны инструменты, структурированный вывод, изображения, видео или управление рассуждением, проверьте каждую функцию на выбранной модели; текстовый ответ ничего больше не доказывает.
- Сохраните в записи использования статус, выбранную группу, входные/выходные/кэш-токены, задержку, повторы и итоговое списание.
- Ограничьте повторы на стороне приложения и отличайте временную нехватку ёмкости от окончательной ошибки модели или политики.
- Перед большим объёмом снова откройте живые цены; страница и запись использования важнее скопированной таблицы.
Частые вопросы
Эти цены постоянны? Нет. Это датированный снимок каталога; источником истины остаётся живая страница цен.
Означает ли rpm: 0 неограниченный трафик? Нет. Для группы просто не задан потолок RPM на платформе. Ограничения поставщика, аккаунта, сети и безопасности всё равно возможны.
Можно ли отправить один payload во все три протокола? Нет. Сохраните ID модели, но адаптируйте оболочку, аутентификацию, разбор ответа и обработчик streaming под выбранный контракт.
Какие модели документируют контекст 1M? Kimi K3 и Qwen3.8-Max указывают 1M в связанных первичных источниках. Для GLM-5.3 эта страница не заявляет 1M.
Источники и актуальность
- Z.ai: GLM-5.3
- Выбор моделей Kimi API
- Alibaba Cloud Model Studio: Qwen3.8-Max
- Живые цены Modelflare
- Подробное руководство Qwen3.8-Max на Modelflare
- Руководство по OpenAI-совместимому API
- Responses API и Chat Completions
Запись обновления: 29 августа 2026 года — первая версия; первичные страницы, группы Modelflare, отметки endpoint и цены проверены в этот день.