GLM-5.3、Kimi K3、Qwen3.8-Max:機能・料金・API 接続ガイド
GLM-5.3、Kimi K3、Qwen3.8-Max の一次資料、Modelflare の現行料金とグループ、Chat Completions、Responses、Anthropic Messages の例、本番確認をまとめた検証済みガイドです。
Modelflare では、glm-5.3、kimi-k3、qwen3.8-max を1つの互換ゲートウェイから利用できるようになりました。本ガイドでは各モデルに向く用途、現在の米ドル料金、3種類のリクエスト契約、API Key 作成から本番確認までの安全な接続手順を説明します。
以下では、ベンダーの一次資料と Modelflare カタログ上の事実を分けて記載します。ベンダーが示す能力が、そのままゲートウェイで公開済みとは限りません。必ず最新のモデル行と、クライアントが実際に使うエンドポイントを確認してください。
変動する可用性、グループ、料金は 2026年8月29日 に確認しました。それ以降は Modelflare 料金ページを正としてください。
3モデルの概要
| モデル ID | 適した出発点 | 一次資料にある能力 | コンテキストと推論 |
|---|---|---|---|
| glm-5.3 | 複雑なコーディングと長時間の Agent タスク | Z.ai は GLM-5.3 を難しいコーディングと長期 Agent 作業向けと位置付け、API では思考が常時有効 | 思考は常時有効。文書化された強度は low、high、max、既定値は max |
| kimi-k3 | 長いコンテキストのコーディングと知識作業 | Kimi はネイティブな視覚理解と、端から端までの長期作業を記載 | 最大1Mコンテキスト。思考は常時有効。low、high、max、既定値は max |
| qwen3.8-max | 専門ワークフローと長時間 Agent | Qwen は総2.4T・活性95Bの MoE、コーディング、視覚入力、ツール中心の作業を記載 | 1Mコンテキスト。テキスト・画像・動画入力、テキスト出力。一部ツールは地域とエンドポイントに依存 |
最新のベンダー表現は、GLM-5.3 発表、Kimi モデル選択ガイド、Qwen3.8-Max リファレンスで確認できます。ベンチマーク値はベンダー報告であり、Modelflare の保証ではありません。
ワークロードで選ぶ
- 継続的な計画、難しいコード変更、長い Agent ループが必要で、常時推論の予算を確保できる場合は glm-5.3 を候補にします。
- 非常に大きなコンテキスト、視覚理解、端から端までの知識作業が中心なら kimi-k3 を候補にします。
- 1M Token ウィンドウ、マルチモーダル入力、構造化ツール、専門的な自動化が重要なら qwen3.8-max を候補にします。
これは出発点であり、万能な順位ではありません。機密情報を除いた自社タスクを再生し、成功タスク単価、再試行、遅延、レビュー時間を測定してください。大きなコンテキスト上限は容量の天井であり、すべての位置で同じ有用性や速度を保証しません。
Modelflare 料金スナップショット
以下は現在の公開グループにおける 100万 Token あたりの米ドル料金です。グループ倍率は 0.8x で、発表の「公式価格 × 0.8」という表現に対応します。
| モデル | グループ | 入力 | 出力 | キャッシュ入力 |
|---|---|---|---|---|
| glm-5.3 | glm-stable | $1.12 | $3.52 | 約 $0.21 |
| kimi-k3 | kimi-stable | $2.40 | $12.00 | $0.24 |
| qwen3.8-max | qwen-stable | $1.60 | $4.80 | $0.20 |
金額はライブカタログの入力価格、completion 比率、キャッシュ比率、グループ倍率から計算し、読みやすく丸めています。料金ページにキャッシュ書き込み専用項目がある場合、キャッシュ作成にはその項目を使い、読み取り価格から推定しないでください。
現在3グループはいずれも rpm: 0 で、プラットフォーム側に固定グループ RPM 上限が設定されていないことを示します。ただし、ベンダー、アカウント、ネットワーク、安全上の制限は残ります。料金と可用性は変わるため、ライブ料金ページと利用記録で照合してください。
1つのゲートウェイと3つの API 契約
このスナップショットでは、Modelflare カタログは3つのモデル ID を次の公開形式に対応と表示しています。
| 契約 | エンドポイント | 認証 | 主な用途 |
|---|---|---|---|
| OpenAI Chat Completions | POST /v1/chat/completions | Authorization: Bearer | 既存チャットクライアントと互換 SDK |
| OpenAI Responses | POST /v1/responses | Authorization: Bearer | Responses の項目とイベントを扱うクライアント |
| Anthropic Messages 互換 | POST /v1/messages | x-api-key または Bearer と anthropic-version | Anthropic 形式のクライアントとメッセージストリーム |
共通の OpenAI 互換 Base URL は https://modelflare.dev/v1 です。Anthropic SDK は通常 https://modelflare.dev を Base URL とし、/v1/messages を追加します。エンドポイント対応は機能同等性を意味しません。ストリーミングイベント、ツール、構造化出力、マルチモーダル入力、推論制御を個別に確認してください。
Modelflare への接続
- API Keys でキーを作成または更新し、目的のモデルを含む glm-stable、kimi-stable、qwen-stable のいずれかを付与します。
- キーは環境変数に保存し、リポジトリ、ブラウザストレージ、サポートチケットには書かないでください。
- 同じキーで /v1/models の認証済み応答を確認し、正確な ID で小さな非ストリーミングリクエストを送ります。
- Agent やユーザートラフィックを移す前に、ストリーミングを別契約としてテストします。
Chat Completions
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "移行リスクを3つの箇条書きで要約してください。"}],
"stream": false
}'
Responses API
curl -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"input": "安全なデータベース移行の短いチェックリストを返してください。",
"stream": false
}'
Anthropic Messages
curl -sS https://modelflare.dev/v1/messages \
-H "x-api-key: $MODELFLARE_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"max_tokens": 256,
"messages": [{"role": "user", "content": "最初の3つのリリース確認項目を挙げてください。"}]
}'
例では意図的にプレーンテキストと stream: false を使っています。クライアントが選択した契約のイベント形式を処理できてからストリーミングを有効にしてください。意味を持つ明示的な 0 と false は保持し、契約確認なしにベンダー固有フィールドを別モデルへコピーしないでください。
本番前の確認
- 同じキーでモデル一覧を取得し、正確な ID とグループが見えることを確認します。
- アプリが実際に呼ぶエンドポイントで、非ストリーミングとストリーミングを1回ずつ試します。
- ツール、構造化出力、画像、動画、推論制御を使う場合、選択モデルで各機能を個別に試します。テキスト応答の成功だけでは証明になりません。
- 利用記録から状態、選択グループ、入力・出力・キャッシュ Token、遅延、再試行、最終課金を保存します。
- アプリ側の再試行回数を制限し、一時的な容量応答と終了扱いのモデル・ポリシーエラーを分けます。
- 大量投入前にライブ料金を再確認します。料金ページと利用記録はコピーした表より優先されます。
よくある質問
この料金は固定ですか? いいえ。日付付きのカタログスナップショットです。ライブ料金ページが正です。
rpm: 0 は無制限という意味ですか? いいえ。プラットフォーム側のグループ RPM 上限が未設定という意味です。ベンダー、アカウント、ネットワーク、安全上の制限は適用され得ます。
同じ payload を3プロトコルに送れますか? いいえ。モデル ID は維持できますが、包み、認証、応答パーサー、ストリーミング処理を契約に合わせてください。
1Mコンテキストが文書化されているモデルは? Kimi K3 と Qwen3.8-Max はリンク先の一次資料に明記されています。本ページは GLM-5.3 に 1M を主張しません。
情報源と更新日
- Z.ai:GLM-5.3
- Kimi API モデル選択
- Alibaba Cloud Model Studio:Qwen3.8-Max
- Modelflare ライブ料金
- Modelflare の Qwen3.8-Max 詳細ガイド
- OpenAI 互換 API ガイド
- Responses API と Chat Completions
更新記録: 2026年8月29日 — 初版。一次資料、Modelflare グループ、エンドポイント表示、料金を同日に確認しました。