AI APIコスト追跡:トークンとモデルグループ
モデル料金、トークン使用量、グループ倍率、リクエストログがAI APIコストをどう構成するかを理解し、利用量を管理します。
AI APIのコスト追跡では、各費用を1件のリクエスト、1つのモデル、1つのモデルグループ、実測された使用量へ結び付けることが重要です。月次合計からは支出の変化が分かりますが、理由を説明するにはリクエスト単位の記録が必要です。
Modelflareはモデル料金、計測使用量、グループポリシー、リクエストログを関連付け、画面に表示された文字だけで費用を推測しなくてよい状態を作ります。
リクエストコストの4層
1. モデル料金
モデルごとに料金基準が異なります。多くのテキストモデルは入力トークンと出力トークンを分け、画像、音声、Rerankなどは別の計測単位を使う場合があります。固定トークン単価だけで表現できない機能には、バージョン管理された高度な料金ルールが使われることもあります。
料金をアプリへコピーせず、最新のモデルと料金でモデルとAPI形式を確認してください。
2. 実測された使用量
ゲートウェイは完了したリクエストで返却または算出されたUsageを記録します。トークン課金のテキストモデルでは、単価が異なる可能性があるため入力と出力を分けて保持します。
端末に表示されたストリーミングテキストだけでは正確なコストを算出できません。ツールItem、推論、キャッシュ入力、正規化トークン、プロバイダー固有Usageは、通常のAssistantテキストとして表示されなくても課金へ影響する場合があります。
3. モデルグループ倍率
選択されたルーティンググループは、基本使用量料金へ販売倍率を適用できます。たとえばRatioが0.9なら、そのリクエストは基本モデル料金の90%で計算されます。
この倍率は使用量課金にだけ影響し、Top-upで追加されるクレジット量は変えません。
4. 最終リクエスト記録
使用量ログは、計算結果をモデル、グループ、ステータス、トークン、タイミング、安全な運用メタデータへ結び付けます。失敗やキャンセルでは異なる精算経路を通るため、永続化された結果がクライアント側推定より信頼できます。
使用量ログで比較する項目
支出が変わった場合は次を比較します。
- モデル: 入力、出力、機能料金が異なるモデルへ移動したか
- グループ: プライマリまたはフォールバックで倍率が変わったか
- プロトコル: Chat CompletionsとResponsesでUsage形式が変わったか
- 入力サイズ: プロンプト、検索コンテキスト、ファイル、ツール結果が増えたか
- 出力サイズ: Completion上限やエージェントループで出力が増えたか
- ステータスとリトライ: 失敗が追加の完了試行を発生させたか
- タイミング: 長い生成時間が出力量に対応しているか、単なる待機か
無関係なアカウントトラフィックを混ぜず、専用APIキーやRequest IDでワークロードを分離してください。
実用的なコスト境界を作る
ワークロードごとにAPIキーを分ける
本番、開発、自動化、個人ツールで別のキーを作成します。各キーに名前、有効期限、グループポリシー、有限または無制限のQuotaを設定できます。
グループを意図的に選ぶ
表示名だけで選択せず、最新のモデル可用性、倍率、アクセス条件、RPM、フォールバックポリシーを確認します。許容できるフォールバックを持つ低コストのプライマリグループは、説明しにくい暗黙のルーティングより予測しやすくなります。
出力より先に入力を見直す
長いSystem Prompt、繰り返される会話履歴、検索文書、ツール結果が入力使用量の大半を占める場合があります。回答に影響しないコンテキストを削除し、安全に参照またはキャッシュできる不変データを毎回送り直さないようにします。
エージェントループを確認する
1回のユーザー操作が複数のモデルリクエストを発生させることがあります。最終回答を1回のAPI呼び出しとみなさず、各ツールラウンドとリトライを追跡してください。
クライアント推定がずれる理由
ローカルトークナイザーや文字数は計画に使えますが、最終料金と異なる場合があります。
- プロバイダーごとに正規化や計数方法が異なる
- キャッシュ、推論、画像、音声、ツール単位が別料金になる
- 実際に選択されたモデルとグループで精算される
- 失敗リクエストと返金は実際のライフサイクルに依存する
- 料金変更後も過去リクエストは記録済み結果を保持する
財務確認では、1つの表示フィールドから残高を逆算せず、永続化された使用量、ウォレット、関連台帳を照合します。
繰り返し使える確認手順
- 使用量ログを1つのAPIキーと期間へ絞る
- モデルと選択グループで分類する
- リクエストごとの入力、出力、ステータス、コストを比較する
- 外れ値でリトライ、長いコンテキスト、ツールループ、フォールバックを確認する
- ルーティング変更前に最新料金とグループポリシーを確認する
- ハード上限が必要ならキーへ有限Quotaを設定する
- 変更後に同じ指標を再確認する
コスト管理は帰属から始まります。モデル、グループ、使用量、リクエスト結果のつながりを保てば、集計値から推測せず、実際の支出要因を最適化できます。