NewsHub.JP
NewsHub.JP

AI予算を半年で溶かすトークン爆発の正体と企業実務に必須の防衛策

by 山本 涼太
URLをコピーしました

企業AI予算を狂わせる費用単位の転換

生成AIの導入が実証実験から日常業務へ広がるにつれ、企業のAI予算は従来のSaaS管理とは別物になっています。席数を数えればよかった時代から、入力、出力、キャッシュ、推論、ツール呼び出しを積み上げる時代へ移ったためです。

McKinseyの2025年調査では、AIを少なくとも1つの業務機能で定常利用している組織は88%に達しました。さらにAIエージェントをどこかの業務で拡大中の企業が23%、実験中の企業が39%とされ、利用量は人のチャットだけでなく、ワークフローそのものに埋め込まれ始めています。

問題は、モデル単価が高いことだけではありません。1回の質問に、長いシステムプロンプト、社内文書検索の結果、過去の会話履歴、JSONスキーマ、ツール定義、再試行が重なります。ユーザーからは短い依頼に見えても、裏側では数十倍のトークンが動く場合があります。これが「トークン爆発」の本質です。

トークン爆発を起こす五つの技術要因

固定プロンプトと検索文脈の肥大化

トークンは単語数と同じではありません。OpenAIの説明では、英語では1トークンが約4文字、または単語の4分の3程度という目安が示されていますが、実際の数はモデル、言語、エンコーディング、記号、空白で変わります。日本語やコード、表、ログ、PDFから抽出した文章では、体感より大きな入力になることがあります。

企業アプリでは、ユーザーの入力よりも固定部分のほうが大きくなりがちです。安全方針、出力形式、担当部署ごとのルール、参照する社内規程、検索で拾った文書チャンク、会話履歴が毎回プロンプトに入ります。RAGを使えば回答品質は上がりますが、検索結果を多く詰め込みすぎると、回答前に予算を消費します。

FinOps Foundationは、トークン消費を増やす要素として、システムプロンプト、文脈と記憶、モデル選択、出力長、再試行やオーケストレーションを挙げています。特に検索拡張、推論モデル、複数のツール呼び出しを組み合わせた処理では、単純なチャットに比べて1桁から2桁大きいトークン消費になり得ます。

出力、推論、再試行の見えない膨張

多くの料金表では、出力トークンが入力トークンより高く設定されています。AnthropicのClaude Sonnet 5.5は、100万トークン当たり入力2ドル、出力10ドルです。Claude Haiku 4.5でも入力1ドル、出力5ドルで、同じ文字量なら出力側が重くなります。GoogleのGemini APIにも、入力より出力の単価が高いモデルが並びます。

さらに、推論モデルでは画面に出ない内部推論トークンが費用に影響します。OpenAIのヘルプでも、推論トークンは見える回答文ではないものの、出力使用量に含まれ、課金対象になると説明されています。短い答えなのに請求が大きい、という現象はここで起きます。

再試行も見落とされがちな増幅装置です。構造化出力が壊れたために再生成する、回答検証に別モデルを呼ぶ、ツール呼び出しが失敗してやり直す、エージェントが計画を立て直す。ユーザーからは1操作でも、請求上は複数の推論になります。出力長の上限、再試行回数、検証モデルの選定を決めないまま本番投入すると、利用者増より速く費用が増えます。

エージェント化とキャッシュミスの連鎖

AIエージェントは費用構造をさらに複雑にします。エージェントは単に回答するのではなく、計画を作り、検索し、コードを読み、外部APIを呼び、結果を解釈し、必要なら再度実行します。Anthropicのドキュメントでは、ツール利用時にツール定義やスキーマ、ツール結果が入力トークンに加わると説明されています。

ここで重要になるのがキャッシュです。OpenAIのプロンプトキャッシュでは、条件を満たす長い共通プレフィックスを再利用できます。GPT-5.6以降では、キャッシュ書き込みは通常入力の1.25倍、読み取りは多くのモデルで0.1倍です。10回同じ前提を使うなら、毎回処理するより大幅に安くできます。

ただし、キャッシュは魔法ではありません。モデル、ツール定義、スキーマ、推論設定、会話圧縮の位置が変わると、同じように見える依頼でも一致しなくなります。固定プロンプトの末尾に日時やユーザー固有情報を混ぜる設計も、キャッシュ効率を落とします。キャッシュを効かせるには、変わらない指示を前方に固定し、変わるデータを後ろに分離する設計が必要です。

5つ目の要因は、高性能モデルの常用です。重要案件で高性能モデルを使うのは自然ですが、分類、整形、抽出、要約の一部まで同じモデルに流すと、単価差がそのまま月次予算を圧迫します。モデルルーティングを設けず、全処理を最上位モデルに寄せる運用は、トークン爆発の典型です。

予算管理を難しくする契約と現場運用

定額に見える契約のクレジット制約

企業が混乱しやすいのは、AIサービスが「定額」に見えても、実際にはクレジット、月次上限、ワークスペース予算、追加利用の可否で制御されている点です。ChatGPT EnterpriseやEduでは、契約によってクレジットベースとトークンベースの仕組みがあり、ユーザー、グループ、ワークスペース単位で利用上限を設定できます。

OpenAIのヘルプによると、トークンベースのEnterpriseワークスペースでは月次のUSD予算がメーター利用を制限します。一方でAPIの支出は別管理です。クレジットベース契約では、共有クレジットプールを使い切った後に追加利用を許すか、止めるかを設定します。上限に達すると一部の高度な機能が一時停止することもあります。

つまり、利用者から見ると「契約しているのに高機能モデルが使えない」「月の途中で機能が制限される」という事態が起こり得ます。これは障害ではなく、契約上の消費枠と利用ペースが合っていない状態です。予算管理では、座席数だけでなく、誰が、どの機能で、どのモデルを、どれだけ使うかを見積もる必要があります。

請求データと利用実態の時間差

クラウド経由でAIを使う場合、請求の見え方にも注意が必要です。Amazon BedrockのCost and Usage Reportでは、入力、出力、キャッシュ読み取り、キャッシュ書き込みなどが別の使用タイプとして扱われます。これは精密な配賦に有効ですが、タグやIAMプリンシパルを整備しないと、どのアプリが費用を生んだかが後追いになります。

Microsoft Foundryのコスト管理では、モデルやエージェントのモニターでトークン使用量や推定コストを確認できます。ただし、トークンとリクエストのチャート、推定コスト、最終請求額には集計タイミングの差があります。さらにAzure OpenAIには、OpenAI APIのような予算超過を直接止めるハードリミットはなく、Azureの予算アラートと自動化で補う必要があります。

Google CloudはGemini APIやVertex AI向けに早期の費用異常検知を用意し、20分から40分程度の遅延で推定異常を出せるとしています。Cloudflare AI Gatewayも、モデル、プロバイダー、ユーザーIDなどのメタデータ単位でドル建ての支出上限を設定できます。こうした仕組みは有効ですが、どれも設計なしに有効化するだけでは十分ではありません。

部門別費用を曖昧にするシャドーAI

トークン爆発は技術だけでなく、組織の問題でもあります。Flexeraの2026年AI Pulse Reportでは、80%の組織がAI投資を増やした一方、3分の1超がAIアプリで過剰支出を経験し、14%が無駄なAI支出を報告したとされています。さらに85%がIT可視性の不足をリスクと見なし、約半数が従業員のAI利用状況を常に把握できているわけではないと答えています。

この状況で部門横断のAPIキーを配ると、費用配賦は崩れます。営業支援、開発支援、法務レビュー、社内検索、顧客対応が同じプロジェクトキーを使えば、請求書は1枚でも改善策は見えません。高コストの原因がモデル選択なのか、長い文書投入なのか、失敗したエージェントのループなのかを判別できないからです。

FinOps Foundationの2025年調査では、AI支出を管理するFinOps実務者は63%に増え、前年の31%から大きく伸びました。調査対象は861人で、約690億ドルのクラウド支出を代表しています。ここで重視されているのは、最初から最適化することではなく、まず利用と費用を理解し、ビジネス価値にひも付けることです。

枯渇を防ぐトークンFinOpsの実装条件

計測粒度の再設計

最初に整えるべきものは、モデル選定ではなく計測です。最低限、リクエストID、ユーザー、部署、アプリ、ユースケース、モデル名、入力トークン、出力トークン、キャッシュ読み取り、キャッシュ書き込み、推論トークン、ツール呼び出し数、再試行回数、失敗理由を記録します。可能なら、回答が業務で使われたか、手直しされたかも記録します。

見るべき指標は「総トークン数」だけではありません。重要なのは、成功タスク当たりコスト、1回答当たり入力と出力の比率、キャッシュヒット率、再試行率、ツール呼び出し回数、モデル別構成比です。安いモデルを使っても失敗して再試行が増えれば、高いモデルを1回使うより高くなる場合があります。

予算も、実験費と本番ランレートを分けるべきです。実験は失敗を含むため、短期間の探索枠として扱います。本番は月次の処理量、ピーク、季節性、利用部署、SLAとひも付けます。実験費をそのまま年額化したり、逆に本番費をPoC水準で見積もったりすると、半年で年度予算を使い切るようなズレが起きます。

モデルルーティングと文脈削減の実務

対策の中心は、モデルを安くすることではなく、仕事に合う粒度へ分けることです。分類、抽出、整形、短い要約は軽量モデルに回し、複雑な推論、設計判断、法的リスクの高いレビューだけを高性能モデルに上げます。最初から最上位モデルを呼ぶのではなく、信頼度や難易度で段階的に昇格させるルーティングが有効です。

文脈削減も効果があります。RAGでは検索結果の件数、チャンク長、重複文書、古い会話履歴を制御します。プロンプトには「念のため全部入れる」のではなく、回答に必要な根拠だけを入れます。長い資料は毎回投入せず、要約、索引、埋め込み検索、差分投入を組み合わせます。

出力側では、最大出力トークン、回答形式、冗長な説明の抑制を設定します。構造化出力を使う場合も、スキーマが過度に大きいと入力が膨らみます。不要な複数候補生成、長すぎる検証プロンプト、失敗時の無制限リトライは避けるべきです。AIに任せる範囲を広げるほど、システム側の上限設計が重要になります。

支出制御と業務継続の両立

支出上限は最後の防波堤です。OpenAI APIでは、組織またはプロジェクト単位で月次支出上限を設定でき、ハードリミットに達すると429エラーで止まります。Cloudflare AI Gatewayも、ドル建ての支出上限をモデルやプロバイダー、メタデータ別に設定できます。どちらも予算管理には有効ですが、業務システムでは停止時の挙動を設計する必要があります。

重要業務では、単純に止めるのではなく、安価なモデルへのフォールバック、要約モードへの切り替え、添付文書数の制限、非同期処理への退避、承認付き追加枠を用意します。ユーザーには「使えない」とだけ表示するのではなく、現在の制限理由と代替手段を返すべきです。

また、キャッシュはコスト対策であると同時に設計規律です。固定プロンプト、ツール定義、参照文書の順序を安定させ、変動データを後段に置くことで、キャッシュ読み取り比率を上げられます。GoogleのProvisioned Throughputでも、キャッシュ済み入力は通常入力より小さいバーンダウンで扱われる例が示されています。大規模利用では、この差が月次の処理能力と費用を左右します。

経営者が来期予算で確認すべき指標

AI予算の議論は、単価交渉だけでは不十分です。確認すべきなのは、どの業務がAIで増え、どの処理が価値を生み、どのトークンが無駄になっているかです。経営会議では、総額、部署別利用、モデル別構成比、成功タスク当たりコスト、キャッシュヒット率、再試行率、ツール呼び出し数を月次で見る必要があります。

来期予算では、実験枠、本番枠、緊急追加枠を分けて設計します。あわせて、ハードリミットに達した時の業務継続策、部門ごとの責任者、APIキーとプロジェクトの分離、シャドーAIの棚卸しを決めます。AIの利用拡大は止まりませんが、トークン爆発は不可避ではありません。見える化、モデル分担、文脈削減、支出制御を同時に進める企業ほど、AI投資を費用事故ではなく競争力に変えられます。

参考資料:

山
山本 涼太

AI・半導体・先端技術・SaaS

AI・半導体・通信などの先端技術とそれを事業化する企業を取材。技術の本質と市場インパクトをわかりやすく解説する。

関連記事

AI浪費を防ぐ企業統治、生成AIの費用対効果を測る実務の条件

生成AIの社内利用はMcKinsey調査で88%に広がる一方、EBIT効果を示す企業は39%にとどまります。API課金、AIエージェント、クラウド費用が重なれば、個人の試行は経営課題に膨張します。CIOと取締役会が設けるべき予算統制、KPI、業務設計、停止基準、プロジェクト別原価管理を具体策から解説。

中小企業が生成AIで価格戦略を磨き自社の物語を利益に変える実践法

生成AIは価格表を自動で作る道具ではなく、顧客価値、競合、原価、自社の物語を結び直す経営参謀です。帝国データバンク調査で企業活用が34.5%に広がる中、中小企業が価値ベース価格を使い、価格仮説、検証、営業現場への落とし込み、情報漏洩や誤回答を防ぐ統制、データ基盤の整え方までを含む実務手順を具体的に解説。

AI暴走とサイバー攻撃を防ぐ企業の安全設計と監視運用実務対策

生成AIとエージェントAIの普及で、プロンプト注入、データ漏洩、脆弱性悪用の速度が経営リスクに直結しています。NIST、CISA、NCSC、OWASPなどの最新ガイドと2026年の侵害統計を基に、企業が今すぐ整えるAI棚卸し、権限管理、サンドボックス、監視、事故対応、取締役会への報告体制を解説します。

最新ニュース

銀行脆弱性検知が倍増、AI時代の金融サイバー防衛を急ぎ再構築

国内大手行で脆弱性検知が前年の2倍に増えたとの情報を手がかりに、Claude MythosなどフロンティアAIが銀行の攻防速度を変える構図を整理。金融庁・日銀の短期要請、全銀協の自主停止論、サードパーティ管理、国際規制の視点まで、決済網への波及を抑える資産保護と利便性の優先順位を冷静に詳しく読み解く。

ガソリン車シェア初の5割割れ、原油高がEV需要を押し戻す構図

2026年1〜6月の世界新車販売でガソリン車シェアが49%に低下し、EVは原油高と中国勢の価格競争力を追い風に復調しました。欧州や韓国、新興国では補助策と燃料費不安が需要を押し上げる一方、米国は税控除終了で失速。日本メーカーのHV依存、電池・ソフト投資の遅れ、供給網再編の課題を整理し、次の競争軸を読み解く。

PPIHのトイザらス買収が映すドンキ刷新とファミリー開拓戦略

PPIHが民事再生下の日本トイザらス事業を取得へ。158店舗、玩具市場1兆1664億円、少子化下で伸びるキダルト需要を手掛かりに、ドンキが苦手層へ届くブランド再設計と再建リスクを分析。アピタやMEGAドンキとの連携、玩具調達力、家族客接点、店舗体験刷新の成否を、消費文化の変化とM&A戦略から読み解く。

プルデンシャル生命処分へ、保険販売停止3カ月の統治課題を読む

金融庁がプルデンシャル生命に一部業務停止命令を検討。約31億円の金銭不祥事、販売自粛中に判明した多摩支社の追加事案、補償委員会の進捗、第一四半期の新契約急減を整理する。保険販売の現場で何が起きたのかをたどり、3カ月停止が示す営業報酬制度、三線管理、親会社ガバナンス、顧客本位の実効性の課題を読み解く。

カスハラ対策義務化で中小企業に広がる録音カメラと専用保険の実務

2026年10月1日、全事業主にカスハラ対策が義務化された。従業員相談があった企業は27.9%、経験労働者は10.8%、小規模企業の未対応は約39%。厚労省指針の必須措置、録音・録画機器やAI検知、弁護士費用を補償する保険、最大40万円の支援策まで、中小企業の実務を読み解く。