生成AIの従量課金・推論モードを解説|コスト管理のポイント

GitHub Copilotは2026年6月1日、従来の「プレミアムリクエスト」という枠組みを廃止し、使った分だけ支払う「GitHub AI Credits」による従量課金へ移行しました。4月にはすでに無料トライアルと個人向け有償プランの新規受付も停止しており、Anthropicも6月15日にClaude Codeなど自動実行系の機能をサブスクリプションの利用枠から切り離し、クレジット制で扱う変更を発効させています。生成AI各社の料金体系は、こうして月額固定のサブスクリプションから、使った分だけ支払う従量課金・推論モードに応じた課金へと軸足を移しています。

この転換が重要なのは、コスト管理の考え方そのものを変える必要がある点です。人が対話でAIを使う分には、月額固定でも予算は読みやすいものでした。しかし、AIエージェントが1つのタスクで数百〜数千回もモデルを呼び出すようになると、利用量は事前に見積もりにくくなります。

法人としては、料金プランの選び方だけでなく、利用量を可視化し、モデルや推論の深さを使い分ける運用ルールを持つことが求められます。

※本記事は2026年8月時点の情報です。

月額固定のサブスクリプションから従量課金・推論モード課金へ移行する流れを示す図解
生成AIの料金は月額固定から、使った分だけ払う従量課金・推論モード課金へ移っている

2026年に何が起きたか:定額から従量への転換

2026年の前半だけでも、主要なAIサービスで相次いで料金体系の見直しが行われました。時系列で見ると、単発の値上げ・値下げではなく、構造そのものを変える動きだと分かります。

2026年に相次いだ生成AIの料金体系転換を時系列で示すイメージ
GitHub、Anthropic、Googleが2026年前半に相次いで従量課金・クレジット制へ移行した

GitHubは無料トライアル・新規有償プランの停止からクレジット制へ

2026年4月10日、GitHub Copilotは不正利用の急増を理由に新規の無料トライアル受付を停止しました。続く4月20日には、個人向け有償プランの新規契約も停止しています。そして6月1日、従来の「プレミアムリクエスト」という枠組みを廃止し、「GitHub AI Credits」による従量制へ移行しました(1クレジット=0.01ドル、コード補完機能は対象外)。公式は、エージェント型ワークフローの広がりが計算需要の前提を根本から変えたと説明しています。

Anthropic・Googleも従量・クレジット化を進めた

6月9日には、Anthropicが新しい最上位モデル「Claude Fable 5」の提供を開始しました(API料金は入力10ドル・出力50ドル/100万トークン)。6月15日には、Claude Codeなどの自動実行系の機能を、サブスクの利用枠から切り離しクレジット制で扱う変更が発効しています。Googleも6月18日にGemini CLIの提供を終了し、無料枠を大幅に削減しました。いずれも、人の対話利用を前提にした定額・無料枠の設計を、機械による自動実行の利用量に合わせて見直す動きです。

ポイント

GitHubは2026年4月に無料トライアル・新規有償プランを止め、6月にAI Creditsの従量制へ移行しました。Anthropicも6月15日に自動実行系機能をクレジット制へ切り離し、Googleも同時期に無料枠を削減しています。

なぜ「使った分だけ」課金に向かうのか

背景にあるのは、AIの使われ方が「人が都度会話する」から「エージェントが自動でタスクをこなす」へ広がったことです。1件の対話であれば、月額固定でも各社の採算は取りやすいものでした。しかし、コーディングエージェントやAIエージェントが、1つのタスクの中で調査・実行・検証を何度も繰り返すようになると、1ユーザーあたりの呼び出し回数が桁違いに増え、定額モデルの前提が崩れます。

AIエージェントの大量呼び出しが定額モデルを壊した

GitHub Copilotが無料トライアルを止めた理由として「不正利用の急増」が挙げられているように、大量にAPIを呼び出す使い方は、想定していた定額プランの採算ラインを崩しやすくなります。各社が新規受付の停止やクレジット制への移行を急いだのは、利用量に応じて費用を回収できる仕組みへ作り直す必要があったためです。

推論の深さで料金を変える発想も広がる

従量課金と並行して、「どこまで深く考えさせるか」で消費量や料金を変える設計も広がっています。Claude Opus 5のエフォート設定(low・medium・high)は、知能の深さとトークン消費量を利用者が調整できる仕組みです。GPT-5.6の値下げで追加されたFast modeも、標準の2倍の料金で処理速度を2.5倍にする選択肢であり、「同じ知能をどの条件で使うか」で単価を分ける考え方は共通しています。定額の月額料金だけでなく、こうした推論条件の選択も、実質的なコストを左右する要素になっています。

推論の深さ(エフォート設定)と料金・速度の関係を示す図解
エフォート設定や処理速度の選択によって、消費量や料金の単価が変わる

ポイント

AIエージェントの大量呼び出しが定額モデルの採算ラインを崩したことが、従量課金へ向かう主な理由です。エフォート設定やFast modeのように、推論の深さ・速度で料金を変える設計も同時に広がっています。

主要サービスの料金構造を比較する

サービス2026年の主な変更課金の特徴
GitHub Copilot4月に無料トライアル・個人有償プランの新規受付停止、6月にAI Creditsへ移行1クレジット=0.01ドルの従量制(コード補完は対象外)
Anthropic Claude6月にFable 5提供開始、自動実行系をクレジット制へ分離Maxプランは定額、APIとエージェント実行は従量
Google Gemini6月にGemini CLI終了、無料枠を大幅削減標準の推論課金、上位プランでキャッシュ等の割引
OpenAI GPT-5.67月にLuna80%・Terra20%値下げ、Fast mode追加モデル別の従量課金+速度優先の割増プラン

各社に共通するのは、月額固定の枠を残しつつも、実際の処理量が多い部分は従量課金やクレジット消費で精算する二段構えになっている点です。プラン名だけで比較せず、「何が定額分に含まれ、何が従量になるか」を契約前に確認する必要があります。

ポイント

各社とも月額固定の枠を残しつつ、処理量が多い部分は従量課金やクレジット消費で精算する二段構えです。プラン名だけでなく、何が定額に含まれ何が従量になるかを契約前に確認してください。

企業がコストを管理する実務ポイント

従量課金・推論モード課金が広がる中で、企業側もコストの見える化と使い分けルールを整備する必要があります。

利用量の可視化とアラート設計

トークン消費量やクレジット残高を部署・用途ごとに可視化し、想定を超えたら通知する仕組みを持つことが第一歩です。AIエージェントの自動実行は、人の目が入らないまま消費が積み上がりやすいため、上限設定とアラートを組み合わせておくと、想定外の高額請求を防ぎやすくなります。

モデル・エフォートの使い分けルールを決める

すべての処理を最上位モデル・最高エフォートで回すと、コストは急速に膨らみます。Copilot in Excelのように、日常業務は軽量モデル、重要な判断だけ上位モデルへ切り替える設計を、業務ごとに具体的なルールとして決めておくと、担当者の判断ばらつきを抑えられます。

キャッシュ・バッチAPIでコストを抑える

各社とも、同じ内容を繰り返し処理する場合のコンテキストキャッシュや、即時性が不要な処理をまとめて実行するバッチAPIを用意しています。リアルタイム性が不要な社内バッチ処理は、こうした割引の仕組みへ寄せることで、体感速度を落とさずにコストだけを抑えられる場合があります。自社の処理がキャッシュやバッチに向くかどうかは、各社の公式料金ページで最新の条件を確認してください。

企業が生成AIコストを管理する3つの実務ポイント(利用量の可視化とアラート、モデル・エフォートの使い分け、キャッシュ・バッチAPIの活用)を示す図解
利用量の可視化、モデル・エフォートの使い分け、キャッシュ・バッチAPIの活用でコストを抑える

ポイント

利用量の可視化とアラート、業務ごとのモデル・エフォートの使い分けルール、キャッシュ・バッチAPIの活用が、従量課金時代のコスト管理の基本です。

まとめ:料金プランではなく「使い方」を管理する時代へ

2026年の一連の料金改定が示しているのは、生成AIのコスト管理が「どのプランを契約するか」だけでなく、「モデル・エフォート・処理タイミングをどう使い分けるか」という運用の問題になったということです。

GitHub・Anthropic・Google・OpenAIそれぞれの動きを個別のニュースとして見るのではなく、従量課金・推論モード課金という共通の流れとして捉え、自社の利用量を可視化しながら、コストと品質のバランスを継続的に見直していきましょう。

よくある質問(FAQ)

Q. なぜ生成AIの料金は定額から従量課金へ移っているのですか?

AIエージェントが1つのタスクで数百〜数千回モデルを呼び出すようになり、人の対話利用を前提にした定額プランでは採算が取りにくくなったためです。GitHub Copilotの無料トライアル・新規有償プラン停止や、クレジット制への移行はその代表例です。

Q. 「推論モード課金」とは何ですか?

モデルに「どこまで深く考えさせるか」を選ばせ、その条件によって消費量や料金を変える設計です。Claude Opus 5のエフォート設定(low・medium・high)や、GPT-5.6のFast mode(標準の2倍料金で2.5倍速)が例に挙げられます。

Q. 2026年にどんな料金体系の変更がありましたか?

4月にGitHub Copilotが無料トライアル・個人有償プランの新規受付を停止、6月にAI Creditsの従量制へ移行、Claude Fable 5の提供開始、Gemini CLIの終了、7月にGPT-5.6の値下げなどが相次ぎました。

Q. 企業はコストをどう管理すればよいですか?

利用量を部署・用途ごとに可視化してアラートを設定し、業務の重要度に応じてモデルやエフォートを使い分けるルールを作ることが基本です。即時性が不要な処理はキャッシュやバッチAPIの活用も検討します。

会社紹介

株式会社riplaでは、お客様の事業・ユーザー・業務に最適化したオーダーメイド型システムを、構想策定・要件定義から開発・改善まで一気通貫で支援。事業会社でIT・DXを経験したプロフェッショナルによる高い要件定義力・システム設計力を活かし、事業成果の最大化に伴走します。

また、当社独自の開発テンプレート「Boxシリーズ」による標準機能の高速開発と、AI駆動開発の独自フレームワーク「GoDD」による独自機能のAI実装を組み合わせることで、低コスト・短期間で開発を実現いたします。

もし、システム開発やプロダクト開発に関するご要望がございましたら、お気軽にお問い合わせください。

・サービス概要資料のURLはこちら >>>
・お問合せページのURLはこちら >>>
・お役立ち資料のURLはこちら >>>

執筆者プロフィール
張田谷凌央
張田谷凌央

株式会社ripla 代表取締役CEOとして、システムパッケージ活用、システム開発、データ分析、生成AI活用、SaaS開発、アプリ開発、EC構築など、幅広い領域で企業のDX推進と事業成長を支援している。事業会社でIT・DXを経験したプロフェッショナルが集う株式会社riplaにおいて、お客様の事業・ユーザー・業務に最適化したオーダーメイド型システムを構想策定・要件定義から開発・改善まで一気通貫で支援し、単なるシステム納品にとどまらず、クライアントと同じ目線で事業成果の最大化に向けた伴走支援を行う。早稲田大学卒業後、ラクスル株式会社、LINEヤフー株式会社にて事業開発やDX推進などに従事した後、株式会社riplaを創業。