Claude Codeのトークン節約、すぐ上限に当たる原因と5つの手順
Claude Codeの定額プランには、使える量の上限が「5時間ごと」と「1週間ごと」の2つあります。上限に当たると、枠が戻るまで作業が止まります。この上限にすぐ当たると感じたことはないでしょうか。2026年3月には、Maxプランの利用者から「以前と同じ作業なのに、5時間の枠が1〜2時間で尽きる」という報告が相次ぎました(MacRumors)。
しかも週の上限は、2026年9月14日から実質的に下がります。期間限定だった50%の上乗せが終わり、恒久的な25%の上乗せに切り替わるため、個人向けと、チーム・企業向けの定額プランでは、いまより約17%少なくなります(BleepingComputer)。
「出力を短くさせれば長持ちする」「圧縮ツールを入れれば半分以下になる」といった節約術を調べるほど、どれが本当に効くのか分からなくなった方もいるはずです。公式ドキュメントと公開された実測、筆者自身の30日分のログを突き合わせると、使用量がどこに消えているかは数字で見えてきます。
上限を超えて使うなら、使った量の支払いになる
定額プランの枠の中で使っているあいだは、使いすぎても利用が一時的に止まるだけです。追加の請求は発生しません。
ただ、止まらずに使い続けたい、あるいは組織で本格的に使う場合は、使った量で払う形になります。この量は「トークン[1]」で数えます。トークンとは、AIが読み書きした文字の量を数える単位のことです。
- Enterprise:料金ページの記載では、席料金が1席あたり月20ドル(約3,100円。1米ドル=154.65円、2026年9月11日時点の三菱UFJ銀行の公示相場の中値で換算)で、そこに使った量が上乗せされます(Anthropic)。使った量は、実際に消費したトークンを標準のAPI料金[2]で請求します(Claude Help Center)
- APIキーで使う場合:定額プランではなく、Anthropicの管理画面(Console)で発行した鍵やクラウド事業者経由で使うと、トークン単位で組織に請求されます(Claude Code Docs)
- usage credits:Pro や Max では、枠を使い切ったあとも標準API料金で使い続けられる usage credits[3] を有効にできます(Claude Help Center)。Team や Enterprise でも、席ごとの枠を超えて使うときは usage credits を有効にします(Claude Code Docs)
つまり、枠に収まっているうちは作業が止まり、枠の外で使えば請求が増えます。どちらの場合も、AIにどれだけ読ませ、書かせたかで決まります。
では、その量の大半は何に使われているのでしょうか。
トークン消費の大半は、会話の読み直しにかかっている
AIは毎回、会話を最初から読み直している
使った量の中身を開けてみると、多くを占めるのはAIの出力ではありません。
モデルは、リクエストとリクエストの間のことを覚えていないからです。そのため Claude Code は、メッセージを送るたびに、システムプロンプト[4]、プロジェクトの文脈、それまでのやり取りとツール[5]の結果をすべて送り直しています(Claude Code Docs)。打ち合わせのたびに、前回までの議事録を頭から読み上げてから本題に入る場面を想像してください。
前回と同じ部分はキャッシュ[6](一度読んだ内容の控え)から読まれ、標準の入力料金の約10%で済みます。ただ、送り直す量そのものが多いので、合計は大きくなります。「キャッシュが外れる」とは、この割引が効かず、定価で読み直しになることです。

筆者の30日分では、97.5%が読み直しだった
筆者(松本)が、手元に残っている会話の記録を集計したところ、直近30日(2026年8月12日〜9月10日)で132.7億トークンを使っていました。APIの定価で換算すると11,536ドル(約178万円)、1日あたり384ドル(約5万9,000円)です(Qiita(筆者))。公式ドキュメントが示す企業導入の平均は開発者1人の稼働日1日あたり約13ドル(約2,000円)なので(Claude Code Docs)、その約30倍にあたります。サブスクリプションなので、実際にこの額を請求されてはいません。
内訳は次のとおりでした。
| トークンの種別 | 中身 | 割合 |
|---|---|---|
| 読み直し(キャッシュ読み込み) | それまでの会話を割引の単価で読み直した分 | 97.5% |
| キャッシュ書き込み | 次に割引で読めるよう、新しい部分を控えた分 | 2.1% |
| 出力 | AIが書いた答えやコード、考えた過程 | 0.4% |
| 入力 | 控えを使わずに読んだ新しい部分 | 0.01% |
つまり、使用量を決めていたのは何を書かせたかではなく、会話を閉じずに続けていたことでした。
これは筆者だけの傾向ではありません。GitHubに報告された30日分(2026年1〜2月)でも、トークン全体のうちキャッシュ読み込みが99.93%でした(GitHub issue #24147)。Systimaが2026年7月に Claude Code 2.1.207 の通信を記録した例では、依頼を読む前の固定部分だけで約3.3万トークンありました(Systima)。何が会話を膨らませるかは使い方で変わるので、次の /usage で自分の内訳を確かめてください。
自分の内訳は /usage で確かめる
「自分の使い方でも同じなのか?」と気になったら、/usage[7] を開いてみてください。Claude Codeのバージョン2.1.251以降では、キャッシュから読んだ入力の割合、キャッシュが外れた回数、いまキャッシュが有効かどうかが表示されます(Claude Code Docs)。Pro/Max/Team/Enterprise では、スキル[8]・サブエージェント[9]・MCPサーバー[10]ごとの使用量の内訳も出るので、どこから手を付けるかはこの画面を見て決められます。
Claude Codeのトークンを節約する5つの手順
ここから先は、Claude Codeを実際に操作する人向けの手順です。利用を承認する立場の方は、最後の「まず /usage を開くところから」まで読み飛ばしても、エンジニアに何を頼めばよいかは分かります。
読み直しが使用量の大半を占めるなら、打つ手は2種類に絞れます。読み直す会話を短くすることと、キャッシュを外さないことです。この2つに効く手を、効く順に5つ紹介します。
ステップ1:作業が変わったら /clear で会話を切る
関係のない作業に移るときは、/clear[11] で会話を切ります。/clear そのものに費用はかかりません(Claude Code Docs)。公式ブログも、作業と作業の間に /clear を実行するよう勧めています(Claude Blog)。
「セッションを変える」「Claude Codeを起動し直す」も、会話を持ち越さない点では /clear と同じ効果です。/clear は空の状態で新しい会話を始める操作で(Claude Code Docs)、公式の費用のページでも、/clear で新しいセッションが始まり、/usage の集計がゼロに戻ると説明されています(Claude Code Docs)。CLAUDE.md も、起動したときと /clear のあとの両方で読み込み直されます(Claude Code Docs)。前の会話は保存されているので、あとから /resume[12] で戻れます(Claude Code Docs)。
違うのは、起動し直したときにしか反映されないものがある点です。MCPサーバーの設定を書き換えた場合と、自動更新で新しいバージョンが入った場合は、次の起動から反映されます(Claude Code Docs)。トークンを減らすだけなら、Claude Codeを閉じずに /clear で足ります。
「文脈が消えたら困る……」と感じる方は、長く使う情報をファイルに残してください。いいね1,052を集めたQiitaの記事は「会話は揮発、ファイルは不揮発」として、計画を PLAN.md に書いてから会話を切るよう勧めています(Qiita(tehito))。退勤前に引き継ぎメモを残すのと同じ考え方です。
ステップ2:モデルとeffortは会話の最初に決めて変えない
キャッシュはモデル[13]ごとに別なので、途中でモデルを変えると会話全体を読み直すことになります。effort[14](どこまで考えさせるかの設定)も、多くのモデルでは段階ごとにキャッシュが分かれます(Claude Code Docs)。
ステップ3:CLAUDE.mdを短くし、手順はスキルに移す
CLAUDE.md[15](プロジェクトの指示を書いておくファイル)は会話の開始時に読み込まれ、関係のない作業中もずっと会話に入っています。公式は、特定の作業の手順を呼ばれたときだけ読み込まれるスキルへ移し、CLAUDE.md は200行以内を目安にするよう勧めています(Claude Code Docs)。
Systimaの計測(Claude Code 2.1.207)では、72KB(日本語でおよそ2万〜3万字)の指示ファイルを置くと1リクエストあたり約2万トークン増えました(Systima)。この分が、毎回の読み直しに上乗せされるわけです。
ステップ4:サブエージェントは並列で独立した作業にだけ使う
サブエージェント(親から作業を切り出して任せる別のAI)は、親とは別のシステムプロンプトとツールで会話を始めます。そのため、最初のリクエストでは親のキャッシュを読みません(Claude Code Docs)。
Systimaの例では、直接やれば12.1万トークンで済む小さな作業を2本のサブエージェントに分けたところ、51.3万トークン(4.2倍)になりました(Systima)。同時に進められ、互いに依存しない作業のときだけ分けましょう。
もう1つ見落としやすいのが、サブエージェントの報告の行き先です。筆者の30日分では、サブエージェントは呼び出し件数で全体の約22%あったのに、推計費用では12.4%しかありませんでした。軽いのではなく、終わったときの報告が親の会話に入り、以降のやり取りのたびに読み直されるからです。その分はメインの会話の費用に計上されます(Qiita(筆者))。

ステップ5:流れを捨てるなら /rewind、/compact は休憩の前に
試した方向が外れ、直近のやり取りを捨てたいときは /rewind[16] を使います。/rewind はキャッシュ済みの前の地点まで会話を切り詰めるだけなので、次のリクエストはその地点のキャッシュを使えます(Claude Code Docs、Claude Blog)。
/compact[17] は要約を作ってキャッシュを作り直すので、作業の区切りや休憩の前にかけます。キャッシュの有効期間は、サブスクリプションの枠内なら1時間、usage credits やAPIキーでは既定で5分です(Claude Code Docs)。会社の従量課金で使っているなら、席を立つ直前にかけてください。
| 操作 | 使う場面 | キャッシュへの影響 |
|---|---|---|
| /clear | 関係のない作業に移るとき | 会話を切る。費用はかからない |
| /rewind | 直近の流れを捨てたいとき | キャッシュ済みの地点に戻る |
| /compact | 作業の区切り、休憩の前 | 要約を作り、作り直す |
つまり、話題が変わるなら /clear、捨てるなら /rewind、残して続けるなら区切りで /compact です。
効かない、または逆効果になるトークン節約の通説
5つの手順は、どれも読み直しの量かキャッシュの外れに効くものでした。反対に、よく勧められていても、根拠に照らすと効かない策があります。

- 出力圧縮ツール rtk[18] を入れる:宣伝ではトークン消費の60〜90%削減をうたっています。一方、JetBrainsが2026年7月に公開した課金ありの425回の試行(Claude Code 2.1.201)では、effort が低いとき1作業あたりの費用の中央値が+7.6%(p=0.004[19])、やり取りの回数が+13.8%(p=0.03)と増えました。effort が高いときは+0.1%で差がありませんでした(JetBrains)
- effort を下げるだけにする:筆者の30日分では、出力はトークンの0.4%でした。考える量や出力を削っても、大半を占める読み直しの量は変わりません
- 実装の途中で /compact をかける:/compact は要約のために会話全体を読むので、大きな会話ではそれ自体が大きなリクエストになります。キャッシュが切れたあとなら、全体を割引なしで読み直します(Claude Code Docs)。前出のQiita記事も、途中でかけると元の設計方針が抜け落ちるとして「危ない手術」と呼んでいます(Qiita(tehito))
新しい節約策を見かけたら、導入する前に「これは読み直す量を減らすのか?」と一度問いかけてみてください。
よくある質問(FAQ)
通説のほかにも、設定の見直しや社内への報告で迷いやすい点が残ります。
Q. MCPをつなぎっぱなしにしていると、毎ターン重くなりますか?
ツール定義は、既定で後から読み込まれます。ツールを使うまで、会話に入るのはツール名とサーバーの説明だけです(Claude Code Docs)。ただしツールの返事は会話に残ります。Systimaの計測(2026年7月、2.1.207)では、MCPを5つつなぐと1リクエストあたり約5,000〜7,000トークン増えました(Systima)。
Q. ログ集計ツールの数字を、そのまま請求額として報告してよいですか?
そのまま使わないでください。gille.aiの検証(2026年2月)では、Claude CodeのJSONLログ[20]が入力トークンを実際の100〜174分の1しか記録していませんでした(gille.ai)。検証の時点では、ccusage など、JSONLを集計するツールはすべて影響を受けるとしています。報告には請求画面と /usage の数字を使いましょう。
Q. CLAUDE.mdを削ると、指示を守らなくなりませんか?
短くしたほうが従いやすい、という人気記事があります。いいね568のQiita記事(2026年3月)では、100行のCLAUDE.mdを35行に減らしたところ、出力の質が上がったと報告しています(Qiita(nogataka))。個人の観察ですが、削った手順はスキルに移せば、必要な作業のときだけ読み込まれます。
Claude Codeのトークン節約は、まず /usage を開くところから
ここまで読んで、自分の使用量も読み直しが大半なのか、気になった方もいるのではないでしょうか。確かめながら進める順番は、次の3つです。
- /usage を開き、キャッシュから読んだ入力の割合、キャッシュが外れた回数、使用量の内訳を見る
- 5つの手順のうち、ステップ1の /clear と、ステップ2のモデル・effort の固定から始める
- 数日たったら、もう一度 /usage を開いて変化を比べる
利用料を承認する立場の方は、エンジニアと請求の話をするとき、ログ集計ツールの数字ではなく /usage と請求画面の数字を並べてください。同じ数字を見ていれば、上限を決める話も進めやすくなります。
公式ドキュメントも、公開された実測も、筆者の30日分のログも、同じ場所を指しています。節約は、毎回読み直している会話の量を減らすところから始まります。
用語の注釈
- トークン AIが文章を読み書きするときに数える単位です。Claude Codeの料金や利用枠は、このトークンの数で計算されます。 ↩
- API料金 プログラムからAIを直接呼び出す使い方(API)の、トークン単位の定価です。読む量・書く量・キャッシュごとに単価が決まっています。 ↩
- usage credits 定額プランの枠を使い切ったあとも、超えた分を標準のAPI料金で払って使い続けられる仕組みです。有効にするかは利用者や組織の管理者が選びます。 ↩
- システムプロンプト Claude Codeが会話の最初に必ず付けて送る、AIへの基本の指示です。利用者が書くものではありません。 ↩
- ツール AIがファイルを読む、コマンドを実行する、Webを調べるといった作業をするための機能です。その実行結果も会話に入ります。 ↩
- キャッシュ 前回のリクエストと先頭から同じ部分を控えておき、次は割引の単価で読む仕組みです。前のほうが1文字でも変わると、そこから後ろは割引が効きません。 ↩
- /usage Claude Codeの中で使用量を表示するコマンドです。セッションごとのトークン数や推定金額、プランの枠の使用状況を確認できます。 ↩
- スキル 特定の作業の手順をまとめたファイルです。呼ばれたときだけ読み込まれるので、ふだんの会話には入りません。 ↩
- サブエージェント メインの会話から作業を切り出して任せる、別のAIの会話です。終わると結果の報告だけがメインの会話に戻ります。 ↩
- MCPサーバー Slack・GitHub・Notionなど外部のサービスをClaude Codeから使えるようにする接続です。 ↩
- /clear それまでの会話を捨てて、新しい会話を始めるコマンドです。CLAUDE.mdなどの設定は読み込み直されます。 ↩
- /resume 保存されている過去の会話を選んで、続きから再開するコマンドです。 ↩
- モデル AIの種類のことです。Claude Codeでは Opus・Sonnet・Fable などを選べ、種類ごとに性能とトークンの単価が違います。 ↩
- effort AIが答える前にどこまで深く考えるかの設定です。高いほど丁寧に考えますが、そのぶん考える過程のトークンが増えます。/effort などで変えられます。 ↩
- CLAUDE.md プロジェクトのルールや前提を書いておくファイルです。会話の開始時に自動で読み込まれ、その会話の間ずっと入っています。 ↩
- /rewind 会話とコードを、前の時点まで巻き戻すコマンドです。 ↩
- /compact それまでの会話を要約に置き換えて短くするコマンドです。要約を作るために、会話全体を一度読みます。 ↩
- rtk コマンドの出力を短く縮めてからAIに渡すことで、トークンを減らすとうたう外部ツールです。 ↩
- p=0.004 本当は差が無いと仮定したとき、これほどの差が偶然出る確率がおよそ0.4%という意味です。値が小さいほど、偶然とは考えにくい差です。 ↩
- JSONLログ Claude Codeが手元のパソコンに保存している会話の記録ファイルです。 ↩