軽量ハーネス vs 重量ハーネス——Piは200トークン、Claude Codeは10,000トークン
Piは200トークン、Claude Codeは10,000トークン——同じAIモデルでもハーネスの選び方で費用が10倍変わる。高校生にもわかるコーディングエージェント設計思想の分岐点
軽量ハーネス vs 重量ハーネス——Piは200トークン、Claude Codeは10,000トークン
モデルに任せるか、ハーネスで削るか。コーディングエージェント設計思想の分岐点
1. 同じ「AIにコードを書かせる」でも、料金が10倍違う
「AIにプログラミングを任せる」。一言で言っても、裏側ではまったく違う仕組みが動いていて、同じ仕事をさせるのにかかる金額が10倍以上変わる。
| タスク | Claude Code | Codex CLI | Gemini CLI |
|---|---|---|---|
| バグ修正(小) | $0.036 | $0.028 | $0.003 |
| 新モジュール追加(中) | $0.174 | $0.080 | $0.143 |
| 大規模リファクタ(大) | $3.150 | $0.252 | $0.400 |
2026年3月時点の実測値。小タスクなら12倍、大タスクなら12.5倍もの開きがある。
大事なのは「どのAIモデルを使うか」だけじゃない。「どの道具立て(ハーネス)で使うか」がコストと速度を決める。 そしてその鍵を握るのが「トークン」という単位の理解だ。
2. まず3層構造を理解しよう
AIエージェントの世界は3つの層に分かれている:

この記事で扱う「ハーネス」は 🦾 BODYの部分。AIの頭脳(モデル)は同じでも、ハーネスが違えば、パフォーマンスもコストもまるで変わる。
料理にたとえると:
- HEAD = シェフの腕前(GPT-5 / Claude / Gemini)
- NECK = 食材の仕入れ先(OpenRouter / OpenCode)
- BODY = 厨房の設計・道具の揃え方 ← ここが今回の主役!
同じシェフでも、厨房(ハーネス)が違えば出来上がる料理も予算もまったく変わる。
3. トークンって何?なぜ大事?
トークン = AIが理解する言葉の最小単位。
「私はプログラマーです」という文なら:
- 「私」「は」「プログラマ」「です」→ だいたい5〜7トークン
- 英語なら1単語がだいたい1トークン
AIに支払う料金は、このトークンの使用量で決まる。
| モデル | 入力(1Mトークンあたり) | 出力(1Mトークンあたり) |
|---|---|---|
| Claude Sonnet 4 | $3 | $15 |
| GPT-4.1 / codex-mini | $1.50 | $6 |
| Gemini 2.5 Flash | $0.15 | $0.60 |
| DeepSeek V4 Flash | $0.14 | $0.28 |
| Kimi K2.7 Code | $0.95 | $4.00 |
つまり 「どれだけトークンを消費するか」がそのまま料金に直結する。そして、ハーネスによって同じタスクでも消費トークン数がまったく違う。 これがこの記事の核心だ。
4. ハーネスって具体的に何をするの?
AIがコードを書くとき、裏ではこういうことが起きている:
- システムプロンプトの作成 — 「あなたはプログラミングのプロです。以下のルールに従って…」という最初の指示書
- ツール定義 — 「ファイルを読む」「検索する」「実行する」など、使える道具の一覧と使い方
- 会話履歴の管理 — これまでのやりとりを覚えておく
- サブエージェントの起動 — 必要に応じて別のAIを呼び出す
- 結果の検証と整形 — 出力が正しいかチェックする
このすべてがトークンを消費する。特に「システムプロンプト」と「ツール定義」は毎回のやりとりで必ず送られるので、ここが長いと毎回数十万トークンを無駄に消費することになる。
5. 軽量ハーネス:Piの哲学
Pi(@earendil-works/pi-coding-agent)は「ハーネスは最小限に」という哲学を貫く。
- システムプロンプト:200〜1,000トークン
- ツールはたった4つ:read / write / edit / bash
- セッションはJSONLで保存、完全に読める
- ライセンス:MIT、完全無料
思想:「モデルが賢いんだから、余計な指示は要らない」
システムプロンプトのイメージ:
「あなたはプログラマーです。read/write/edit/bashの4つのツールが使えます。
PythonとNode.jsが使えます。セッションはJSONLに保存されます。」
たったこれだけ。あとはモデルの能力に任せる。
✅ 利点:
- 起動が爆速
- 1回の呼び出しで無駄が最小
- 完全に透明 — 何が起きているか全部読める
- モデルを自由に差し替えられる(15以上のプロバイダ、324モデル)
- 月額0円(モデル代のみ)
⚠️ 欠点:
- 複雑なタスクだと迷う
- モデルが弱いと結果も弱い
- サブエージェントや高度な機能はなし
比喩: シェフに「料理して」とだけ言って、包丁1本だけ渡すスタイル
6. 重量ハーネス:Claude Codeの哲学
Claude Code(Anthropic)は「ハーネスで頑張ってトークンを最適化する」哲学。
- システムプロンプト:約2,900トークン(core)+約110の条件付きセクション → 実質10,000トークン超
- ツール多数+MCPサーバーで拡張可能
- サブエージェント、cron、Teams、リモート制御、GitHub統合
思想:「ハーネス側で丁寧に誘導すれば、モデルの性能を最大限引き出せる」
✅ 利点:
- 複雑なタスクを安定して実行
- 豊富な機能(Teams、cron、リモート制御)
- SWE-bench最高スコア(80.9%)
- 1Mトークンのコンテキスト窓
⚠️ 欠点:
- トークン消費が大きい
- システムプロンプトが非公開(逆解析でしかわからない)
- 安いプラン($20/月)だとすぐ上限到達 → $100/月が実質必須
- 1日$10〜30のAPI利用がざら
ツール定義だけで55,000トークン
Anthropicの公開データによると:
- MCPサーバー5つ + 58ツールを upfront 読込:55,000トークン
- 社内の最大構成:134,000トークン
- 「Hello」と打っただけで裏で55Kトークン消費している
Anthropicはこれに対して Tool Search(遅延読込)という機能を開発し、85%削減に成功したが、これはあくまで対策であって、設計の複雑さを物語っている。
比喩: 厨房全部の道具と100ページのマニュアルを一緒に渡すスタイル。でも料理は確かにうまい。
7. 一覧比較
| ツール | システムプロンプト | ツール数 | 透明性 | 得意分野 | 月額コスト目安 |
|---|---|---|---|---|---|
| Pi | 200〜1K | 4 | ✅ 完全公開 | 単純タスク爆速 | モデル代のみ |
| OpenCode | 変動(8系統) | 20+ | ✅ 公開 | バランス型 | モデル代のみ |
| Codex CLI | 非公開(Rust) | 多数 | ⚠️ 部分的 | コスパ最強 | $20(ChatGPT Plus込) |
| Gemini CLI | 非公開 | 多数 | ✅ Apache 2.0 | 巨大コード解析 | 無料〜API課金 |
| Claude Code | 10K+ | 多数+MCP | ❌ 非公開 | 複雑タスク | $20〜100/月 |
8. 金額の具体例:同じ仕事、この差
週に20の小タスク + 10の中タスク + 2の大タスクをこなす開発者の場合:
| ハーネス | 週間コスト | 月間コスト | 年間コスト |
|---|---|---|---|
| Claude Code | $8.34 | $23.36 | $280 |
| Codex CLI | $3.56 | $9.96 | $120 |
| Gemini CLI | $3.03 | $8.48 | $102 |
| 最適混合 | $2.80 | $7.84 | $94 |
年間で最大$186もの差がつく。 軽量系のツールだけでも十分な仕事ができるなら、年間約3万円の節約になる。
9. じゃあ、どれを選べばいい?
| あなたの状況 | おすすめ |
|---|---|
| とりあえず試したい | Pi(無料、シンプル、完全透明) |
| ガッツリ開発、品質最優先 | Claude Code(ただし$100/月覚悟) |
| コスト最優先、毎日大量 | Codex CLI($20/月、4倍効率的) |
| 予算ゼロ、軽めのタスク | Gemini CLI(無料枠あり) |
| モデルを自由に選びたい | OpenCode(75+プロバイダ対応) |
| 超巨大コードベースの解析 | Gemini CLI(2Mコンテキスト) |
| 学習用・仕組みを理解したい | Pi(全セッションがJSONLで読める) |
💡 プロの「最適混合」戦略
実際に最も効率の良い使い方は「どれか1つ」に絞らないこと:
| タスクの種類 | 使うツール | 理由 |
|---|---|---|
| 大きな設計・実装 | Claude Code | 品質と長文脈が強い |
| 日常的な修正・リファクタ | Codex CLI | 4倍効率的、$20/月で使い放題 |
| コードレビュー・下調べ | Gemini CLI(無料枠) | 0円で検索と解析 |
| READMEやコメント生成 | Pi + ローカルモデル | 0円、機密情報が外に出ない |
10. まとめ:ハーネスを知らずしてAI運用するな
同じモデルでも、使うハーネスで:
・トークン消費量が4倍違う
・かかる費用が10倍違う
・かかる時間が数倍違う
「どのAIモデルを使うか」だけに注目する時代は終わった。
今や 「どのハーネスでそのモデルを動かすか」がパフォーマンスとコストを決める最重要要素 だ。
軽量ハーネス(Pi)は200トークンのシステムプロンプトで「モデルに任せる」哲学。重量ハーネス(Claude Code)は10,000トークンのシステムプロンプトで「ハーネスで徹底管理する」哲学。
どちらが正しいという話ではない。あなたのタスク、予算、求める品質に合わせて選ぶべきだ。
そして、その選択を正しくするために、トークンという単位を理解しておくこと。これが、AIエージェントを「使われている側」から「使いこなす側」に変わる第一歩になる。
参考:本記事のデータは2026年3月〜6月時点のものです。料金や性能は各社のアップデートにより随時変化します。