← Back to Home
AI・テクノロジー ·

軽量ハーネス vs 重量ハーネス——Piは200トークン、Claude Codeは10,000トークン

Piは200トークン、Claude Codeは10,000トークン——同じAIモデルでもハーネスの選び方で費用が10倍変わる。高校生にもわかるコーディングエージェント設計思想の分岐点

軽量ハーネス vs 重量ハーネス——Piは200トークン、Claude Codeは10,000トークン

軽量ハーネス vs 重量ハーネス——Piは200トークン、Claude Codeは10,000トークン

モデルに任せるか、ハーネスで削るか。コーディングエージェント設計思想の分岐点


1. 同じ「AIにコードを書かせる」でも、料金が10倍違う

「AIにプログラミングを任せる」。一言で言っても、裏側ではまったく違う仕組みが動いていて、同じ仕事をさせるのにかかる金額が10倍以上変わる。

タスクClaude CodeCodex CLIGemini CLI
バグ修正(小)$0.036$0.028$0.003
新モジュール追加(中)$0.174$0.080$0.143
大規模リファクタ(大)$3.150$0.252$0.400

2026年3月時点の実測値。小タスクなら12倍、大タスクなら12.5倍もの開きがある。

大事なのは「どのAIモデルを使うか」だけじゃない。「どの道具立て(ハーネス)で使うか」がコストと速度を決める。 そしてその鍵を握るのが「トークン」という単位の理解だ。


2. まず3層構造を理解しよう

AIエージェントの世界は3つの層に分かれている:

この記事で扱う「ハーネス」は 🦾 BODYの部分。AIの頭脳(モデル)は同じでも、ハーネスが違えば、パフォーマンスもコストもまるで変わる。

料理にたとえると:

  • HEAD = シェフの腕前(GPT-5 / Claude / Gemini)
  • NECK = 食材の仕入れ先(OpenRouter / OpenCode)
  • BODY = 厨房の設計・道具の揃え方 ← ここが今回の主役!

同じシェフでも、厨房(ハーネス)が違えば出来上がる料理も予算もまったく変わる。


3. トークンって何?なぜ大事?

トークン = AIが理解する言葉の最小単位。

「私はプログラマーです」という文なら:

  • 「私」「は」「プログラマ」「です」→ だいたい5〜7トークン
  • 英語なら1単語がだいたい1トークン

AIに支払う料金は、このトークンの使用量で決まる。

モデル入力(1Mトークンあたり)出力(1Mトークンあたり)
Claude Sonnet 4$3$15
GPT-4.1 / codex-mini$1.50$6
Gemini 2.5 Flash$0.15$0.60
DeepSeek V4 Flash$0.14$0.28
Kimi K2.7 Code$0.95$4.00

つまり 「どれだけトークンを消費するか」がそのまま料金に直結する。そして、ハーネスによって同じタスクでも消費トークン数がまったく違う。 これがこの記事の核心だ。


4. ハーネスって具体的に何をするの?

AIがコードを書くとき、裏ではこういうことが起きている:

  1. システムプロンプトの作成 — 「あなたはプログラミングのプロです。以下のルールに従って…」という最初の指示書
  2. ツール定義 — 「ファイルを読む」「検索する」「実行する」など、使える道具の一覧と使い方
  3. 会話履歴の管理 — これまでのやりとりを覚えておく
  4. サブエージェントの起動 — 必要に応じて別のAIを呼び出す
  5. 結果の検証と整形 — 出力が正しいかチェックする

このすべてがトークンを消費する。特に「システムプロンプト」と「ツール定義」は毎回のやりとりで必ず送られるので、ここが長いと毎回数十万トークンを無駄に消費することになる。


5. 軽量ハーネス:Piの哲学

Pi(@earendil-works/pi-coding-agent)は「ハーネスは最小限に」という哲学を貫く。

  • システムプロンプト:200〜1,000トークン
  • ツールはたった4つ:read / write / edit / bash
  • セッションはJSONLで保存、完全に読める
  • ライセンス:MIT、完全無料

思想:「モデルが賢いんだから、余計な指示は要らない」

システムプロンプトのイメージ:
「あなたはプログラマーです。read/write/edit/bashの4つのツールが使えます。
PythonとNode.jsが使えます。セッションはJSONLに保存されます。」

たったこれだけ。あとはモデルの能力に任せる。

✅ 利点:

  • 起動が爆速
  • 1回の呼び出しで無駄が最小
  • 完全に透明 — 何が起きているか全部読める
  • モデルを自由に差し替えられる(15以上のプロバイダ、324モデル)
  • 月額0円(モデル代のみ)

⚠️ 欠点:

  • 複雑なタスクだと迷う
  • モデルが弱いと結果も弱い
  • サブエージェントや高度な機能はなし

比喩: シェフに「料理して」とだけ言って、包丁1本だけ渡すスタイル


6. 重量ハーネス:Claude Codeの哲学

Claude Code(Anthropic)は「ハーネスで頑張ってトークンを最適化する」哲学。

  • システムプロンプト:約2,900トークン(core)+約110の条件付きセクション → 実質10,000トークン超
  • ツール多数+MCPサーバーで拡張可能
  • サブエージェント、cron、Teams、リモート制御、GitHub統合

思想:「ハーネス側で丁寧に誘導すれば、モデルの性能を最大限引き出せる」

✅ 利点:

  • 複雑なタスクを安定して実行
  • 豊富な機能(Teams、cron、リモート制御)
  • SWE-bench最高スコア(80.9%)
  • 1Mトークンのコンテキスト窓

⚠️ 欠点:

  • トークン消費が大きい
  • システムプロンプトが非公開(逆解析でしかわからない)
  • 安いプラン($20/月)だとすぐ上限到達 → $100/月が実質必須
  • 1日$10〜30のAPI利用がざら

ツール定義だけで55,000トークン

Anthropicの公開データによると:

  • MCPサーバー5つ + 58ツールを upfront 読込:55,000トークン
  • 社内の最大構成:134,000トークン
  • 「Hello」と打っただけで裏で55Kトークン消費している

Anthropicはこれに対して Tool Search(遅延読込)という機能を開発し、85%削減に成功したが、これはあくまで対策であって、設計の複雑さを物語っている。

比喩: 厨房全部の道具と100ページのマニュアルを一緒に渡すスタイル。でも料理は確かにうまい。


7. 一覧比較

ツールシステムプロンプトツール数透明性得意分野月額コスト目安
Pi200〜1K4✅ 完全公開単純タスク爆速モデル代のみ
OpenCode変動(8系統)20+✅ 公開バランス型モデル代のみ
Codex CLI非公開(Rust)多数⚠️ 部分的コスパ最強$20(ChatGPT Plus込)
Gemini CLI非公開多数✅ Apache 2.0巨大コード解析無料〜API課金
Claude Code10K+多数+MCP❌ 非公開複雑タスク$20〜100/月

8. 金額の具体例:同じ仕事、この差

週に20の小タスク + 10の中タスク + 2の大タスクをこなす開発者の場合:

ハーネス週間コスト月間コスト年間コスト
Claude Code$8.34$23.36$280
Codex CLI$3.56$9.96$120
Gemini CLI$3.03$8.48$102
最適混合$2.80$7.84$94

年間で最大$186もの差がつく。 軽量系のツールだけでも十分な仕事ができるなら、年間約3万円の節約になる。


9. じゃあ、どれを選べばいい?

あなたの状況おすすめ
とりあえず試したいPi(無料、シンプル、完全透明)
ガッツリ開発、品質最優先Claude Code(ただし$100/月覚悟)
コスト最優先、毎日大量Codex CLI($20/月、4倍効率的)
予算ゼロ、軽めのタスクGemini CLI(無料枠あり)
モデルを自由に選びたいOpenCode(75+プロバイダ対応)
超巨大コードベースの解析Gemini CLI(2Mコンテキスト)
学習用・仕組みを理解したいPi(全セッションがJSONLで読める)

💡 プロの「最適混合」戦略

実際に最も効率の良い使い方は「どれか1つ」に絞らないこと:

タスクの種類使うツール理由
大きな設計・実装Claude Code品質と長文脈が強い
日常的な修正・リファクタCodex CLI4倍効率的、$20/月で使い放題
コードレビュー・下調べGemini CLI(無料枠)0円で検索と解析
READMEやコメント生成Pi + ローカルモデル0円、機密情報が外に出ない

10. まとめ:ハーネスを知らずしてAI運用するな

同じモデルでも、使うハーネスで:
 ・トークン消費量が4倍違う
 ・かかる費用が10倍違う
 ・かかる時間が数倍違う

「どのAIモデルを使うか」だけに注目する時代は終わった。

今や 「どのハーネスでそのモデルを動かすか」がパフォーマンスとコストを決める最重要要素 だ。

軽量ハーネス(Pi)は200トークンのシステムプロンプトで「モデルに任せる」哲学。重量ハーネス(Claude Code)は10,000トークンのシステムプロンプトで「ハーネスで徹底管理する」哲学。

どちらが正しいという話ではない。あなたのタスク、予算、求める品質に合わせて選ぶべきだ。

そして、その選択を正しくするために、トークンという単位を理解しておくこと。これが、AIエージェントを「使われている側」から「使いこなす側」に変わる第一歩になる。


参考:本記事のデータは2026年3月〜6月時点のものです。料金や性能は各社のアップデートにより随時変化します。