← Back to Home
AI・テクノロジー ·

Jev — 「インターネットの瞬間」を迎えたAI判断層(193倍速い・444倍安い判断モデルの全貌)

TypeSafe AIの「System One Model」Jevを、0xCodilaの10ステップ設計図と一次情報から解剖。193倍速い・444倍安いの数字の出所、Choice/Score/Noulの3プリミティブ、State→Questions→Action→Verifyの設計パターンまで。

Jev — 「インターネットの瞬間」を迎えたAI判断層(193倍速い・444倍安い判断モデルの全貌)

0xCodilaが2026年9月18日に投稿したスレッドは、32万ビューを超えた。 タイトルは「Jev is “Internet” moment for AI」。 193倍速い、444倍安い。 Claude Fable 5.1とGPT-6 Astraを相手にしたテストで出た数字だ。

ルイス・ウーはリングワールドの縁で、超光速船のエンジン音を聞いたことがない。 だが彼は、効率が上がれば需要が増えることを知っている。 ジェヴォンズのパラドックス。 石炭で起きたことが、知能でも起きる。

TypeSafe AIの創業者ディオゴ・アルメイダは、OpenAIでRLHFを作った人間だ。 ChatGPTの研究基盤を築いた。 4年間、同じ問いを抱えていた。 「チャットで超人になったモデルが、なぜ自動化を生まないのか」

答えは、アーキテクチャが間違っているからだった。 LLMはSystem 2だ。遅く、逐次的にトークンを吐き、幻覚を見る。 自動化に要るのはSystem 1。速く、並列で、構造化された判断を返すものだ。 TypeSafeはそれを「System One Model」と名付け、最初の実装をJevと呼んだ。

1. 判断を分離せよ

エージェントのループはこうだ。 LLMが考え、ツールが実行し、モデルが評価し、またLLMが考える。 すべての分岐がモデル呼び出しになる。 コストもレイテンシも、分岐の数に比例して膨らむ。

Jevはそこから「判断」だけを切り出す。 state(非構造テキスト+プログラム状態)を入力し、型付き質問のマップを投げる。 戻ってくるのは、選択肢と確率、スコア、yes/noの確率。 すべて並列、1回のフォワードパス、70〜500ミリ秒。

コードで書くとこうなる。

state: "Research three new AI-agent tools and draft tomorrow's briefing. Save the draft for my review."
questions:
  next_action: Choice[research, write, review]
  relevance:   Score[unrelated, partial, direct]
  needs_review: Noul

これがJevへの1リクエストだ。 戻り値はコードが直接使えるJSON。パースもバリデーションもいらない。 スキーマ一致は構造上保証される。タイプエラー0%。 幻覚も構造上0%——選択肢の外を出しようがないからだ。 ただし「誤答」と「過信」はあり得る。だから毎回答に、較正された確率とconfidenceが付いてくる。

2. 3つのプリミティブ

2. 3つのプリミティブ

TypeSafeは3つのAIプリミティブを定義した。 ソフトウェアのプリミティブと同じように、合成可能で信頼できる部品だ。

Choice — 1つを選ぶ。 「どのワーカーを次に動かすか」「どのモデルにルーティングするか」。 返り値は選択肢、確率分布、confidence。

Score — 尺度で採点する。 「このソースはどのくらい関連するか」「緊急度は1〜5のどこか」。 返り値はスコア、確率分布、confidence。

Noul — yes/noの確率を返す。 「このリクエストは公開判断を要するか」「作業は完了したか」。 返り値は0.0〜1.0の確率。

興味深い設計が2つある。 第1に、質問IDはモデルに見えない。フィールド名をsafe_to_publishにしても、指示には機能しない。 要件は質問文と選択肢の記述に書く。プロンプトインジェクション的な「名前への依存」を構造が許さない。 第2に、全質問は並列かつ独立に評価される。質問同士が互いの答えを読まないため、context rot(文脈の腐敗)が起きない。 エビデンス——収集済みソース、発見、残りギャップ——は、元の依頼文とは別フィールドでstateに渡す。

3. バッチで判断、逐次で実行

codilaのステップ5はこう主張する。 13個の質問を1コールで投げると、逐次13回より10倍速く、12.2倍安い。 並列評価だからだ。

Browser Useの実装では、ページ状態を1回の読み取りで収集し、無関係なアニメーションの再予測を避けた。 ブラウザプロトコル呼び出しの中央値が1,092回から101回へ。 タスク時間の中央値は25%減った。 「より速いモデルに金を払う前に、繰り返しツール呼び出しを検査せよ」——これがJev的アプローチだ。

4. あらゆる有界フォークに配置する

ステップ6。 エージェント選択、モデル選択、ツール選択、ブラウザアクション選択、人間へのエスカレーション判断。 これらはすべて「有界フォーク」だ。選択肢が有限で、stateから決まる判断。 Jevを置けば、LLM呼び出しが判断の数だけ減る。

選択肢が多い場合は、コードで明らかなミスマッチを先に除外し、残りをJevでスコアリングする。 Choiceは最大255オプションまで対応。それ以上は2段階(スコアリング→選択)が公式の推奨だ。

ステップ8の実測値。 誤ったHermes skillロードは16.8%から7.3%へ。 リーガルTop-10検索の的中率は38%から62%へ。 「広くランク付けし、狭く読む」。 Jevが広く選別し、LLMが狭く深く読む。 これが、スキルロードの無駄撃ちを半分以下にする仕組みだ。

5. システムを盗め、プロンプトを盗むな

ステップ9は、記事全体で最も実用的な部分だ。 Chief of Staff、モデルルータ、受信箱ファイアウォール、リサーチフィード、ブラウザコントローラ、セーフティゲート。 異なる用途の6システムが、すべて同じパターンで動く。

State → Questions → Action → Verify

プロンプトをコピーしてその場しのぎをするのではなく、判断システムとして設計し、再利用する。 そしてBrowser Useは、JevがDONEを選んだ後に、独立して結果を検証する。 判断と検証の分離。 「confidenceが高い」ことは「ファイルが保存された」ことを証明しない。 新しいstateで実績を確かめて初めて、完了になる。

6. 数学・執筆・不可逆実行から遠ざけろ

ステップ10。 code computes, LLMs create, Jev decides, fresh state proves the result. コードが計算し、LLMが生成し、Jevが決め、新しいstateが結果を証明する。

Jevに数学をさせない。コードがやる。 Jevに文章を書かせない。LLMがやる。 Jevに不可逆な実行(発券、削除、送金、公開)をさせない。承認ゲートの後ろに置く。 Jevが決めるのは「次に何をするか」だけだ。

7. 実測値の重み

7. 実測値の重み

codilaが挙げた実例を並べる。

  • Browser Use + Jev: Google Flightsの検索結果まで7.1秒、$0.0039(Jev入力90,558トークン+テキストヘルパーの課金。ブラウザ実行コストは別。発券まではしない)
  • Hassan: AI研究論文1,018件を分類、合計$0.08、1件あたり中央値256ms
  • Riley Brown: 受信箱トリアージ(返信・調査・待機・レビューに自動分類)
  • LangChain: タスクに応じて安いモデルと推論モデルをルーティング
  • Vercel fxチーム: GPT-5.6-luna比で5〜18倍速い安全性分類、精度も向上

TypeSafe公式ベンチは193.6倍速い、444.6倍安い。 ただし公式自身が「実世界のゲインとしては上限側」と明言している。 ベンチ方法論は、全モデルに同一ワークフローを与え、最強モデル(Astra+Fable)の平均を参照確率として使うもの。 公式いわく「Jevはパレートフロンティアをほぼ2桁支配している」。

Doom実演も面白い。 構造化stateベースで、1秒あたり10クエリ、コストは時給7ドル相当。 「リアルタイム知能が、コードの中に住めるようになった」という一例だ。

8. アーキテクチャの転換

「LLMが仕事を作り、Jevが次を決める」。 この分離が、エージェントスタック全体を変える。

これまでの構造では、分岐のたびにフロンティアモデルを呼び出していた。 遅く、高く、JSONパースは壊れ、幻覚で分岐を誤る。

これからの構造は3層に分かれる。 LLMはリサーチ・計画・執筆に専念する。 Jevはルーティング・スコアリング・承認・エスカレーションを担当する。 コードが判断を実行する。

ほとんどのビルダーは、yes/no/ルート/スコアのすべてにフロンティアモデルのトークンを払い続ける。 わずかな人間だけが「思考」と「判断」を分け、桁違いに速いエージェントを、桁違いに安く作る。 codilaはそう締めくくっている。

9. 始め方(10ステップ要約)

  1. Jevに会う: LLMが書き、エージェントが動き、Jevが次の手を選ぶ——知性と実行の分離
  2. 3プリミティブに落とす: すべてのエージェント分岐をChoice/Score/Noulに変換
  3. アクセス前に構築: TypeSafe公式アダプタ(OpenAI/Anthropic/xAI)で先に繋ぎ、後でJevに差し替え
  4. 最初のJev: state 1つ、並列3判断、リスクベース閾値、実キュー
  5. 判断をバッチ化: 逐次化せず、1コールで複数質問(13問で10倍速・12.2倍安)
  6. あらゆる有界フォークに配置: ワーカー/モデル/ツール/ブラウザ/エスカレーション選択に、新鮮なstateを読ませる
  7. ループ全体をベンチ: Browser Use 7.1秒、Every 777チェック0.7秒未満、Mobile Jev 9アクション21秒
  8. 広くランク、狭く読む: 誤skillロード 16.8%→7.3%、リーガル検索 38%→62%
  9. システムを盗め: 6システム全部が State→Questions→Action→Verify
  10. 数学・執筆・不可逆実行から遠ざける: code computes, LLMs create, Jev decides, fresh state proves

完全な10ページ設計図はcodilaのX記事とSubstack(@0xcodila)で公開されている。 TypeSafe Playground(typesafe.ai)は早期アクセス制。 OpenRouter、Vercel AI Gateway、Netlify AI Gateway、AIMLAPIの各ゲートウェイ経由なら、待ちなしでアクセスできたという報告もある。 価格は入力$0.042/100万トークン、出力無料(出力トークンを生成しないため)。 コンテキスト64k、テキストのみ、という制限は把握しておきたい。

10. ジェヴォンズの影

10. ジェヴォンズの影

ウィリアム・スタンリー・ジェヴォンズ(1835-1882)。 蒸気機関の効率が上がったとき、石炭消費は減らなかった。増えた。 TypeSafeは社名の由来をこう説明する。 「知能のコストが1桁下がるごとに、ユースケースが桁で増える」 モデル名Jevは、このジェヴォンズのパラドックスへのオマージュだ。

皮肉なことに、この予測はLLMにも当てはまる。 判断が安くなれば、LLMの生成は減るどころか増える。 判断層と生成層が、互いを増幅し合う。 「インターネットの瞬間」という表現は、要するにそういうことだ。

ルイス・ウーならこう言うだろう。 「効率が上がったからといって、使わなくなるわけではない。使い方が変わるだけだ」

Jevはチャットボットではない。 あなたのシステムの現在stateを読み、あなたが定義した選択肢の中から、確率付きで答えを返す。 テキストを生成しないモデルが、生成するモデルの隣に座る。 それが、2028年のAIエンジニアスタックの核になる——codilaはそう見ている。

【加藤テック記事 #1】

元記事: https://note.com/keity717/n/nea24232f8eb2