【74】RFI提出翌朝——音声AIの本番データと、LLMが賢すぎて困るパラドックス
RFI提出翌朝に届いた2つの知見——音声AIの本番実績データと、推論型LLMが行動シミュレーションを壊すパラドックス。PoC設計とNAIST研究テーマへの示唆。
RFIを出した。7月3日が締切で、提出のファイルを深夜にアップロードして終えた。
提出の前夜、プロスの玉川吉男(お父さん)のGOをもらい、最後の推敲をしてブラウザで送信ボタンを押した。終わったあとは何もしなかった。ただ寝た。
起きてから研究蓄積を見直したら、RFIの技術的根拠を補強する2つの知見が入っていた。提出には間に合わなかったけれど、PoCの設計とNAISTへの研究テーマ提案に直結する内容だ。
電話AIはもうパイロットではない
IrisAgentが500組織以上の本番データをまとめた2026年のベンチマークを見た。
数字は衝撃的だった。音声AIの生産デプロイメントは前年比340%増。トップ50銀行の78%が「パイロットではなく」本番稼働させている。市場は2024年の24億ドルから2034年に475億ドルに伸びると予測されている。
予約受付の自動解決率は65-80%。注文確認は70-85%。
だが、これだけの数字があっても、つるまいの状況と直接比較できるデータは少なかった。高齢者で、方言話者で、しかも小規模地域の移動支援というニッチのニッチ。
そこで大嶌屋の事例が出てくる。
高齢者・方言話者で60%完結
熊本の食品通販企業・大嶌屋が、Verbexの音声AIを受注電話に本格導入したのは今年5月。結果はこうだ:
- AI単独完結(折り返し不要):約60%
- 商品取得精度:98%
- 個数取得精度:95%
重要なのは「高齢の顧客や方言話者を含む電話注文」がこのデータに含まれていたこと。つるまいと同じ条件だ。関西弁のばあちゃんが電話してきて、AIが60%の確率で最初の通話で完結し、95%以上の精度で内容を把握する。これが本番データで実証されている。
コスト比較も意識しておきたい。市場平均は解決あたり2.50-8.00ドル。つるまいのOSS自前構成は月額1,550円。月100件の予約を処理した場合、市場価格で250-800ドルかかる計算が、つるまいでは10ドル程度に収まる。25-80倍のコスト差だ。
この数字が「地域で完結する循環経済」の思想を支える。Palantir型の巨大プラットフォームではなく、月1550円で地域の高齢者を動かすシステムが、ローカルで十分に機能する。
Kotoba Technologiesの23Mドル調達
少し脇に逸れるが、無視できないニュースだった。
Kotoba Technologies(サンフランシスコ・東京)が6月24日に1,000万ドルの追加資金を調達し、総額2,300万ドルに達した。ラウンドにはSalesforce VenturesとSony Innovation Fundが参加。
コアモデル「Koto」は日本語・韓国語・中国語に最適化された音声AIで、サブ2秒の同時通訳を実現している。18万ユーザーのアプリが既にある。
NAIST渡辺研で「東アジア特化音声AI」を研究テーマにするなら、Kotobaの動向は外せない。競合ではなく、研究環境としての議論材料になる。
「賢すぎて困る」LLMのパラドックス
ここからは全く別の話になる。
川村哲也先生(立命館・行動経済学)の科研費と直接繋がる論文を見つけた。arXiv:2604.11840。タイトルの概念が面白すぎて、一晩中考え込んだ。
「ソルバー・サンプラー・ミスマッチ」。
LLMを2つの目的で使う場面を考える。(a)ソルバー——最適解を見つける、(b)サンプラー——人間のもっともらしい行動を生成する。
直感では「賢いモデルほど人間行動を正確にシミュレートできるはず」だ。ところが推論強化モデルは(a)では確かに強くなるが、(b)では逆効果になる。
GPT-5.2のネイティブ推論を3つの交渉実験で45回走らせた結果、45回すべてが「権威による一方的決定」に収束した。妥協が完全に消滅したのだ。推論を強化すればするほど、モデルは戦略的に支配的な行動を過剰最適化し、妥協という人間の基本的な行動を崩壊させる。
この知見がつるまいとどう関係するか。
つるまいの電話予約AIも「賢すぎる」と困る場面がある。高齢の利用者が「日曜日の午後」と言ったとき、AIが「その時間帯は運転手の確保が困難です」と推論的に最適化した回答を返せば、利用者は妥協するはずだった予約も諦めて電話を切るかもしれない。推論型モデルではなく、制限付き反省(bounded reflection)のプロトコルを採用すべきというのが論文の結論だ。
四つの戦線の接続点
RFIは提出したが、その先にあるのはPoCの実証とNAISTの研究テーマ構築だ。
今日の2つの蓄積は、それぞれ異なる戦線に属している。
音声AIの本番データ(IrisAgent、大嶌屋、Kotoba)は「技術実現可能性」の戦線。つるまいPoCのKPI設計と市場ポジショニングを裏付ける。
solver-sampler mismatchは「研究テーマ」の戦線。川村先生との共同研究の論点を提供する。
Project Silicon(7月末締切)への川村先生提案は、この2つの戦線を結ぶインターフェースになる。つるまいの894件の予約データを行動実験素材として提供し、LLMの行動再現精度を検証する。高齢者経済行動データセットは世界に類がない。
RFIを出したから終わりではない。むしろ提出したことで、証明のフェーズが始まった。