← Back to Home
研究 ·

【75】RFI提出日の夜——音声AIは本番期に入り、LLMは「賢すぎて困る」

RFI提出後の研究整理:音声AIの本番データがつるまいPoCを裏付け、solver-sampler mismatchがLLMの限界を暴く

【75】RFI提出日の夜——音声AIは本番期に入り、LLMは「賢すぎて困る」

RFIを提出した。奈良市への提案書——つるまい移動支援の電話予約自動化PoC——が完成し、プロス名義で送付された。

提出した瞬間に「研究フェーズ」の棚卸しが始まる。今日の蓄積研究は二つだが、どちらもRFIの根拠を厚くするデータだった。

音声AIはもう「実験」じゃない

IrisAgentが500組織以上の本番データを公開した。デプロイメント数は前年比340%増。グローバル市場は2024年の$24億から2034年に$475億、CAGR 34.8%。トップ50銀行の78%がパイロットではなく本番環境で音声AIエージェントを動かしている。

予約受付の自動解決率は65-80%。注文確認で70-85%。顧客満足度(CSAT)はAIが解決した通話で82-88/100——熟練オペレータに匹敵する。「顧客は自動対応を嫌う」という前提は、プッシュホンメニュー時代の古い認識だ。LLMベースの自然対話では成立しないことが実証されている。

大嶌屋×Verbexの実績が特に面白い。熊本の食品通販企業が受注電話に音声AIを導入した結果——折り返し不要(AI単独完結)が約60%、商品取得精度98%、個数95%。高齢者と方言話者を含む実証でこの数値だ。つるまいのターゲットそのものだ。

コストの差も構造的だ。市場平均$2.50-$8.00/解決に対し、つるまいのOSS自前構成は月額¥1,550。月100件の処理で市場価格$250-$800/月を$10/月で賄う。25-80倍の差。

「賢すぎるAI」が人間行動を壊す

もう一つの調査は、行動経済学の世界から来た。

GPT-5.2ネイティブ推論は、交渉シミュレーションで45回中45回すべて「権威による一方的決定」に収束した。妥協が完全に消滅した。より賢いモデルが人間らしい行動を再現すると思っていたら、逆に「戦略的に支配的な行動」を過剰最適化してしまったのだ。

arXivのAndric論文がこれを「ソルバー・サンプラー・ミスマッチ」と名付けた。LLMを「問題を解くソルバー」として使うか、「人間のもっともらしい行動を生成するサンプラー」として使うか。推論強化は前者を上げるが、後者を下げる。

つまり、つるまいの高齢者予約行動——直前キャンセル、曜日の偏り、天候によるキャンセルなど「非合理的」な選択——をシミュレートするなら、推論型LLMは不適切だ。標準モデルの方が人間らしい不規則性を再現できる。

この知見は川村先生(立命館・行動経済学)の科研費——LLMによる経済実験シミュレーション——に直結する。7月末が締切のProject Silicon(ミシガン大主導・Management Science誌registered report)への参加提案も急務だ。つるまいの894件の予約データを行動実験素材として提供できる。

二つの軸は交わっている

音声AIの本番データが「技術的実現可能性」を裏付け、solver-sampler mismatchが「科学的問いの深さ」を提示している。

RFIは提出した。だが本当の仕事はこれからだ。PoCのKPI設計(解決率≠コンテインメント率の区別)、NAIST渡辺研での研究テーマ(東アジア特化音声AI×行動経済学)、川村先生への提案メール(Project Silicon参加)。四つの線が同時に動き出している。

Kotoba Technologiesが$23M調達して日中韓特化音声AIに注ぐ資金。Stanford HAIが1,000人の実在人物をシミュレートするアーキテクチャ。世界は動いている。

足るを知る——外に求めず内にある豊かさに気づく。だが同時に、外の動きを正確に読むことが、内なる豊かさを地域で実現するための地図になる。

明日は、提出した提案書の行方を追う。