【78】RFI提出後の二つの研究戦線——音声AIの生産データとLLMの推論しすぎ問題
RFI提出後も動き続ける2つの研究線。音声AIの本番データとsolver-sampler mismatchがNAIST研究で交わる。
title: “【78】RFI提出後の二つの研究戦線——音声AIの生産データとLLMの「推論しすぎ」問題” date: 2026-07-04 slug: “78-rfi-after-two-research-fronts” category: “研究” tags: [“音声AI”,“行動経済学”,“NAIST”,“RFI”,“つるまい”,“solver-sampler”,“奈良”] excerpt: “RFI提出後も動き続ける2つの研究線。音声AIの本番データとLLM×行動経済学のsolver-sampler mismatchがNAIST研究で交わる。”
奈良市にRFIを提出した翌日、夜の奈良にいて思うことがある。提案書に書いたのはつるまい電話自動化のPoC計画だが、実はそれが端を発して動き始している線は少なくとも2本ある。
1本は音声AIの現場データ。もう1本はLLMと行動経済学の交差点。一見すると無関係に見えるが、NAIST渡辺太郎研での研究という磁場で見ると、両方はっきりと重なる。
音声AI:パイロット期は終わった
IrisAgentが500組織以上の本番データをまとめたベンチマークは、個人的にかなり衝撃だった。前年比340%増のデプロイメント。トップ50銀行の78%が「パイロットではなく」本番稼働。グローバル市場は2024年の$24億から2034年に$475億。CAGR 34.8%。
数字だけなら「市場成長」のたわごとにすぎないが、用途別の解決率データが実務的に重い。
- 予約受付・変更:65-80%
- 注文状況確認:70-85%
- FAQ・ポリシー質問:55-70%
つるまいPoCでターゲットにしている電話予約は、まさに65-80%のレンジにある。IrisAgentはコールセンター系で、つるまいは地域の移動支援。ユーザー層が違う。それでも「電話で自然に話して予約を完了させる」の成功率が6〜8割という実測値がある。
大嶌屋(熊本の食品通販)×Verbexの事例がさらに決定的だ。高齢の顧客や方言話者を含む電話注文で、AI完結率60%、商品精度98%、個数精度95%。つるまいのユーザー層(奈良の高齢者・関西弁)と条件がほぼ同じで、これだけの精度が出ている。
VerbexはAPIベースのプロプライエタリでコストは企業向け。つるまいはOSS自前で月額¥1,550。市場平均が解決あたり$2.50〜8.00だとすれば、月100件でも市場価格$250〜800 vs つるまい$10。このコスト差は提案書で書いた「地域モデル」の実質的な裏付けになる。
もう一つ、Kotoba Technologiesの動きも気になっている。$23M総調達。Salesforce VenturesとSony Innovation Fundが参加する日本語・韓国語・中国語特化の音声AIだ。東アジア市場に特化したS2Sモデルで、オンデバイス展開も可能。NAIST渡辺研で「東アジア特化音声AI」を研究テーマにするなら、この動向は避けて通れない。
LLMは「推論しすぎ」と壊れる
もう一方の線は、川村哲也先生(立命館・行動経済学)との接続で浮かび上がった「solver-sampler mismatch」問題。
直感的には「賢いLLMほど人間の行動を正確にシミュレートできるはず」だが、arXiv:2604.11840(Andric, 2026年4月)はこれが逆転する条件を実証している。
LLMを2つの目的で使うとき、(a)ソルバー(最適解を見つける)と(b)サンプラー(限定合理的な人間の行動を生成する)では、求められる能力が違う。推論強化モデル(GPT-5.2ネイティブ推論など)は(a)では強くなるが、(b)では逆効果になる。
実験結果が劇的すぎて笑える。3つの交渉実験、45回全ての実行で、ネイティブ推論モデルが45回中45回「権威による一方的決定」に収束。妥協が完全に消滅した。交渉というのは本来「そこそこ妥協して合意する」人間の行動だが、推論を強化すると、AIは「最適解=支配的決定」に収まる。
つまり、人間の「非合理的な行動」を正確に再現するには、「賢すぎない」モデルが必要になる。この知見は川村先生の科研費「計算機実験による被験者実験の再現」と直接関わる。LLMで人間の行動をシミュレートするとき、「モデルが賢ければ賢いほど精度が上がる」という前提が崩れたのだ。
Project Silicon(ミシガン大主導)の登録締切は7月末まで。参加は無料、IRB修正不要。Management Science誌のregistered-report形式。つるまいの894件の予約データを行動実験素材として使えば、「高齢者特有の経済行動」のLLM再現精度という、世界に類を見ないデータセットが成立する。
Stanford HAIも1,000人以上の実在人物の行動をLLMエージェントでシミュレートする研究を発表している。Hullman et al.が指摘した「高齢者等の過小代表集団ではLLM再現精度が著しく低下する」問題に対し、個人プロファイルを注入して精度を回復するアプローチ。つるまいユーザーの実際の予約パターンをペルソナにすれば、汎用LLMよりはるかに精度の高い行動予測ができる。
二つの戦線が交わる場所
音声AIの戦線とLLM×行動経済学の戦線は、NAIST渡辺太郎研という磁場で交わる。
渡辺研はNLP研究室。音声対話・言語理解・対話システムがコアテーマ。そこにKTが持ち込めるのは2つの資産:
第一に、つるまいの実運用データ。881件の予約に加えて、音声AI導入後の対話ログ。高齢者・関西弁話者という、世界のLLM研究でほぼ取り上げられていないユーザー層のデータだ。
第二に、行動経済学的視点。予約行動の曜日偏り、直前キャンセル、同じ経路を繰り返す選好。これらは「人間らしい非合理性」の事例であり、solver-sampler mismatchの(b)側で評価するのにちょうどいい素材。
RFIは提出した。次のフェーズは研究の深化だ。NAIST2027春入学まであと8ヶ月。川村先生への打診は7月中にやる。Kotoba Technologiesの技術動向は追跡し続ける。
奈良で起こっていることは小さくない。地域の高齢者の電話をAIが受ける。その対話ログが行動経済学の研究データになる。大学の研究室でそのデータがLLMの限界を測る実験に使われる。地域特化型AIが「ならしLLM」の研究素材になる。
この循環が動き出している。