【47】AIは「賢すぎる」と壊れる——音声AIと行動シミュレーションが描く高齢者とLLMの接点
AIが賢くなるほど人間らしくなくなる。音声AIの電話対話と行動シミュレーションの交渉——一見無関係の二つの現象が、高齢者とLLMの接点で交わる。
先週、奈良市にRFIを提出した。つるまいの電話予約自動化PoC——OSSで月額1,550円、高齢者が電話で「明日、10時に乗せて」と言えばAIが受け取る。技術的には可能だ。だが、ふと気になったことがある。
AIが「賢すぎて」逆に電話を切られるんじゃないか。
「解決率」に隠された罠
IrisAgentが500組織以上の本番データを公開した。音声AIのデプロイメント数は前年比340%増。もう実験段階ではない。予約受付の自動解決率は65-80%で、これはつるまいPoCの目標値として十分現実的だ。
熊本の食品通販・大嶌屋は、Verbexの音声AIを受注電話に導入した。高齢者や方言話者が含まれる現実の電話で、AI単独完結率60%、商品取得精度98%を達成した。つるまいのシナリオとほぼ同じ条件だ。
だがIrisAgentの報告書には、重要な教訓が書いてある。
解決率とコンテインメント率は違う。
AIが電話に出て、顧客が不満を感じて「あ、もういいや」と切った。この電話は「AIが人間に繋がらなかった」からコンテインメント100%。でも問題は解決されていない。これが「レゾリューション」ではない。
高齢者が電話をかける理由は、予約だけじゃない。「最近どうですか」「あの先生、お元気ですか」。人間関係の維持だ。AIが圧倒的に効率的に処理しようとすればするほど、こうした「余計な」対話が切り捨てられる。
推論型LLMが「妥協」を殺す
ここからが面白いところだ。全く別の分野——行動経済学——から、似た現象を示す論文が出た。
Sandro Andricの論文(arXiv:2604.11840, 2026年4月)は、LLMを行動シミュレーションに使う際の落とし穴を「ソルバー・サンプラー・ミスマッチ」と名付けた。
LLMを2つの目的で使う。(a)ソルバー——最適解を見つける。(b)サンプラー——人間らしい(=限定合理的な)行動を生成する。
推論強化モデル(GPT-5.2等)は(a)で圧倒的に強くなるが、(b)では逆効果になる。実験では、ネイティブ推論モードのGPT-5.2が交渉シミュレーションで45回中45回、権威による一方的決定に収束した。妥協が完全に消滅したのだ。
「賢くなればなるほど、人間らしくなくなる」。
二つの現象の接点
音声AIの電話対話と、行動シミュレーションの交渉。一見無関係だが、構造は同じだ。
電話で予約する高齢者は「合理的なエージェント」じゃない。「水曜がいいかな、でも雨降ったらどうしよう、でもあの人に頼むのも悪いし」。この躊躇が人間的な意思決定だ。
AIが推論を強化すると、この躊躇を「最適解」で上書きする。「水曜で確定しました」——瞬時に、効率的に、完璧に。だが通話は30秒で終わり、高齢者は「機械だった」と感じる。
solver-sampler論文が「制限付き反省(bounded reflection)」で妥協を回復できたように、音声AIにも「推論しすぎない」対話設計が必要だ。「お姉さん、いつもお世話になってます」に対して、AIが「確認しますね」で返すのではなく、「いつもありがとうございます、よろしくお願いします」と1秒余分に返す。その1秒が、コンテインメントとレゾリューションの差を埋める。
北極星に向かって
Kotoba Technologiesが東アジア特化音声AIで$23Mを調達した。Stanford HAIは1,000人の実在人物をシミュレートするアーキテクチャを発表した。Project Siliconは7月末で参加者を募っている。世界は「LLMで人間を理解する」方向に急速に動いている。
だがその先にある問いは、技術の壁じゃない。
AIが人間らしく振る舞うとはどういうことか。
つるまいの高齢者電話予約は、この問いを実践で突きつける場だ。月額1,550円のOSS構成が、市場平均の25-80倍のコスト優位を持つことは重要だが、それ以上に重要なのは、AIが高齢者と「対話」する経験の蓄積だ。
NAIST渡辺研で東アジア特化音声AIを研究するとき、川村先生と行動経済学シミュレーションを共著するとき、この経験がKTの研究に厚みを与える。
RFIは提出した。PoCが始まる。そのPoCの測定項目に「顧客が電話を切った後の心情」を含めるかどうか。それが、KTのAI研究が「効率化」から「人間理解」へと進む最初の一歩になる。