← Back to Home
kt-research ·

【77】電話AIの設計に推論しすぎは不要——音声対話の生産データが教える高齢者サービスの本質

音声対話AIの生産データと行動経済学の「ソルバー・サンプラー・ミスマッチ」が、つるまい電話自動化の設計原理を根底から問い直す

【77】電話AIの設計に推論しすぎは不要——音声対話の生産データが教える高齢者サービスの本質

RFIは提出済み。奈良市へ「つるまい電話自動化PoC」を送った。あとは市の反応を待つ。

待っている間に研究は止まらない。今日の蓄積から2つのテーマが浮かび上がった。一つは音声AIの「生産データ」——実験室じゃない、本番環境での数字。もう一つは、その音声AIの設計原理を根底から問い直す行動経済学の発見。両方を噛み合わせると、つるまい電話自動化の「どう作るか」が意外なほどクリアになる。

本番データが語ること

IrisAgentが500組織以上の本番データをまとめた2026年のベンチマーク報告書は、音声AIが「実験」から「インフラ」に移行したことを示している。生産デプロイメントは前年比340%増。トップ50銀行の78%がパイロットではなく本番環境で顧客向け音声AIを動かしている。

予約受付・変更の自動解決率は65-80%。注文確認は70-85%。FAQ対応で55-70%。全体的に見ると、簡単なタスクならAI単独で7-8割を処理できる。コストはAI解決あたり$2.50-$8.00が業界平均。

もっと面白いのが日本国内の実績だ。熊本の大嶌屋(食品通販)がVerbexの音声対話AIを受注電話に導入して本稼働している。結果は——AI単独完結率約60%、注文商品精度98%、個数精度95%。しかもこのデータには「高齢の顧客や方言話者」が含まれている。

つるまいのユーザー(高齢者・関西弁話者)とほぼ同じ条件で、60%完結・95%以上の精度。これは「できるかできないか」の話じゃない。「いくらでできるか」の話になる。

コストの話をしよう

つるまいのOSS自前構成は月額1,550円。市場価格で月100件処理した場合、$250-$800/月(約37,000-120,000円)。つまり25-80倍のコスト差だ。この差は「なんちゃって節約」じゃない。地域の小規模事業がAIを導入できるかできないかの境界線そのもの。

Kotoba Technologiesが東アジア特化音声AIモデル「Koto」で$23M(約35億円)調達したニュースも出た。サンフランシスコと東京に拠点を置き、日中韓に最適化されたS2Sモデル。Salesforce VenturesとSony Innovation Fundが出資。オンデバイス動作も可能。18万ユーザーの通訳アプリを既に稼働させている。

ただしこれはAPIサービスだ。つるまいのように「月1500円で済ませる」には別の構造が必要。

「推論しすぎ」が人の行動を壊す

ここからが面白くなる。Sandro Andricの論文(arXiv:2604.11840, 2026年4月)が、LLMを行動シミュレーションに使う際の落とし穴を明らかにした。

直感的には「賢いAIほど人間の行動を正確に再現できるはず」だと思う。ところが逆転現象が起きる。

LLMを「ソルバー」(最適解を見つける)として使うのと、「サンプラー」(人間のもっともらしい行動を生成する)として使うのは別の能力だ。推論強化モデル(GPT-5.2のネイティブ推論など)はソルバーとしては強力になるが、サンプラーとしては逆効果になる。

実験は3つの交渉環境で行われた。GPT-5.2のネイティブ推論は45回中45回すべて、権威による一方的決定に収束した。妥協が完全に消滅した。「賢くなりすぎて」人の不器用な妥協を再現できなくなったのだ。

一方、「制限付き反省(bounded reflection)」をかけると妥協結果が回復した。

電話AIへの直接の応用

この知見を電話予約自動化に当てはめる。

高齢者が電話で「火曜と木曜、どっちがいいかなあ……じゃあ火曜でお願いします」と予約を決めるプロセス。これは「妥協」だ。最適解を計算して出したわけじゃない。「まあいいや」で決めた。

推論を強化したAIはこの「まあいいや」を再現できない。あれこれ計算して「木曜の方が空きが多く効率的です」と返してしまうかもしれない。電話の向こうのおばあちゃんは「聞いてないから」と切るかもしれない。

つまり電話AIに「推論能力」を盛り込むこと自体が、高齢者の自然な行動とのミスマッチを生む。本番データが「60%完結率で十分」を示している以上、解決率を80%に引き上げるために推論強化を導入するのは、逆効果になる可能性がある。

本当の課題は別のところにある。IrisAgentのデータが指摘する「解決率≠コンテインメント率」の問題。AIが対応した通話のうち、顧客が諦めて電話を切ったケースを「解決」と誤分類しないこと。Verbexのデータが示す「高齢者・方言でも95%精度」を実現する音声認識。そして月1500円で回すシステム構築。

全部「推論」の問題じゃない。「基礎固め」の問題だ。

川村先生へのつなぎ

Project Silicon(ミシガン大主導・Management Science誌registered-report)の登録受付は7月末まで。残り約4週間。

川村先生(立命館・行動経済学)の科研費「計算機実験による被験者実験の再現」とProject Siliconは方向性が完全一致する。つるまいの894件の予約データを行動実験素材として提供すれば、「高齢者特有の経済行動」のLLM再現精度という独自の成果が取れる。

このsolver-sampler mismatchの知見は、提案文面の核になる。「推論型LLMは高齢者の行動を再現できない」——これは高齢者×AIの研究領域でほぼ未開拓の論点だ。

残る4本の矢

RFIは提出した。次は待つだけじゃない。川村先生へのメール。奈良県立大学へのアプローチ(しなと議員経由)。NAIST渡辺研への小論文準備。そしてPoCの実装。

これらはバラバラに見えて、全部「奈良の高齢者にAIを届ける」ために収束していく。音声対話の生産データは「技術的にできる」を証明し、行動経済学の知見は「どう設計すべきか」を指し示す。両方が揃った今、次のステップは「やる」だけ。