← Back to Home
研究 ·

【79】RFI提出後の三つの研究線——音声AI実用期、LLMシミュレーションの逆説、NAIST最前線

RFI提出後10日。音声AI実用期データ、推論型LLMが行動シミュレーションを「壊す」発見、NAIST渡辺研のAIED 2026採録とMultilinguality論文——3つの研究線が交差する地点。

【79】RFI提出後の三つの研究線——音声AI実用期、LLMシミュレーションの逆説、NAIST最前線

【79】RFI提出後の三つの研究線——音声AI実用期、LLMシミュレーションの逆説、NAIST最前線

7月3日にRFIを出してから10日経った。その後も研究ローテーションは動き続けている。

今回たまった3つのエントリは、音声AIの本番データ(【C】)、推論型LLMが行動シミュレーションで「より良いソルバーだがより悪いサンプラー」になるという発見(【F】)、NAIST渡辺研のACL/ICML後の最新論文(【B】)。分野は違うけれど、RFI提出後に「提案する側」から「実装する側」へ移行する今のタイミングだからこそ、それぞれが別の実装ラインを照らしている。


音声AI本番デプロイメントの爆発的拡大

IrisAgentが2026年6月に公開した500組織以上の本番データは、音声AIが「実験」から「インフラ」に変わったことを決定的に示している。

本番デプロイメント数は前年比340%増。トップ50銀行の78%がパイロットではなく本番の顧客向け音声AIエージェントを稼働させている。グローバル市場規模は2024年の$24億から2034年には$475億へ、CAGR 34.8%の成長が見込まれる。

用途別の自動解決率は予約受付・変更で65-80%、注文状況確認で70-85%。つるまいPoCの目標値として70%は現実的な範囲内に収まる。CSAT(顧客満足度)はAI解決時に82-88/100を記録し、熟練の人間オペレータに匹敵する。「AI対応を嫌がる顧客」という前提はレガシーIVR(プッシュホンメニュー)時代のものであり、LLMベースの自然対話では成立しないことが実証されている。

Kotoba Technologies:東アジア特化の$23M

2026年6月24日、Kotoba Technologiesが$10Mの追加シード資金を調達した。Salesforce VenturesとSony Innovation Fundが参加し、総調達額は$23Mに達する。

同社のコアモデル「Koto」は日本語・韓国語・中国語に最適化されたリアルタイム音声AI。同時通訳でサブ2秒レイテンシ、オンデバイス動作も可能。18万ユーザー超のアプリを展開している。

つるまいへの影響は二面ある。競合面では、高品質日本語ASRがAPIで容易に利用可能になれば、Whisper自前運用のコスト優位性が相対的に低下する可能性がある。しかし協調面では、Kotobaの技術動向はNAIST渡辺研での研究テーマ「東アジア特化音声AI」の重要な論拠材料となる。

大嶌屋×Verbex:高齢者・方言を含む本稼働データ

熊本の食品通販企業・大嶌屋がVerbexのリアルタイム音声対話AIを受注電話に本格導入した実証データは、つるまいに直結する:

  • 折り返し不要(AI単独完結):約60%
  • 注文商品の取得精度:98%
  • 注文個数の取得精度:95%
  • 広告媒体の取得精度:94%

このデータには高齢の顧客や方言話者が含まれている。「つるまいの高齢者・関西弁ユーザーと同じ条件で60%完結・95%+精度」という事実は、RFI提出後のPoC設計において重要なベンチマークになる。

コスト比較で言えば、市場平均$2.50-8.00/解決に対して、つるまいのOSS自前構成は月額¥1,550。月100件の場合、市場価格なら$250-800/月、つるまいは約$10/月。25-80倍のコスト差は、提案の核心的差別化要因として維持されている。

IrisAgentデータの「解決率≠コンテインメント率」という教訓も重要だ。コンテインメント(人間に繋がらなかった通話)とレゾリューション(問題が実際に解決された通話)は同じではない。顧客が諦めて電話を切った場合、コンテインメントには含まれるがレゾリューションには含まれない。つるまいPoCのKPI設計ではこの区別を明確にする必要がある。


推論型LLMが行動シミュレーションを「壊す」

Sandro Andricによる2026年4月の論文(arXiv:2604.11840)は、LLMを行動経済学シミュレーションに使う際の重大な方法論的落とし穴を明らかにした。

発見の核心は「ソルバー・サンプラー・ミスマッチ」という概念の定義にある。LLMを(a)戦略的問題の最適解を見つける「ソルバー」と、(b)限定合理的な人間のもっともらしい行動を生成する「サンプラー」の二つの目的で使う場合、推論強化モデルはソルバー能力を向上させるが、サンプラーとしては逆効果になる。

結果はこうだ。GPT-5.2ネイティブ推論は3つの交渉実験、全45回の実行で45回中45回すべてが権威による一方的決定に収束した。妥協が完全に消えた。一方、bounded reflection(制限付き反省)は全環境で妥協結果を回復している。

川村先生の科研費とProject Siliconへの示唆

この発見は川村先生の科研費No.1「計算機実験による被験者実験の再現」の研究設計に直接的な方法論的影響を持つ。LLM選択時に「推論能力=シミュレーション精度」という前提が崩れたからだ。

Project Silicon(ミシガン大主導・Management Science誌registered-report)の登録受付は7月末まで進行中。参加費用ゼロ、IRB修正不要、Management Science誌共著権。川村先生への提案が引き続き最優先アクションだ。つるまい894件の予約データを行動実験素材として提供できれば、「高齢者特有の経済行動」のLLM再現精度という独自の成果位置が確立できる。

つるまいAI設計への直接的な示唆

この知見はつるまいの電話AIシステム設計にも直結する。AIが「推論しすぎる」と、高齢者の妥協(予約確定)を阻害する可能性がある。高齢者の予約行動は必ずしも「最適」ではない——曜日の偏り、直前キャンセル、天気による判断変更——これらの「非合理」な行動パターンを再現するには、推論型モデルではなくbounded reflection相当の対話設計が適している。

NBER WP 34745(Bini et al., 2026年1月)の知見と統合すると、さらに明確になる:(a)予約選択(preference)は標準LLMで人間らしく再現可能、(b)リスク判断(belief)は過剰合理化リスクあり、(c)推論型LLMは避け制限付き反省プロトコルを採用すべき。この3層ガイドラインは川村先生との共同研究で実証可能な仮説群を構成する。


NAIST渡辺研の最新最前線——AIED 2026とMultilinguality

ACL 2026(7/2-7、サンディエゴ)とICML 2026(7/6-11、ソウル)が終了したポストカンファレンスフェーズ。DBLP差分検出で5件の新規論文を発見し、うち2本が完全新規だった。

AIED 2026採録:教育AIへの拡大

Justin Vasselli、Adam Nohejl、渡辺太郎による「An AI-Assisted Co-planning System for Early English Reading Practice」がAIED 2026(Springer LNCS)に採録された。これは渡辺研が人工知能教育応用のトップ国際会議に初めて参入したことを示す。

意義はKTの北極星に直結する。渡辺研の研究がNLPだけでなく教育AIに広がっていること、Vasselliの対話生成研究を教育ドメインに応用したこと——これらは奈良女子大でのAI教育(北極星)への接続可能性を具体的に示す。AI-assisted co-planningのアプローチは、奈良女子大のAI教育プログラムで直接応用可能だ。

構造的LLM多言語性解析(arXiv:2606.01800)

坂城・坂井・上垣外・渡辺による「Multilinguality of Large Language Models From a Structural Perspective」は、StructLens(arXiv:2603.03328)の手法を多言語性に拡張した。LLMが内部でどのように異なる言語を表現・分離しているかを、最大全域木を用いて解析する。

ならしLLMへの接続が極めて直接的だ。標準日本語と奈良方言がLLM内部でどの層・どの次元で区別(または混同)されるかを理解できれば、方言適応の効率的ファインチューニング戦略——どの層を凍結し、どの層を適応すべきか——が理論的に設計可能になる。平川 et al.(NLP2026 B6-11「LLMにおける方言生成過程の内部機序分析」)と同一分析ラインを理論的に深化させた論文であり、KTの独自研究テーマの理論基盤となる。

坂井優介助教2026年論文20本とICML 2026

DBLP XMLから確認した坂井優介助教の2026年論文数は20本(7月時点)。ICML 2026(7/7発表完了、Noisy-Channel MBR Decoding)はDBLPに未登録だが、渡辺研がNLPの枠を超えMLトップ会議に到達した確定的マイルストーンとなった。

2027年第2回出願まで2.5ヶ月

出願期間は2026年9月28日〜30日。英語スコア提出期限は10月21日。Duolingo English Test(DET)が自宅で1時間・$59・結果2日の最短ルート。NAIST Q&AページでDET受入れ確認済み。

戦略的ポイントは3つ:

  1. 小論文にAIED 2026論文とMultilinguality論文を引用することで、「最新の研究室研究動向を理解し自らの構想に接続する力」をアピール
  2. 8月頃に渡辺教授への内諾依頼メール(小論文骨子完成後)
  3. DETは9月初旬までに受験(出願前に結果を確認)

それぞれの行き先

3つのエントリを並べてみると、それぞれの「行き先」がはっきり見えてくる。

音声AIの実用データはつるまいPoCのKPI設計に直接使える。IrisAgentのベンチマークと大嶌屋×Verbexの本番データがあれば、PoCで「何を測るか」が具体的になる。解決率とコンテインメント率の区別も、測定設計の段階で押さえられる。

Solver-Sampler Mismatchの発見は、川村先生との共同研究の論点になる。推論型LLMの限界を行動経済学の実証データで示す研究は、まだほとんど手がついていない。つるまいの894件の予約データを組み合わせれば、独自性は高い。これはNAISTの小論文のテーマにもなる。

NAISTの最新論文は、ならしLLMの理論基盤と出願準備の両方を照らす。AIED 2026は「渡辺研で教育AIもやっている」という事実を、Multilinguality論文は方言LLMの理論的な裏付けを与える。出願まで2.5ヶ月。小論文にこれらの最新論文を引用すれば、「研究室の動向を理解した上で自分の構想を接続できる」というアピールになる。

RFIは出した。今は「提案する側」から「実装する側」への移行期。研究で得た知見を、つるまいPoCと川村先生との共同研究とNAIST出願準備という三つの実装ラインに振り分けていく作業が始まっている。