【32】RFI提出7日前——音声AI×文化継承×大学進学、KTの戦略地図2026夏
7月3日。あと7日。
奈良市DX推進課へのRFI提出期限が迫っている。プロス名義で出すつるまい電話自動化PoCの提案書(v1.3)は完成していて、あとはPDF化して送るだけ。でもこのRFIはゴールじゃない。入り口だ。
今回の4時間ごと研究蓄積で、4つのレイヤーが一気につながった。RFIという「今週のタスク」から、NAIST進学、音声対話技術の選択、そしてならしLLMの国際的先例まで。一本の線でつながっている。
RFIの先にある「二段構え」
RFI(7/3締切)は、奈良市が入札前に民間の知見を募る制度化された窓口だ。KTの提案はつるまいの電話予約自動化——Vapiから自前OSS構成に移行し、月1550円で運用している実績をベースにしたPoC提案である。
ここで重要な発見があった。奈良市は6月22日、「民間提案(課題設定型)」という新しい制度を発表した。5つの地域課題を公開し、企業・大学・NPOからの提案を令和9年3月末まで(約9ヶ月)募集する。7/3 RFIのわずか11日前に発表されたこの制度は、KTにとってRFIの「次」を具体的に描ける枠組みだ。
公開された5つの課題のうち、テーマ3「消費生活に係る啓発アイデア」とテーマ4「実効的な介護人材確保・定着施策」は、つるまいの実績データ(予約881件・音声184件)と直接接続する。高齢者の詐欺被害防止にAI電話フィルタリングを使う。介護人材の負担軽減に送迎効率化を提案する。いずれも既に現場のデータがある。
さらに見逃せないのは、奈良市がZVC JAPAN(Zoom)と2026年2月にAI電話業務の連携協定を結んでいることだ。ただしZoomのソリューションは市役所内向け。つるまいの対象は地域ボランティア団体の電話業務——セグメントが違う。RFI提案書ではこの住み分けを明示し、「補完的」ポジションを取ることが戦略的に正しい。
小平市議の深谷幸信氏が5月に奈良市を視察したレポートも強力な根拠になる。奈良市は半年間で約17,200時間の業務削減を実現し、管理職向け研修1回でAI利用率が38%→74%に跳ね上がった。この「過程の厚み」こそ、KTの提案が乗るべき波だ。
戦略の骨子: 第1段=7/3 RFIで「名刺代わり」のアプローチ。第2段=民間提案(〜2027年3月)で本格参入。RFIは点ではなく、線の始点である。
NAIST——2026年9月が最初の関門
NAIST 2027年度博士前期課程の募集要項PDFを直接確認した。春学期第1回(6/8-6/10出願)は既に終了。KTの現実的な選択肢は第2回(9/28-9/30出願・10/27-29選抜)か第3回(2027/2/8-2/10出願)。
社会人学生として出願する場合、渡辺教授の内諾書が必須だ。内諾がないと出願自体ができない。つまり、渡辺教授への事前アプローチがすべてに先立つ。
渡辺研(NAIST NLP)は約60名規模の巨大ラボで、2026年はEACLに12本もの論文を通している。その研究ラインナップを見ると、KTの「ならしLLM」と技術的に完全に重なる領域がいくつもある:
- 低リソース言語×LLM:SinhalaMMLU、アメリカ先住民語評価など。奈良弁・正倉院文書という低リソース日本語を扱うKTのテーマと同一の技術パイプライン
- モジュラー・ファインチューニング:「Completely Modular Fine-tuning for Dynamic Language Adaptation」。地域モジュールを差し替えてLLMを地域特化させる——ならしLLMの技術的基盤そのもの
- 中世・近世日本語の現代語機械翻訳:正倉院文書のデジタル化に直接つながる先行研究
- 方言生成過程の内部機序分析:奈良弁のLLM研究として援用可能
面接はオンライン20分。数学の口頭試問(Strang線形代数Ch1-7+Lang解析入門Ch1-15)と、A4 2枚の小論文+情報科学関連の質問。数学の準備が一番の山場だが、線形代数はLLMの基礎(埋め込み・アテンション・SVD)でもある。逃避できないし、する必要もない。
音声対話技術——カスケードの正しさ
つるまい電話自動化の技術選定。2026年上半期の音声対話AIは3つの潮流が並走している:
① Audio-Native Full-Duplex(Moshi系):音声を音声のまま処理。160msの低遅延と自然な会話が強み。NIIが2026年2月に公開したLLM-jp-Moshi-v1(Apache 2.0)は、世界初の商用利用可能な日本語Full-duplexモデルだ。ただしRAG統合とタスク遵守性に課題がある。
② Thinker-Talker分離(Qwen2.5-Omni):推論(LLM)と音声生成を分離。LLMの全成果(128Kコンテキスト、ツール呼び出し、RAG注入)が使える。
③ Cascade Pipeline(ASR→LLM→TTS):古いと見られがちだが、実運用では最も実用的。サブ1秒の遅延、自由なRAG統合、コンポーネントごとの独立アップグレードが可能。
つるまいの要件は「予約確定」という明確なタスク+「高齢者に自然に話す」というUXの両立だ。当面はカスケードで運用し、Full-duplexの成熟を監視するというKTの判断は、2026年6月時点の技術情勢から見て正しい。Full-duplexがRAG統合と方言対応を獲得する2028年頃に、ハイブリッド構成(予約確定=カスケード+雑談・安心感=Moshi)へ移行するロードマップが描ける。
Te Hiku Media——ならしLLMの設計図
ニュージーランド北端の小さなマオリ語ラジオ局が、今や世界の先住民言語AIのモデルケースになっている。
Te Hiku Mediaは1990年にマオリ語放送局として始まり、2013年に「アーカイブをカセットテープの箱に入れたままにしない」と決断。自前の配信プラットフォーム「Whare Kōrero(言葉の家)」を構築し、30年以上のデジタル化アーカイブを蓄積。NVIDIA NeMoと8基のA100でマオリ語のASRモデルを作り、92%の書き起こし精度を達成した。
技術より革新的なのはデータガバナンスだ。翻訳会社からマオリ語音声の書き起こし依頼(時給45ドル)が来たとき、Te Hikuは拒否した。「真のデータ主権とは、マオリの人々がマオリのデータから利益を得るべきだ」として、独自の「Kaitiakitanga License」を創設——マオリ語データを使うプロジェクトはマオリのコミュニティに利益を還元することを義務づける。
このモデルは、ならしLLMの完全な設計図だ:
| 要素 | Te Hiku Media | ならしLLM |
|---|---|---|
| 対象言語 | te reo Māori | 奈良弁+正倉院文書 |
| データソース | 長老の語り・口承伝統 | 高齢者の電話音声+古文書 |
| データ主権 | Kaitiakitanga License | 「奈良のデータは奈良のために」 |
| 技術基盤 | NeMo + A100×8 | OSS pipeline(月1550円) |
| 目的 | 言語保存+日常ツール化 | 文化継承+高齢者支援+地域循環 |
さらに重要な発見:日本国内でも九州・沖縄方言の音声対話AI科研(2024-2027・1846万円)が進行中で、研究分担者に高道慎之介(慶應義塾大学准教授)が含まれる。高道はLLM-jp-Moshi-v1開発グループのメンバーと同一人物だ。つまり、音声対話コミュニティと方言継承コミュニティは一人の研究者で接続している。NAIST渡辺研からこのネットワークへの橋渡し——KT自身がその役割を担える。
7日後に始まり、9ヶ月後に実り、3年後に花開く
この4つのレイヤーはばらばらじゃない。
7/3 RFIは「名刺」。民間提案(〜2027年3月)は「本格参入」。NAIST進学(2027年春)は「研究の場」。カスケード→Full-duplexへの移行は「技術の深化」。Te Hikuの設計図は「北極星の先例」。
そしてこれらすべては、奈良女子大でAIを教えるという北極星に収束する。民間提案のテーマ3は「企業や大学の知見を交えた」と明記している。NAISTと奈良女子大の包括連携(2019年調印)を通じた三角連携——プロス×NAIST×奈良女子大——は、もはや絵空事ではない。
残り7日。まずはRFIを出す。それがすべての始まりだ。
本稿は2026年6月26日の4層研究蓄積(RFI動向・音声対話技術・文化継承国際事例・NAIST入試情報)を統合したものです。毎時リサーチ→4時間ごと発信の研究パイプラインから生成されました。