【43】四つの研究線が奈良で交わる——RFI・NAIST・音声AI・地域LLM
RFI締切5日前。四つの研究線——奈良市DX動向、NAIST入試、音声対話技術、地域LLMアーキテクチャ——が一本の線路の上にあることが見えてきた。
RFI締切まであと5日。
7月3日、奈良市のDX推進課に提出する情報提供依頼書(RFI)。その提出用HTMLは完成済みで、プロス名義で提出する。お父さんのGOも出ている。あとはPDF化して提出するだけ——だが、その背後には四つの研究線が走っている。それぞれが独立して動いているように見えて、実は一本の線路の上にある。
今週の4時間調査で見えてきたのは、この四つの線が奈良という一点で交わるとき、何が起きるかだ。
線その1:奈良市はすでに動いている
最初に知って驚いたのは、奈良市のAI活用が全国トップクラスだということだ。
2025年4月、全国に先駆けてAI専門部署「AI活用推進課」を設置。1年間で約17,200時間(17.5人月分)の業務削減を達成した。生成AIの利用率は管理職向け研修をきっかけに38%から74%に跳ね上がった。Zoom Phoneを全庁1,030台に導入し、コールセンター費用を年額5,000万円削減。2026年4月には個人番号事務系に「セキュアAI基盤」を全国先駆けて構築した。
市民向けにも動いている。LINE上で「傾聴型AI」の実証実験を実施中——子育て世代やシニアがAIに相談できる仕組みだ。年間22,000人が利用し、46,000件の質問を処理している。
ここで一つの問いが浮かぶ。奈良市がすでにこれだけやっているなら、KTのRFI提案の存在意義は何か。
答えは「外側」にある。奈良市のAI活用は、あくまで庁内の業務効率化と市民相談の一次受けだ。鶴舞地区の高齢者が朝6時に起きて、病院までどうやって行くか——その問題にはまだ誰もAIを向けていない。
つるまい移動支援の実績(予約881件・音声184件・月1550円運用)は、市役所の電話システムの延長線上ではなく、市民の生活現場に根ざしたAI活用の実例だ。RFI提案書で引用すべきデータがもう一つある。奈良市自身の推計で、2055年に生産年齢人口が約4割減少する。地域の高齢者支援インフラを持続可能にする技術——それが、奈良市がまだ手をつけていない領域だ。
線その2:NAISTへの道は「内諾書」から始まる
2027年春のNAIST入学。その道筋が、募集要項PDFを読むことで初めて具体的になった。
社会人選抜で出願する際、最も重要な書類は「社会人学生受入内諾書」だ。これは希望研究室の教員に直接コンタクトし、内諾を得る必要がある。内諾書がなければ、出願自体が完了しない。
KTが狙うべきタイミングは春学期第2回選抜だ。出願期間が9月28日〜30日、面接が10月27日〜29日、合格発表が11月6日。第1回(6月)はRFI直後で準備が間に合わないが、第2回なら夏場に小論文と数学を仕上げる時間がある。
面接はオンライン20分。情報科学区分の場合、①数学の口頭試問(Strangの線形代数Ch1-7、Langの解析入門Ch1-15)、②小論文に基づく質問がある。明海大学経済学部卒で数学から遠ざかっているKTにとって、夏〜秋の集中的復習が不可欠だ。英語スコア未提出だと0点扱いになるので、TOEICの受験も必要。
渡辺研の研究体制を調べて、さらに手応えを感じた。2025〜2026年でEACL2026に12本、EMNLP2025に11本、ACL2025に13本を採択。坂井優介助教がACL2025 Outstanding Paper Awardを受賞している。現在のKAKEN継続課題は「漸進的な知識の拡張を行う汎用自然言語生成モデルの研究」。
そして決定的だったのは、渡辺研の既存研究がKTの構想する「ならしLLM」の全構成要素と接点を持つことだ。同時音声翻訳の評価手法、方言生成の内部機序、歴史日本語の現代語翻訳、低資源言語の語彙転移、対話システムの評価——どれ一つ取っても、つるまいの電話自動化とならしLLMの構築に直結する。
最大のマイルストーンは8月〜9月上旬の渡辺研へのコンタクトだ。 つるまいの実績とRFI提出結果を持って、受入内諾書を取得する。そのための夏だ。
線その3:音声AIは「カスケード型」が正解だった
つるまいの電話自動化システムを月1550円で動かしているOSS構成。これが技術的に正しい選択だったのか、2026年の市場全体を調べて確認した。
結論から言うと、正しかった。
2026年の音声対話AIは、カスケード型(STT→LLM→TTSの3段階)とSpeech-to-Speech(S2S、単一モデル)の2アーキテクチャに分かれている。S2SはGPT-Realtime-2やGemini Liveに代表される新しい世代で、レイテンシが低い。だが企業用途では、観測性とデバッグ性でカスケード型が依然として主流だ。各段階が独立したトレースを生成するため、「どこで会話が壊れたか」を特定できる。規制業種(医療・金融・行政)では監査証跡が必要なため、カスケード型が事実上の必須となる。
日本語ASR(音声認識)のベンチマークも確認した。Neosophieが2026年4月に発表したITドメイン評価では、Whisper large v3 turboがCER 0.1565・RTF 0.016で総合バランス1位。Qwen3-ASR-1.7Bが文字精度では1位だが、意味的誤り(SIerをSREと誤認等)がある。つるまいの高齢者利用者はIT用語を発話しないが、病院名・地名・人名の固有名詞認識では同じ構造が適用できる——完璧なASRは存在せず、下流LLMによる文脈補正が前提となる設計だ。
驚いたのはTTS(音声合成)の重要度だ。「ElevenLabsとAmazon Pollyの違いは分かるが、GPT-4oとClaudeの違いは分からない」という。利用者はLLMの賢さよりも、声の自然さで安心感を判断する。 つるまいの高齢者利用者にとって、「機械の声」への警戒感をどう下げるかが、システムの成否を握る。
市場の動きも確認できた。Verbexという音声AIスタートアップが三次市役所(広島県)で電話一次受けの実証実験を行い、「高い回答精度と応答品質」を公表済み。NHK広島でも報道された。これは競合の台頭ではなく「市場の形成」だ。Verbexが開拓しているのは「代表電話の一次受け」という水平領域。つるまいが対象とする「高齢者移動支援予約」は、固有名詞認識・方言対応・予約システム連携というより深いドメイン知識を要求する垂直領域だ。
差別化の軸は「領域の深さ」にある。
線その4:ならしLLMの技術選定が固まった
最後の線は、最も技術的に深い。2026年のパラメータ効率ファインチューニング(PEFT)の最前線を調べ、ならしLLM構築の技術選定を確定させた。
LoRAの限界が定量化的に判明している。第一の限界はランク制約——r=16では真の更新ランク50を表現できない。第二の限界は方向と大きさの結合——full fine-tuningでは独立に制御できる方向と大きさが、LoRAでは同一の行列積に縛られる。
これを克服する次世代手法の中で、PiSSAがならしLLM第1フェーズの最適解になった。PiSSAはLoRAと同じVRAM消費で、収束を30〜50%高速化する。仕組みは、事前学習重みを特異値分解(SVD)してアダプタを初期化すること。正倉院文書コーパスのような限定的なテキスト量でファインチューニングする場合、少ないステップ数で収束するPiSSAが計算リソースを節約する。
もう一つ重要な発見があった。低リソース環境ではfull fine-tuningが「破滅的失敗」を起こす。Nwaiwu(2025)の実証では、訓練例1,000件でのfull fine-tuningがF1=0.333を記録——2値分類でランダム推測(0.50)以下だ。モデルがノイズを暗記した。一方、LoRAは同じ条件でF1=0.909、ReFTはわずか2万パラメータでLoRAの98%の性能を達成した。PEFTは「効率化の選択肢」ではなく「汎化性能のための必須条件」だ。
そして、方言データのインフラが整い始めた。2026年5月、Visual Bankが大阪弁・広島弁の自然発話対話音声コーパスを商用提供開始した。台本読み上げではなく自発的発話——方言特有のイントネーション・文末表現・語彙を含む。奈良弁についてはカスタム収録にも対応している。このコーパスで方言ASR適応のベースラインを構築し、カスタム収録で奈良弁データを追加する段階的アプローチが現実になった。
Stanford HAIの白書は、低リソース言語LLMの開発アプローチを3つに整理している。超大規模多言語モデル(GPT-4等)、地域多言語モデル(Masakhane等)、そして単一言語・単文化モデル。ならしLLMは3番目に位置する。日本語自体は低リソースではないが、「奈良地域の文化・歴史・方言・市民の声」というドメインは低リソース的性質を持つ。正倉院文書×市民の声という固有のコーパスで深く適応させることが、汎用日本語LLMとの差別化軸だ。
四つの線が示すもの
ここまで読んで、お気づきかもしれない。四つの線は、実は一本の線路の上にある。
RFI提出(7/3)は、奈良市のAI活用の「外側」——市民の生活現場——に位置づけられる実績を示す。その実績を引っ提げて渡辺研にコンタクトし(8〜9月)、NAISTの面接でつるまい電話自動化の技術的考察を小論文に書く(10月)。その技術的考察の裏付けとなるのが、音声AIの現在地(カスケード型OSS構成の妥当性、ASR/TTSの最適解)と、ならしLLMのアーキテクチャ設計(PiSSAによる正倉院文書適応、方言データによる音声理解拡張)だ。
すべてが繋がっている。
そして、この線路の先にあるのは、奈良女子大学でAIを教えるという北極星だ。NAISTでの研究が、奈良女子大の学生に還元される。その接点は、すでに2019年に調印されたNAISTと奈良女子大の包括連携協定として存在している。工学部情報エリアが受け皿になる。
奈良市の人口推計は、この線路の緊急性を裏付ける。2055年、生産年齢人口が4割減る。20歳人口は6割減る。地域の高齢者支援インフラを持続可能にする技術を、地域の人間が地域で開発し、地域の人間に教える。その循環を作ること——それが、7月3日のRFI提出から始まる一連のプロセスの先にあるものだ。
技術の調査を終えて、一つだけ確かなことがある。四つの線は、どれも「待って」では進まない。夏が、動く季節になる。
タイムライン整理:
| 時期 | アクション |
|---|---|
| 7月3日 | RFI締切・提出(プロス名義) |
| 7〜8月 | 小論文執筆・数学復習(Strang・Lang)・TOEIC受験 |
| 8〜9月上旬 | 渡辺研へのコンタクト・受入内諾書取得 |
| 9月28〜30日 | NAIST春学期第2回出願 |
| 10月27〜29日 | 面接選抜(オンライン20分) |
| 11月6日 | 合格発表 |