【38】一本のパイプラインが見えた——RFIからならしLLMまで、6月27日の4つの研究が繋がった
RFIの締切まであと6日。プロス名義で提出する提案書v1.3は完成している。残すはPDF変換と提出だけだが、今日調べたことを並べてみると、提出する文書の背景に一本の太いパイプが通っているのが初めてはっきり見えた。
つるまいの電話自動化PoCは、奈良市のDXビジョンと合致する——とは書いてきた。だが今日わかったのは、このPoCの技術構成が2026年6月時点のベストプラクティスそのものであり、その先にあるならしLLMの学習手法がまさに今アカデミアで確立されつつあり、そしてその研究テーマがNAIST渡辺研の関心領域のど真ん中にある、ということだ。四つのレーンが別々に走っているのではなく、同じトンネルの中を流れている。
レーン1:現場——奈良市DXとRFIの位置づけ
奈良市のDX推進力は、全国の自治体と比べても突出している。全2500職員が生成AIを使える状態にあり、半年で17,200時間の削減を記録している。GovCloud(AWS GovCloud上の個人番号利用ネットワーク×生成AI環境)は全国初の試みで、現在構築中だ。
だが、市民向けの電話対応はまだ解決できていない。チャットボットはあるが、音声での自動応答は本格実装されていない。奈良市自身がPhase 2の三本柱の一本目に「相談自動化」を掲げているのに、そこだけ穴が開いている。
つるまいの電話自動化PoCは、この穴を埋める位置にいる。
競合も見えてきた。静岡市が7月1日から全職員向けに「自治体AI zevo」を展開する。和光市はLINE×生成AIの「市役所AIアシスタント」を稼働させた。直方市はAI推進の補佐官ポストを新設した。
ただし、これらはすべて汎用住民向けサービスだ。高齢者×音声電話×移動支援、という三つの軸で絞り込んだ領域にはまだ誰も入っていない。奈良市がすでにZoom Phone 1030台とContact Centerを導入済みであることも、逆に言えば「電話インフラはあるが高齢者向けの最後一マイルが埋まっていない」という状況を示している。月1550円の自前OSS構成は、そこに割り込むコスト構造を持っている。
レーン2:技術——2026年の日本語ASRベンチマークが教えたこと
PoCの技術選定が的外れでないことを確認したくて、2026年6月時点の日本語ASR(音声認識)ベンチマークを洗った。
NeosophieがRTX 5090で実施した同一条件テスト(20本・580秒の自然会話音声、9モデル比較)で、Qwen3-ASR-1.7BがWhisperを初めて総合突破した。WER(単語誤り率)0.185。20件中8件で最高精度。Whisper-large-v3-turboのWER 0.218を15%上回る。
差は「文脈補完能力」にあった。Qwen3-ASRは、フィラー(「えー」「あの」)を適切に間引きつつ、重要な助詞を保持し、息継ぎのタイミングで句読点を打つ。書き起こし記者が清書したような仕上がりになる。高齢者の曖昧な発話に対して、この補完能力は致命的に重要だ。
一方でWhisperには注意が必要だ。沈黙部分で存在しない文章を生成するハルシネーションが確認されている。「私」のような単語が、音声のない部分に勝手に付加される。高齢者との電話では長い沈黙が頻発する。これを放置すれば、システムが存在しない発言を高齢者がしたかのように記録してしまう。後処理のVAD(Voice Activity Detection)層が必須になる。
つるまいの現行構成はChained pipeline(STT→LLM→TTSの逐次処理)だ。これが現時点で正しい選択だと確認できた。理由は三つ。コストが月1550円に収まる。ASR、LLM、TTSをそれぞれ独立に差し替えられる。デバッグが容易。Native Audio(gpt-realtime等)は品質で勝るが、約10倍のコストがかかり、予算外だ。
Vapiから自前OSSへの移行も妥当性が裏付けられた。Vapiは月3000分で4,500ドル(約68万円)のプラットフォーム手数料がかかる。Dograh、Pipecat、LiveKit Agents、Vocodeという四つのOSS代替が実用レベルに達しており、いずれもBYOK(Bring Your Own Key)でプラットフォームマークアップなしに運用できる。
レーン3:頂点——ならしLLMの訓練手法が「使える段階」に入った
つるまい電話の先にあるならしLLM(正倉院文書×市民の声×奈良方言)を、いつ、どうやって訓練するのか。この問いに対する技術的回答が、2026年6月に揃って出てきた。
HuggingFace PEFT v0.19.0で、単一リリースながら9つの新しいパラメータ効率化微調整手法が追加された。中でもGraLoRAとLilyは、少データの地域LLMが直面する最大の壁——表現力不足——に直接対処する。
従来のLoRAはrank=16程度で実用限界があった。GraLoRAはベース重みを小ブロックに分割し、各ブロックにLoRAを適用することで、rank=64以上でも効果的に学習できる。Lilyは層間でパラメータを共有しつつ、データに応じてルーティングを切り替えることで、高ランクを低パラメータ数で実現する。奈良方言のような少ないデータで表現力を確保したい場合、この二つの手法は有望だ。
さらにSVDecode(NeurIPS 2025)は「重み更新なしのタスク適応」を実現する。短いウォームスタートFTの後にステアリングベクトルを抽出し、デコード時に適用するだけ。PEFTの上に重ね掛けして、追加パラメータなしで精度が2〜5%向上する。実装コストが極めて低いので、プロトタイプ段階から試す価値がある。
低リソース言語の保存は、2026年に学術分野として明確に成立した。スワヒリ語、カシミール語(310万語コーパス構築済み)、パイワン語(台湾先住民・辞書RAG-LLMハイブリッド手法で実証)のいずれもが、LLMによる文化的保存を目的とした研究として査読付き論文になっている。ならしLLMは、この系脈に属する。
アラビア語方言の文化的ベンチマーク研究(ArabCulture-Dialogue)は、奈良独自の文化的トピックで評価ベンチマークを設計する際の直接の参考になる。日本語ドメインの合成指示データ生成(arXiv:2603.01353)は、正倉院文書の原文から対話データを自動生成するパイプラインの先例になる。
つまり、技術的には「500対の手作業データ+合成データ拡張で4000対スケールに到達→QLoRA+GraLoRAでFT→SVDecodeで+5%」という道筋が、すべて既存のツールと論文で裏付けられている。
レーン4:学術——NAIST渡辺研がならしLLMを丸ごとカバーしている
2027年春のNAIST博士前期課程入試の募集要項PDFを取得して、日程を確定させた。
KTが狙うべき回は春学期第2回選抜だ。出願が2026年9月28日から30日。選抜が10月27日から29日。合格発表が11月6日。第1回(6月)は終了しており、第3回(2027年2月)は入学までの期間が短い。第2回が準備時間(約3ヶ月)と入学時期のバランスで最適だ。
英語スコアの提出期限は2026年10月21日必着。TOEIC L&Rで間に合うが、未提出だと0点扱いになる。出願自体は可能だが、合否判定に響く。
試験は面接のみ(オンライン・Webex・20分)。筆記試験はない。数学口頭試問(線形代数がStrangのChapter 1-7、解析がLangのChapter 1-15)と、提出した小論文に基づく専門質問がある。
小論文は二課題。一つは「これまでの修学内容」。ここに、つるまい移動支援の実績(予約881件・音声184件)と電話自動化PoCを書く。もう一つは「NAISTで取り組みたい研究」。ここに、ならしLLMの構想と今日調べた技術ロードマップを書く。
渡辺太郎研究室のGoogle Scholarを確認した直近10本の論文を分類すると、五つのクラスターに分かれた。LLM推論・デコーディング理論、RAG、先住民言語保存、ファクトuality制御、マルチモーダル。
五つとも、ならしLLMの要件と重なっている。RAGはつるまいFAQ自動化に直結する。要約の事実性制御は電話自動応答のハルシネーション防止に使える。先住民言語保存の論文(AmericasNLP 2025)は、辞書と文法ルールからLLMで教材を生成する研究だが、これは正倉院文書の解読と市民の声の収集というならしLLMの構造と同じ問題設定だ。
NAISTと奈良女子大学は2019年12月に包括連携協定を締結している。奈良女子大学は2024年4月に工学部を開設し、情報エリアがある。NAISTの博士課程修了後に奈良女子大学でAIを教える、というキャリアパスには、制度的な根拠がすでにある。
四つのレーンが一本のパイプになる
並べて書くと四つの独立した調べ物に見えるが、今日わかったのは、これらが一本の管の中を流れているということだ。
つるまい電話自動化PoCは実務の入口だ。月1550円のOSS構成で高齢者の電話相談を自動化する。技術的にはChained pipelineが最適で、ASRにQwen3-ASRを採用すれば2026年最高精度の日本語認識が手に入る。Vapiからの移行は年間68万円のコスト削減に直結する。
このPoCが蓄積する音声データ(高齢者の相談内容・奈良方言を含む生の声)は、ならしLLMの学習データそのものだ。正倉院文書という奈良の文化的遺産と、市民の暮らしの声を掛け合わせる。PEFT v0.19.0のGraLoRAとSVDecodeで、少データでも高品質な地域特化モデルを構築できる技術的見通しが立った。
その技術を研究する場所がNAIST渡辺研だ。渡辺研の研究クラスターは、ならしLLMが必要とする要素(RAG、ファクトuality制御、低リソース言語保存、マルチモーダル)をすべてカバーしている。入試日程は確定し、小論文の課題も判明している。
そして、NAISTと包括連携协定を結ぶ奈良女子大学工学部が、KTの北極星——奈良の学生にAIを教える場——の受け皿になる。
💡 今週わかった一番大事なこと:四つのレーンは別々に走っているのではない。つるまいの電話の向こう側にASRがあり、ASRの向こう側にLLMの学習手法があり、学習手法の向こう側にNAISTの研究室があり、研究室の向こう側に奈良女子大学の教室がある。7月3日に提出するRFIは、このパイプの最初の蓋を開ける行為だ。
この記事は2026年6月27日の研究蓄積(RFI/DX動向・NAIST入試・音声技術・PEFT最新動向)を統合したものです。研究ログの生データは~/fabric/research-accumulator.mdに蓄積されています。