← Back to Home
KT研究 ·

【42】RFI締切5日前——四つの研究線が奈良で交わるとき

7月3日締切のRFIを5日前に控え、四つの研究線が一本にまとまる瞬間を書いた。奈良市DX動向、全国自治体AI電話事例、音声対話技術最前線、地域特化LLMのFT手法——交差点は奈良。

7月3日。奈良市のRFI(情報提供依頼)締切まで、あと5日。

この一週間、私は四つの線を引いていた。奈良市のDX動向、全国の自治体AI電話事例、音声対話技術の最前線、そして地域特化LLMのファインチューニング手法。バラバラに見えるこれらが、ある一点で交わる。奈良だ。

線を引いただけで終わりにしない。四つがどう繋がるか、見えてきたものを書く。


奈良市は「準備できている」

奈良市のDX組織は、令和3年度にデジタル推進室で始まり、令和5年度にDX推進課、そして令和7年度には全国でも先駆的な「AI活用推進課」を新設した。全職員約2,500名に生成AIの利用を解禁し、半年で17,200時間の業務削減を達成している。

注目は利用率の変化だ。当初38%だった月間利用率が、管理職向け研修を1回実施しただけで74%に跳ね上がった。「下に配れば使われる」は成り立たない。上層が動くことが波及の鍵だ。36ポイントの向上。この事実は、私が奈良女子大でAI教育を展開する際にも効いてくる。

さらに6月22日、奈良市は「民間提案 課題設定型」を新規開始した。里親制度啓発、清掃ボランティア、消費生活啓発、介護人材確保、月ヶ瀬宿泊拠点——5つのテーマを公開し、民間からの解決提案を募っている。つるまいが直接カバーする「高齢者見守り・移動支援」はこの5テーマに入っていない。だが、テーマ4の介護人材確保との接続は有力だ。介護事業者の電話対応負荷を自動化で減らし、人材リソースを再配分する。この論理で繋がる。

それ以上に重要なのは、奈良市が「事前RFIを制度化」し、ベンダーロックインの回避を明示的に図っている事実だ。つるまいの提案(OSS構成・月1,550円・データ可搬性重視)の方向性が、提出先自治体の調達哲学と完全に合致している。


全国の先行事例が「目標値」をくれた

つるまい電話自動化PoCの目標KPIとして、強力な先行実績を3つ確認した。

福島市(DNP実証、2026年1〜2月)は転入出・証明書交付の電話問い合わせをAIで処理し、自己完結率60%、住民総合満足度82%を記録した。この数字は、つるまいの提案書に目標値として直接引用できる。

四日市市のAIエージェント「GeN」は人口約31万人の市全体で月12万件を処理する。「聞き返し機能」で曖昧な質問を深掘りする設計は、方言や曖昧な発話が多い高齢者ユーザーを対象とするつるまいの要件に技術的に合致する。ただし四日市市は以前チャットボット導入で「情報更新が追いつかず職員負担が増える」という失敗を経験している。知識ベースの運用設計が成否を分けるという教訓は、忘れてはいけない。

京都市のGraffer Callは全11区役所にAI自動音声応答を導入し、電話で問い合わせた市民にウェブページのURLをSMSで送信する仕組みを備えている。

一般的な自治体AI電話サービスは初期50〜200万円、月額10〜30万円。つるまいはOSS構成で月1,550円。1/100から1/200のコスト構造だ。「高額なSaaSに依存せず、OSSと地域人材で構築する持続可能なモデル」というメッセージは、数値の裏付けがある。


音声AIが「高齢者」に追いついた

ここが技術面で一番興奮したところだ。

日本語ASR(音声認識)の世界で、AlibabaのQwen3-ASR-1.7BがWER 0.185でWhisper-large-v3-turbo(0.218)を初めて上回った。同じ条件で9モデルを比較したNeosophieのベンチマークで、Qwen3が「文脈補完能力」——単なる文字起こしではなく、句読点を自然な呼吸位置に挿入し、フィラーを適切に除去する——で圧倒している。

だが私が一番注目したのは、山梨大学がAPSIPA 2025で発表した論文だ。

スーパー高齢者(70〜99歳)の音声認識精度を、TTS(テキスト音声合成)によるデータ拡張で改善する。EARSコーパスのわずか140発話(0.33時間・14話者)でStyle-Bert-VITS2を訓練し、毎日新聞テキストから3,584発話の合成高齢者音声を生成。これをWhisper-large-v3のファインチューニングに使った。結果はCER 10.03%→9.72%の改善(統計的に有意)。

つるまいの利用者——奈良の高齢女性——の音声は、まさにこの「スーパー高齢者」カテゴリに該当する。つるまいの既存録音(184件の音声データ)から高齢者風合成音声を生成し、ASRモデルをファインチューンするアプローチが、直接適用可能だ。

一方で、リアルタイム音声対話LLMの世界ではGPT-Realtime-2がGPT-5級推論をリアルタイム音声ループに統合し、NVIDIAのPersonaPlex-7Bがフルデュプレックス(同時聴取・発話)をOSSで実現した。VoiceBenchではNemotron 3 Nano Omniが89.39で首位。興味深いことに、GLM-4をベースにしたUltravox-GLM-4P7が88.86でOSS最強にあり、GPT-4o-Audio(86.75)を上回っている。

OSS音声エージェントフレームワークはLiveKit Agentsが圧倒的リード。つるまいの月1,550円構成を維持しつつ精度を上げるなら、LiveKit + Whisper-large-v3-turbo(またはQwen3-ASR)+ 軽量LLMの組み合わせが現時点での最適解だ。


ならしLLMが「月数千円」で動く

四つ目の線は、一番先の未来だ。だが技術的に、もう動く。

2026年のパラメータ効率ファインチューニング(PEFT)は、LoRA一強から「目的別使い分け」に成熟した。中でもPiSSAがコストパフォーマンスで頭ひとつ出ている。SVD(特異値分解)でアダプタを初期化することで、LoRAと同じVRAM消費量で収束を30〜50%高速化する。7BモデルのクラウドFT費用は、PiSSAが$1.44に対しLoRAが$2.16。固定GPU予算で最大化したい場合の第一選択だ。

精度を追求するならDoRA。重みの「方向」と「大きさ」を分離して適応させ、フルファインチューンとの精度ギャップの半分を、VRAM+5〜10%の追加で埋める。commonsense reasoningで+3.7%。2026年の標準フローは「LoRAでベースライン→DoRAにアップグレード」になりつつある。

さらにDeepSeek-R1が普及させたGRPO(Group Relative Policy Optimization)が、アライメントの主流パラダイムになりつつある。報酬モデル不要で推論能力を直接訓練する。報酬を「検証可能」に設計できる——数学の正否、コードのユニットテスト、構造化抽出の一致。これを「方言の正しい/誤りの判定」に応用できる可能性がある。奈良方言話者の正解データを報酬関数に組み込み、推論モデル化する。夢物語ではなくなっている。

LLaMA Factoryは70,600スターを獲得し、100以上のモデルアーキテクチャに対応。DoRA、PiSSA、GaLoreを全サポートし、Qwen3・Gemma 3にDay-0対応している。ノーコードWeb UI(LlamaBoard)で非エンジニアでもFTが完結する。

NVIDIAが公開したNemotron-Personas-Japanは100万レコードの日本語合成ペルソナデータセット(CC BY 4.0)。日本語ドメイン特化FTの「データ不足」問題への直接の答えだ。これをベースに、奈良方言・正倉院語彙を追加した合成データセットを構築する戦略が、即座に実行可能。

私のM1 Max 64GB環境では、Qwen3-14B(Qwen2.5-32B相当の日本語能力)の4bit量子化で約8GB使用。QLoRAファインチューンが余裕で可能。クラウドGPU(L40S $0.72/h)を2〜3時間借りれば、$1.44〜2.16で7BモデルのFTが完結する。月数千円のGPU費用で、ならしLLMの試行錯誤サイクルが回る。つるまいの月1,550円と同じDNAだ。


四つの線が交わる点

ここまで書いてきて、改めて整理する。

四つの研究線は、独立して存在しているわけではない。

奈良市のDX組織が準備できている(線①)からこそ、つるまいの電話自動化PoCが「実証の場」になりうる。全国の先行事例(線②)が目標値を与えてくれるからこそ、PoCの成果が測定可能になる。音声AI技術が高齢者音声に追いついた(線③)からこそ、技術的に実現可能だ。そして、その先にある「ならしLLM」(線④)が月数千円で動くことが見えたからこそ、電話自動化は通過点であって終着点ではない。

この四つの交差点に、NAIST渡辺研がある。

渡辺研は2025〜2026年でACL/EMNLP/NAACL/COLING/EACLのトップ国際会議に60本以上の論文を掲載し、ACL 2025でOutstanding Paper Awardを受賞している。研究クラスターを整理すると、つるまいからならしLLMまで、KTの全プロジェクトに対応する領域が揃っている。

同時通訳の遅延最適化(Simul-COMET)はつるまいの音声対話に直結する。ハルシネーション検出ツール(HalluCiteChecker)は「高齢者に不正確な情報を伝えない」というつるまいの命題に応用できる。文法誤り訂正の過剰訂正抑制は、高齢者の方言・非標準表現を「誤り」として直しすぎる問題の対策になる。

そしてJustin Vasselli氏が率いる先住民言語のLLM能力測定——アメリカ先住民の言語をNLPでどう支えるか——は、ならしLLM(正倉院文書×市民の声)と同じ低リソース言語アプローチだ。言語教育×NLPの研究系(GEC・語彙平易化・日本語学習者辞書)は、奈良女子大でAIを教える私にとって最も自然な参入領域になる。

2027年度のNAIST募集要項PDFは既に公開されている。前年度パターンから推測すると、博士前期課程第1回の出願は2026年6月上旬。残り約1〜2週間圏内に入っている。


何をすればいいか

RFIの締切は7月3日。提案書v1.3は完成している。PDF化して提出するだけだ。

だが提出は通過点だ。提出後のことを、今から設計しておく必要がある。

つるまい電話自動化PoCを実行し、福島市の「自己完結率60%」をベンチマークに成果を出す。その成果を持って、奈良市の民間提案(介護人材確保テーマ)に接続する。並行して、NAISTの小論文を書き、渡辺研への進学準備を進める。

その全プロセスで発生するデータ——高齢者の音声、方言のパターン、正倉院文書のコーパス——が、ならしLLMの訓練データになる。

四つの線が一本にまとまる場所。そこが奈良だ。そしてその奈良で、AIを教える。私のやるべきことは、ずっと変わっていない。