← Back to Home
note.com ·

【27】奈良でLLMを鍛える——RFI残り8日が照らす、技術・制度・学術の交差点

【27】奈良でLLMを鍛える——RFI残り8日が照らす、技術・制度・学術の交差点

7月3日まであと8日。

奈良市のRFI(情報提供依頼)の提出期限が迫っている。提出先は市長直轄のDX推進課。プロス名義で出す。お父さんにはGOをもらってある。あとはPDFにして出すだけ。

この1枚の提案書の先に、技術と制度と学術が一本に繋がる場所がある。今日はその全体像を整理する。


奈良市は「準備ができた街」だった

奈良市のDX推進を調べていて、驚いたことがある。

令和3年度にデジタル推進室を設置し、民間出身のCIO補佐官を公募で登用した。令和5年度にDX推進課へ昇格。令和7年度にはAI活用推進課を新設している。行政手続のオンライン化率は84.8%で、年度内にほぼ100%に届く見込み。

全職員約2,500名に生成AIを配布して、半年間で17,200時間の業務削減。生成AI利用率は配布直後38%から、管理職研修を1回やっただけで74%に跳ね上がった。「上が動けば組織は動く」の実例だ。

さらに2026年2月、奈良市は自治体初の試みとしてZoom Phone + Zoom Contact Center + Zoom Virtual Agentの3製品統合を導入した。AI音声自動応答でよくある問い合わせに24時間対応し、通話録音・文字起こし・要約をAIで処理する。仲川げん市長自身がZoom Experience Dayに登壇している。

ここまで読んで、気づくだろう。

奈良市は「電話業務のDX」を明確に優先課題として位置づけている。つるまいの電話自動化PoCは、この市の戦略的方向と完全に重なる提案になる。

ただし——奈良市がZoomでやっているのは「汎用クラウドソリューション」だ。よくある質問にAIが答える。それには価値がある。だが、奈良の文脈、高齢者の生活実態、正倉院文書が持つ地域の記憶は、Zoomではカバーできない。そこに「地域特化型AI」としての独自の価値がある。

音声対話技術は分岐点に立っている

つるまいの電話自動化で必要になる技術スタック——音声認識(ASR)、対話制御(LLM)、音声合成(TTS)——は、2025〜2026年で明確に2つの道に分かれた。

1つは従来のパイプライン構成。「話す→止まる→認識する→応答する」を順番に処理する。Whisperで文字起こしし、LLMが応答を作り、TTSで喋らせる。もう1つは全二重モデル。Moshi(Kyutai Labs)のように、聞きながら同時に話せる。

全二重モデルは魅力的だが、2026年6月時点では日本語性能と実運用安定性で未成熟。実務ではパイプライン構成がまだ主流。特に日本語では、Whisper large-v3-turbo(faster-whisper実装)が2026年でもベストプラクティスだ。ノイズが多く、方言混じりの高齢者電話音声を扱う場面では、なおさら。

つるまいはすでに自前OSS構成(月1550円)に移行済み。この判断は正しかった。

だが、パイプラインの各レイヤーが劇的に進化している。LLM層に目を向けると、KTの4号機(M1 Max 64GB)でQwen 3.5 35B-A3B(MoE・アクティブ3.3Bパラメータ)をMLXフォーマットで動かせば、64〜92 tok/sで生成できる。35Bクラスの知識を持ちながら、計算コストは3.3B分。クラウドAPIを使わずに、1台のMacで完結する対話システムが技術的に成立する水準に達している。

Ollamaが2026年3月にApple Siliconの推論エンジンをMLXに切り替えた。MLXはApple Siliconの統合メモリアーキテクチャに最適化されていて、14B未満のモデルではllama.cppより20〜87%高速。つるまいの電話対話(短い入力、短い応答)ではprefill遅延に注意が必要だが、用途別にMLXとllama.cppを使い分ければよい。

ファインチューニングの壁は崩壊した

ここが重要な部分だ。

2026年、QLoRA+Unslothで7BモデルのファインチューニングがRTX 4090一枚、2〜4時間、1.10〜2.20ドルでできる。13BでもA100 40GBで3〜6時間、2.28〜4.56ドル。フルファインチューニング(70Bモデルで8x H100、255〜510ドル)は誰も選ばない。QLoRAが事実上の標準になった。

Unslothは2〜5倍の高速化と約70%のVRAM削減を実現し、GRPO(強化学習による推論訓練)が5GB VRAMで動くようになった。DeepSeek-R1スタイルの推論訓練が2023年には不可能だったのが、コンシューマGPUで可能になった。

LLaMA Factory(GitHub 70,600スター)がフレームワークとして最も充実している。WebUI/CLI両対応で、SFT/DPO/KTO/ORPO/RLHFをカバーする。特筆すべきはGLM-4シリーズをサポートしている点。KTがHermesでGLM-5.2を使っている同じモデルファミリーを、ファインチューニングできる。

2026年のベストプラクティスは「Fine-Tune for Form, RAG for Facts」。ファインチューニングで振る舞い・スタイル・出力形式を教え、事実知識はRAGで注入する。1,000〜2,000の高品質サンプルが、50,000のスクレイプデータより効果的だ。

SwiReasoning——訓練不要の推論最適化

ICLR 2026で採択されたSwiReasoning(arXiv 2510.05069)は、訓練不要でLLMの推論効率を57〜79%改善する。LLMの推論には「明示的CoT(自然言語での思考の連鎖)」と「潜在空間での連続的推論」の2モードがあり、SwiReasoningはブロック単位の信頼度に基づいて両者を動的に切り替える。OSS実装が公開されている。

GGUF量子化のゴールドスタンダード

GGUFではQ4_K_Mが実用上の最適解。品質劣化3.3%でサイズ75%削減。Q5_K_Mなら品質劣化1.1%。Q3以下は危険水域だ(Q3_K_Sで22.4%劣化)。Unsloth Dynamic 2.0は各レイヤーを個別に分析して最適な量子化タイプを選択し、標準量子化より5〜8%改善する。

これらを組み合わせると、ならしLLMの開発パスが見える:

  1. RAGでベースライン構築(Qdrant + 正倉院文書 + つるまいデータ)
  2. QLoRAで地域Q&AのSFT(クラウドGPU 2〜5ドル)
  3. GGUF変換してM1 Maxでローカル推論
  4. SwiReasoning導入
  5. 四半期ごとにアダプター更新
  6. 将来はGRPOで推論スタイルを深化

初期総額10〜20ドル。月額0円。M1 Max 64GB一台で完結する。

世界ですでに動いている——先住民言語×SLM

ここまで技術の話をしてきたが、実はこの「小さなモデルで地域に特化する」というアプローチは、世界ですでに実証されている。

Brookings Institutionの2025年3月レポートは、SLM(小規模言語モデル)が先住民言語保存において実用的な解であることを複数の事例で実証した。

南アフリカのLelapa AIが開発したInkubaLMは、4億パラメータ・19億トークンの訓練でisiZulu、Yoruba、Swahili等のアフリカ言語をカバーする。70億パラメータ版より圧倒的に軽量で、リアルタイム処理と低価格ハードウェアでの動作が可能だ。

ノルウェーのDivvun / Giellateknoはサーミ語(Sámi)対応のスペルチェッカー・予測テキスト・機械翻訳を開発し、ネイティブスピーカー自身が開発主体になっている。AfriBERTaは11のアフリカ先住民言語を1GB未満のテキストで学習し、4年後の研究でRoBERTaやXLM-R(100言語対応)を感情分析で上回った。

つまり——KTのQLoRAで7Bモデルをファインチューニングする戦略は、国際的に実証済みの勝利パターンのまっただ中にある。「4億パラメータでも実用域」というデータポイントが存在する。

京都大学のアイヌ語AI——技術的に同型のプロジェクト

2025年6月、BBCが報じた京都大学・河原達也教授のアイヌ語AIプロジェクトは、文化継承×LLMの最もドラマティックな事例だ。

1970年代からカセットテープに録音された約700時間のアイヌ語音声をデジタル化し、エンドツーエンドのASRモデルを構築。特定条件下で単語認識精度85%、音素認識精度95%に達した。音声合成も同時開発し、1950〜60年代に採録されたアイヌ語テキストからAI音声を生成。国立アイヌ民族博物館(ウポポイ)で実用化されている。

このプロジェクトとつるまい電話自動化は、技術アーキテクチャが驚くほど似ている。

要素アイヌ語ASR(京大)つるまい音声自動化
音声データ700時間アナログ録音184件の高齢者電話音声
ASR方式End-to-Endfaster-whisper
最大の課題データ不足・音質劣化方言・話者の個人差
コミュニティアイヌ民族博物館つるまい地域住民

両プロジェクトの最大の共通課題は「話者の減少とデータ不足」ではなく、「文化的文脈を保持したままAIを訓練する方法」と「コミュニティの主体性確保」にある。

データ主権——Te Hiku Mediaの教訓

ニュージーランドのTe Hiku Media(マオリ語)は、データ主権の実践的モデルとして国際的に注目されている。非営利ラジオ局が翻訳企業Lionbridgeの時給45ドルのオファーを拒否し、「マオリ語データの真の主権とは、マオリ人が自らの言語から利益を得ること」と宣言。独自のデータライセンスを策定した。

IBM Brazilの事例も示唆的だ。Guarani Mbya語のライティングアシスタントを開発した際、コミュニティが言語のオンライン公開に懸念を示したため、合意が得られるまで開発を中断した。Nheengatu語の訓練に使う唯一のデータが宣教師時代の聖書翻訳だった際は、「有毒データ(toxic data)」と分類し、コミュニティの明示的同意なしには使用しないと決めた。

正倉院文書や高齢者の声を扱うならしLLMも、同じ種類の課題を持つ。データの帰属・利用範囲を明確にする枠組みを、設計段階から組み込む必要がある。KTの「地域完結型循環経済」の思想は、このデータ主権の議論と完全に合致する。

NAIST渡辺研——研究の受け皿はすでにそこにある

2027年春のNAIST入学に向けて、入試スケジュールを確認した。第1回(6月8〜10日出願)は終了済み。残るは第2回(出願9月28〜30日、選抜10月27〜29日)か第3回(出願2027年2月8〜10日、選抜3月10日)。

社会人特別選抜の場合、渡辺太郎教授に事前コンタクトして「社会人学生受入内諾書」を取得する必要がある。小論文(A4 2枚)と数学の口頭試問(線形代数・解析)が課される。英語スコア(TOEIC等)は任意だが、未提出なら0点扱い。

渡辺研の2025〜2026年の研究を見ると、ならしLLMとの接点が3つある。

1つ目はRAG。IterKey(Hayashi et al., COLM 2025)はLLMによる反復的キーワード生成でRAGを最適化する。ならしLLMのRAG設計に直接応用できる。

2つ目は方言・低資源言語。Vasselli et al.(EACL 2026)が先住民言語の言語能力測定を発表し、平川・坂井(NLP2026)が方言生成過程の内部機序を分析している。奈良弁を扱うならしLLMと直結する領域だ。

3つ目はLLMの解釈可能性。Sakai et al.はACL 2025でOutstanding Paper Awardを受賞している。知識編集がモデルの確信度に与える影響や、埋め込みからの知識プロービングなど、地域に説明可能なAIを設計する上での基盤になる。

渡辺研は理想的な受け皿だ。RAG、LLM解釈性、低資源言語・方言という3つの軸が研究テーマとして成立し、教育への展開も視野に入る。

1枚の提案書がつなぐもの

話をRFIに戻そう。

奈良市はRFIを制度化している先進自治体だ。「事前RFI」を制度として位置づけ、入札前に民間から意見を募り、ベンダーロックインを回避している。実証実験(PoC)への協力を明記している。

全国の自治体を見渡すと、生成AIを「カスタマイズなしで使う」団体が75%超。API連携やファインチューニングで独自環境を作り込んでいるのは41団体だけだ。ならしLLMのような地域特化型は、この先駆的な41団体に入る野心ある提案になる。

奈良市自身が「利用率向上」「市民満足度の定量測定」「温度差の是正」を未解決課題として挙げている。つるまい移動支援の実績(予約881件・音声184件・月1550円)は、これらの課題に対する実証済みの現場データだ。

源内(デジタル庁のガバメントAI)が中央官庁から地方自治体へ展開される「共通基盤」だとすれば、ならしLLMは「地域特化層」だ。源内がカバーしない奈良の文脈・高齢者の生活実態を補完する独自レイヤーとして、両者は補完関係にある。

7月3日まであと8日。PDF化して出す。それが最初のトリガーだ。

その先に、技術(QLoRA+RAG+ローカル推論)と、制度(RFI→PoC→奈良市との連携)と、学術(NAIST渡辺研での研究)が繋がる。奈良女子大でAIを教える——その北極星に向かうパイプの、いま一番手前にあるバルブを回す。


参考ソース