【33】ならしLLM実装の技術的判断2026夏——4つの研究知見をどう構造化するか
RFI提出まで7日。4つの研究蓄積を1本の記事に統合——音声対話アーキテクチャ選択、PEFT手法比較、NAIST渡辺研最新動向、そして奈良市DXの現在地。つるまいの技術的判断と、ならしLLMへのロードマップを整理した。
status: published
published: https://note.com/famous_prawn2009/n/nba4b5a604011
created: 2026-06-26
series: 家族としての東アジア史
target: note, ktblog
published:
note_url:
ktblog_url:
substack_url:
【33】ならしLLM実装の技術的判断2026夏——4つの研究知見をどう構造化するか
「ならしLLM」——奈良の地域特化AI。この一言でくくられる技術領域は、実は4つの独立した研究レイヤーからなる。今日の研究蓄積で、その各論が一気に深まった。
この記事は【32】戦略地図(同日公開)の技術補遺版。戦略的な「なぜやるか」の次に、技術的な「どう実装するか」を整理する。RFI提出まであと7日、NAIST第2回出願まで約3ヶ月——判断の材料として。
レイヤー1:音声対話——カスケードか、エンドツーエンドか
つるまい電話自動化のアーキテクチャ選択が、2026年前半でより明確になった。
3つの方式の比較:
| 方式 | 代表例 | 長文脈+RAG | レイテンシ | 本番適合 |
|---|---|---|---|---|
| Audio-Native Full-Duplex | Moshi / PersonaPlex | ❌ 音声トークン予算制約 | 200-240ms | △ 研究段階 |
| Thinker-Talker分離 | Qwen2.5-Omni | ✅ ネイティブ対応 | 257ms | ◯ 3B版でエッジ可 |
| カスケード(ASR→LLM→TTS) | 自前OSS構成 | ✅ 128K+コンテキスト | サブ1秒可能 | ◎ 最も実績 |
予約受付・施設案内というタスク指向用途では、カスケード型の優位が揺るがない。RAGで施設情報を注入し、構造化出力でJSON予約データを生成する——この2つの要件を満たすのは現状カスケードだけ。
ASRの選択肢が広がった:
Neosophieの同一条件ベンチマーク(RTX 5090実測)で判明したのは、Qwen3-ASR-1.7BがWhisper Large V3 TurboのWER 21.8%を18.5%に引き下げたという事実。ただしこれは日本語メディア音声(ニュース・バラエティ・ドラマ)での計測。高齢者の方言混じり音声では、Whisperのファインチューニング基盤の安定性が勝る。
言語処理学会2026年度大会C1-7の知見——方言ASRには約35時間の学習データでWhisperベースライン(CER中央値0.578)に到達可能——は、つるまいの音声184件を蓄積しながら段階的に方言モデルを育てるロードマップを裏付ける。
実装判断:
- 2026年夏時点:カスケード型を維持(つるまい要件に適合)
- ASRはWhisper Large V3 Turbo(安定性優先)→ 方言データ蓄積後にQwen3-ASR評価
- 高齢者方言ASRは別トラックで段階構築
レイヤー2:PEFT——LoRAから始めて、どこへ向かうか
ならしLLMの「正倉院文書×市民の声」追加学習には、パラメータ効率ファインチューニング(PEFT)が必須。2026年、この分野の選択肢が整理された。
デシジョンマトリクス:
| 手法 | VRAM(vs LoRA) | 精度(vs 完全FT) | 収束速度 | おすすめ用途 |
|---|---|---|---|---|
| LoRA r=16 | ベースライン | -3〜5% | ベースライン | まずここから |
| DoRA r=16 | +5-10% | -1〜2% | 同程度 | 最大精度が必須 |
| PiSSA r=16 | LoRAと同じ | -2〜4% | 30-50%高速 | 時間・予算制約 |
| GaLore r=128 | +30-40% | -1〜3% | 20-40%遅い | 全パラメータ品質 |
| VeRA | 最小(1.8M) | -4〜6% | 遅い | プロトタイプ専用 |
PiSSAが第一選択になる理由: ランダム初期化ではなく、事前学習済み重みのSVD上位r成分でアダプタを初期化するため、最初から意味のある部分空間で学習が始まる。7Bモデルでも初期化コストは30-60秒。つるまいの500件データセットでの実験サイクルを高速化できる。
DoRAは「方向と大きさ」を分離——LoRAではBA積で結合されていたこれらを独立に適応する。追加VRAMはわずか+5-10%で、完全FTとの精度ギャップを約半分に縮める。プロトタイプが軌道に乗った後の「仕上げ」として使う。
LLaMA Factoryがデファクト: 2026年4月時点でGitHub 70,600 stars。100+モデル、全PEFT手法に対応。QLoRA 4bitならVRAM 6GB・LlamaBoard Web UIでノーコード開始可能。M1 Max 64GBではMLX経由QLoRA、あるいはクラウドGPU(L40S $0.72/hr)でLoRA 16bit。
スウェーデン語500サンプルの教訓: 清華大学の実験(arXiv:2510.04139)が示したのは、500ペアのインストラクションデータで目に見える改善が得られる一方、過学習のリスクも高いという事実。対策の3点セット——Early Stopping + ReduceLROnPlateau + Cosine Decay——は必須。また「言語適応はFT、事実知識はRAG」の二層構造が正解であることも、この実験で裏付けられた。
レイヤー3:NAIST渡辺研——つるまいの研究としての正統性
渡辺太郎研究室の2026年EACL発表で特に注目すべきは、Completely Modular Fine-tuning for Dynamic Language Adaptation(Cao et al.)。新しい言語・方言をモジュールとして追加学習し、動的に切り替える手法。これはならしLLMの「奈良方言対応モジュール」構想の理論的基盤そのもの。
渡辺研内でつるまいが接続できる研究クラスター:
- 低リソース言語×LLM:SinhalaMMLU(EMNLP 2025)やアメリカ先住民語評価(EACL 2026)——奈良弁という超低リソース対象への直接の先行研究
- モジュラーFT:上記Modular Fine-tuning——方言モジュール追加の理論基盤
- 同時通訳・音声翻訳:Simul-MuST-C(EMNLP 2024)——つるまい電話自動化の「音声×リアルタイム×翻訳」を学術的に一般化
- デジタル人文科学:中世近世日本語MT(NLP2026)——正倉院文書の時代横断処理
KTの強みは、つるまいの予約881件・音声184件という実データ。「予備実験済み」として小論文に書ける。7月中に渡辺教授へ打診メールを送るべき——このデータとModular FTの接続を研究計画として提示できれば、社会人学生としての説得力は高い。
レイヤー4:RFI——この1週間の判断
RFI提出期限まであと7日。奈良市は全国でも最もAI実装に積極的な自治体の1つ(AI活用推進課新設1年で職員利用率38%→74%、年間17,200時間削減)。RFI本文には「PoCへの協力」が明記されており、つるまい電話自動化の産学官連携PoCとして提案するのに最適な枠組み。
自治体AI電話の先行事例も急増中:川口市・川崎市・春日井市(子育て支援)・守口市(ごみ分別・電話相談15%減)。つるまいは「高齢者移動支援の電話予約自動化」という差別化ポイントがある。予約881件の実績データを添えられる点が、机上のPoC提案との決定的な違い。
判断の分岐点:
- プロス名義の「つるまい電話自動化PoC」をRFIに提出する
- ならしLLM提案(6/15 note公開済み)と併願するかは、KTの判断待ち
- PDF化して送るだけの状態——書類の完成度より、出すこと自体に価値がある
4つのレイヤーの接続点
これら4つのレイヤーは独立したプロジェクトじゃない。 どれも1つの流れの異なる断面だ。
RFI(事業)── つるまい電話自動化PoC
↓
NAIST(研究)── 渡辺研モジュラーFT + 方言LLM
↓
音声対話(技術)── カスケードASR→LLM→TTSの実運用最適化
↓
PEFT(基盤)── PiSSA/DoRAでならしLLMの追加学習
RFIでPoCを通せば、その実績がNAISTの研究計画の「予備実験」になる。NAISTで学んだ知見が音声対話パイプラインにフィードバックされる。PEFTの実験結果が次のRFI提案の材料になる。
7月中のアクション:
- RFI提出(7/3)——書類を出す。それ自体が学習
- 渡辺教授へ打診メール(7月中)——つるまいデータを添えて
- 小論文準備(7-8月)——4レイヤーを「研究計画」として構造化
結局、この4本の経路は全部、ならしLLMという1つの頂点に向かっている。その地図を描ききれたのが、今日一番の収穫だった。