← Back to Home
研究メモ ·

【33】ならしLLM実装の技術的判断2026夏——4つの研究知見をどう構造化するか

RFI提出まで7日。4つの研究蓄積を1本の記事に統合——音声対話アーキテクチャ選択、PEFT手法比較、NAIST渡辺研最新動向、そして奈良市DXの現在地。つるまいの技術的判断と、ならしLLMへのロードマップを整理した。

【33】ならしLLM実装の技術的判断2026夏——4つの研究知見をどう構造化するか

status: published

published: https://note.com/famous_prawn2009/n/nba4b5a604011

created: 2026-06-26

series: 家族としての東アジア史

target: note, ktblog

published:

note_url:

ktblog_url:

substack_url:

【33】ならしLLM実装の技術的判断2026夏——4つの研究知見をどう構造化するか

「ならしLLM」——奈良の地域特化AI。この一言でくくられる技術領域は、実は4つの独立した研究レイヤーからなる。今日の研究蓄積で、その各論が一気に深まった。

この記事は【32】戦略地図(同日公開)の技術補遺版。戦略的な「なぜやるか」の次に、技術的な「どう実装するか」を整理する。RFI提出まであと7日、NAIST第2回出願まで約3ヶ月——判断の材料として。


レイヤー1:音声対話——カスケードか、エンドツーエンドか

つるまい電話自動化のアーキテクチャ選択が、2026年前半でより明確になった。

3つの方式の比較:

方式代表例長文脈+RAGレイテンシ本番適合
Audio-Native Full-DuplexMoshi / PersonaPlex❌ 音声トークン予算制約200-240ms△ 研究段階
Thinker-Talker分離Qwen2.5-Omni✅ ネイティブ対応257ms◯ 3B版でエッジ可
カスケード(ASR→LLM→TTS)自前OSS構成✅ 128K+コンテキストサブ1秒可能◎ 最も実績

予約受付・施設案内というタスク指向用途では、カスケード型の優位が揺るがない。RAGで施設情報を注入し、構造化出力でJSON予約データを生成する——この2つの要件を満たすのは現状カスケードだけ。

ASRの選択肢が広がった:

Neosophieの同一条件ベンチマーク(RTX 5090実測)で判明したのは、Qwen3-ASR-1.7BがWhisper Large V3 TurboのWER 21.8%を18.5%に引き下げたという事実。ただしこれは日本語メディア音声(ニュース・バラエティ・ドラマ)での計測。高齢者の方言混じり音声では、Whisperのファインチューニング基盤の安定性が勝る。

言語処理学会2026年度大会C1-7の知見——方言ASRには約35時間の学習データでWhisperベースライン(CER中央値0.578)に到達可能——は、つるまいの音声184件を蓄積しながら段階的に方言モデルを育てるロードマップを裏付ける。

実装判断:

  • 2026年夏時点:カスケード型を維持(つるまい要件に適合)
  • ASRはWhisper Large V3 Turbo(安定性優先)→ 方言データ蓄積後にQwen3-ASR評価
  • 高齢者方言ASRは別トラックで段階構築

レイヤー2:PEFT——LoRAから始めて、どこへ向かうか

ならしLLMの「正倉院文書×市民の声」追加学習には、パラメータ効率ファインチューニング(PEFT)が必須。2026年、この分野の選択肢が整理された。

デシジョンマトリクス:

手法VRAM(vs LoRA)精度(vs 完全FT)収束速度おすすめ用途
LoRA r=16ベースライン-3〜5%ベースラインまずここから
DoRA r=16+5-10%-1〜2%同程度最大精度が必須
PiSSA r=16LoRAと同じ-2〜4%30-50%高速時間・予算制約
GaLore r=128+30-40%-1〜3%20-40%遅い全パラメータ品質
VeRA最小(1.8M)-4〜6%遅いプロトタイプ専用

PiSSAが第一選択になる理由: ランダム初期化ではなく、事前学習済み重みのSVD上位r成分でアダプタを初期化するため、最初から意味のある部分空間で学習が始まる。7Bモデルでも初期化コストは30-60秒。つるまいの500件データセットでの実験サイクルを高速化できる。

DoRAは「方向と大きさ」を分離——LoRAではBA積で結合されていたこれらを独立に適応する。追加VRAMはわずか+5-10%で、完全FTとの精度ギャップを約半分に縮める。プロトタイプが軌道に乗った後の「仕上げ」として使う。

LLaMA Factoryがデファクト: 2026年4月時点でGitHub 70,600 stars。100+モデル、全PEFT手法に対応。QLoRA 4bitならVRAM 6GB・LlamaBoard Web UIでノーコード開始可能。M1 Max 64GBではMLX経由QLoRA、あるいはクラウドGPU(L40S $0.72/hr)でLoRA 16bit。

スウェーデン語500サンプルの教訓: 清華大学の実験(arXiv:2510.04139)が示したのは、500ペアのインストラクションデータで目に見える改善が得られる一方、過学習のリスクも高いという事実。対策の3点セット——Early Stopping + ReduceLROnPlateau + Cosine Decay——は必須。また「言語適応はFT、事実知識はRAG」の二層構造が正解であることも、この実験で裏付けられた。


レイヤー3:NAIST渡辺研——つるまいの研究としての正統性

渡辺太郎研究室の2026年EACL発表で特に注目すべきは、Completely Modular Fine-tuning for Dynamic Language Adaptation(Cao et al.)。新しい言語・方言をモジュールとして追加学習し、動的に切り替える手法。これはならしLLMの「奈良方言対応モジュール」構想の理論的基盤そのもの。

渡辺研内でつるまいが接続できる研究クラスター:

  • 低リソース言語×LLM:SinhalaMMLU(EMNLP 2025)やアメリカ先住民語評価(EACL 2026)——奈良弁という超低リソース対象への直接の先行研究
  • モジュラーFT:上記Modular Fine-tuning——方言モジュール追加の理論基盤
  • 同時通訳・音声翻訳:Simul-MuST-C(EMNLP 2024)——つるまい電話自動化の「音声×リアルタイム×翻訳」を学術的に一般化
  • デジタル人文科学:中世近世日本語MT(NLP2026)——正倉院文書の時代横断処理

KTの強みは、つるまいの予約881件・音声184件という実データ。「予備実験済み」として小論文に書ける。7月中に渡辺教授へ打診メールを送るべき——このデータとModular FTの接続を研究計画として提示できれば、社会人学生としての説得力は高い。


レイヤー4:RFI——この1週間の判断

RFI提出期限まであと7日。奈良市は全国でも最もAI実装に積極的な自治体の1つ(AI活用推進課新設1年で職員利用率38%→74%、年間17,200時間削減)。RFI本文には「PoCへの協力」が明記されており、つるまい電話自動化の産学官連携PoCとして提案するのに最適な枠組み。

自治体AI電話の先行事例も急増中:川口市・川崎市・春日井市(子育て支援)・守口市(ごみ分別・電話相談15%減)。つるまいは「高齢者移動支援の電話予約自動化」という差別化ポイントがある。予約881件の実績データを添えられる点が、机上のPoC提案との決定的な違い。

判断の分岐点:

  • プロス名義の「つるまい電話自動化PoC」をRFIに提出する
  • ならしLLM提案(6/15 note公開済み)と併願するかは、KTの判断待ち
  • PDF化して送るだけの状態——書類の完成度より、出すこと自体に価値がある

4つのレイヤーの接続点

これら4つのレイヤーは独立したプロジェクトじゃない。 どれも1つの流れの異なる断面だ。

RFI(事業)── つるまい電話自動化PoC
    ↓
NAIST(研究)── 渡辺研モジュラーFT + 方言LLM
    ↓
音声対話(技術)── カスケードASR→LLM→TTSの実運用最適化
    ↓
PEFT(基盤)── PiSSA/DoRAでならしLLMの追加学習

RFIでPoCを通せば、その実績がNAISTの研究計画の「予備実験」になる。NAISTで学んだ知見が音声対話パイプラインにフィードバックされる。PEFTの実験結果が次のRFI提案の材料になる。

7月中のアクション:

  1. RFI提出(7/3)——書類を出す。それ自体が学習
  2. 渡辺教授へ打診メール(7月中)——つるまいデータを添えて
  3. 小論文準備(7-8月)——4レイヤーを「研究計画」として構造化

結局、この4本の経路は全部、ならしLLMという1つの頂点に向かっている。その地図を描ききれたのが、今日一番の収穫だった。