← Back to Home
研究 ·

【76】奈良弁を話すAIに必要な3つのピースが揃った

先日、思わぬ発見をした。奈良方言の音声データベースが、すでに存在しているのだ。

しかも499発話。これは日本の20ある地域方言のなかで最大規模だ。

この発見ひとつで、私の研究計画の「実現可能性」が一段上がった。今日は、なぜこれが重要なのか、そして残りの2つのピースは何かを書く。

「奈良弁でAIが話せる」とはどういうことか

私が作りたいのは、奈良のおばあちゃんが電話で話しかけると、奈良弁で応答するAIだ。

つるまい移動支援という福祉交通サービスを2年半やっていて、881件の予約を受けてきた。おばあちゃんたちの話し方がデータとして蓄積されている。「〜しとる?」「〜やわ」「どこ行くの?」

おばあちゃんたちは標準語を話さない。AIも奈良弁を理解して、奈良弁で返さなければ、本当の意味での「寄り添う技術」にはならない。

でも、これを実現するには3つの壁があった。

壁①:奈良弁のデータがない

LLM(大規模言語モデル)をある方言に適応させるには、その方言のデータが必要だ。当たり前だが、奈良弁のテキストも音声も、まとまった形では存在しないと思っていた。

つるまいの184件(約9時間)が唯一の手駄だ、と。

それが間違いだった。

CPJDコーパス——奈良方言499発話

Takamichi & Saruwatariが2018年にLREC(国際言語資源評価会議)で発表したCPJD(Crowdsourced Parallel Speech Corpus of Japanese Dialects)というコーパスが、20の地域方言をカバーしている。

で、奈良方言の発話数が499。2人の話者で録音されたものだが、他方言の2〜3倍のデータ量がある。標準日本語のテキストと方言音声のペアになっている。

さらに驚いたことに、このCPJDを使った研究が2026年に発表されていた。

Mizumoto et al. (2026)が実証したこと

ASRU2025(IEEE音声認識・理解ワークショップ)で採録された論文(arXiv:2606.25436)で、MizumotoたちはCPJDの20方言を使って、LLMと音声LLMの「方言堅牢性」を体系的に評価した。

「方言堅牢性」の定義がシンプルで良い。方言入力時のスコアを、標準語入力時のスコアで割る。1.0に近いほど方言でも標準語と同等に処理できる。

結果は3つにまとめられる。

第一に、音声LLMの方言堅牢性は、ベースとなるテキストLLMの能力と相関する。相関係数は0.848(BLEU)/ 0.910(BLEURT)。テキストで方言を理解できるモデルが、音声でも強い。

第二に、方言データを訓練に追加すると、ほぼ全方言で堅牢性が向上する。当たり前のようだが、「データを足せば良くなる」ことを系統的に証明した意義は大きい。

第三に、そして最重要、Whisper(音声認識モデル)を方言データでファインチューニングすると、さらに大幅に改善する。特に初期の堅牢性が低かった方言で顕著だ。

「Whisper単体では日本方言の処理が不十分」という結論は、私の音声パイプライン設計(Whisper + Qwen3.5-4B)の方針を裏付けるものだ。Whisperをそのまま使うのではなく、奈良弁データで追加学習させる必要がある。

壁②:計算リソースが足りない

LLMを方言に適応させる手法として、CPT(継続事前学習)+ LoRAという組み合わせがある。CPTは既存のモデルに追加で学習させる手法、LoRAはパラメータの1%未満だけを更新する効率的な手法だ。

これが現実的な選択肢かどうかを証明した論文があった。

ケベックフランス語の事例

Khan et al.(2025、arXiv:2510.22747)は、3つのLLMをケベックフランス語(カナダ・ケベック州で話されるフランス語の方言)に適応させた。CPT + LoRAで、パラメータ1%未満の更新で、方言ベンチマークの性能を向上させ、同時に標準フランス語での性能退行を最小限に抑えた。

HuggingFaceでモデルも公開されている。

この構造は、奈良弁へのLLM適応とほぼ同じだ。対象がケベックフランス語か奈良弁か、モダリティがテキストか音声かという違いはあるが、方法論の枠組みはそのまま再利用できる。

「車輪の再発明をしない」。私の研究の基本方針だ。先行研究が構築した手法を敬意を持って受け取り、自分の文脈に適用する。新しい手法を発明する必要はない。

壁③:データの質が問われる

ここが最も意外だった発見だ。

Pezeshkpour & Hruschka(2025、arXiv:2501.17840)は、CPT+LoRAがどの程度LLMに「深い学習」をもたらすかを評価した。医学・金融ドメインで実験している。

結論が鋭い。生の文書をそのままCPTに使っても、効果は限定的だ。ところが、「本質情報のみを抽出した構造化テキスト」でCPTすると、劇的に改善する。

つるまいの予約データに当てはめると、こうなる。

生の会話ログ(「はい、〇〇さんですね、何時にお伺えましょうか」)をそのまま流し込むのではなく、まず「奈良弁の語彙パターン」「文法の特徴」「予約タスクで頻出する表現」を構造化して抽出する。そのエッセンスでCPTする。この前処理プロセスの設計こそが、私の研究の鍵になる。

3つのピースがどう噛み合うか

整理しよう。

ピース1 — データ: CPJDコーパス(奈良方言499発話)+ つるまい実データ(184件・約9時間)。CPJDはCPT用の事前学習データ、つるまいはタスク対話のファインチューニング・評価用。朗読ベースのCPJDと自然会話のつるまいの間にはドメインギャップがあるが、段階的な適応(CPJDで方言の基盤を作り、つるまいでタスク特化させる)で対応できる。

ピース2 — 手法: CPT + LoRA(ケベックフランス語事例と同じ枠組み)+ Whisperの方言ファインチューニング。パラメータ1%未満の更新で、M1 Max(64GB)でも計算可能な範囲。

ピース3 — データ設計: 生データではなく「意味エッセンスを抽出した構造化テキスト」でCPTする前処理手法。これが私の研究の核心的な貢献になる。

3つ揃った。あとは実験するだけだ。

先行研究が開けていない領域

文献を10本以上読んで確認したことがある。

「高齢者」OR「方言」の研究はある。「高齢者」AND「方言」の組み合わせを扱った研究は見つからない。ましてや「方言×タスク対話×高齢者×実証」の4条件を同時に満たす先行研究は皆無だ。

私の貢献は「手法の発明」ではない。最先端の既存手法を、方言音声×タスク対話×高齢者×福祉交通という、誰も組み合わせたことのない文脈に統合して実証することだ。渡辺太郎研(NAIST・NLP)の研究クラスターがこの方向性の正当性を担保してくれている。

おばあちゃんの声をAIに届けるために

つるまいで電話をかけてくるおばあちゃんは、「明日9時にお願いします」と標準語で言わない。「明日の9時にな、お願いするわ」と言う。

その声をAIが聞き取り、理解し、奈良弁で返す。そのための技術的基盤が、ようやく見えてきた。

CPJDコーパスという先行研究の遺産。CPT + LoRAという効率的な適応手法。そしてデータの質を問い直す前処理の設計。

どれも私が発明したものではない。でも、この3つを奈良弁×高齢者×福祉交通に組み合わせる人は、まだいない。

次は実験設計だ。CPJDの499発話とつるまいの184件を、どう訓練・評価・テストに分割するか。この設計が小論文の実験章に直結する。