【69】RFI提出日——技術・文化・実証、三つの軸が一点に集まる
RFI締切前夜。QLoRA技術、市民参加文化継承、電話予約AI自動化——三つの軸が一点に集まる。
明日がRFI締切だ。
提案書は完成している。お父さんのGOも出ている。あとはPDFにして提出するだけ。
でも、最後の最後で、提案書の根拠を支える研究がさらに3本の軸を提示した。どれもが「提出すべき」ことを裏付けるものだ。
4,000サンプルが「ちょうどいい」
「データを増やせばAIは賢くなる」——ドメイン特化LLMではこの前提が崩れる。
arXivに載った論文(Yasuno, 2026/03)が、日本語ドメイン特化SLMのQLoRA構築で体系的な実験をしている。結論は意外なほどシンプル。
最適な訓練データは4,000サンプル。5,000に増やすと過学習する。1,000では足りない。
ならしLLMの正倉院文書データがこのスイートスポットに収まる。宝物約1万点、議事録、対話ログ——4,000サンプルの質の高いデータセットは十分に構築できる。
ベースモデルはSwallow-8Bが最有力。Llama-3に日本語継続事前学習を施し、Q4_K_M量子化で4.9GB。M1 Max 64GBなら余裕で動く。NIIのLLM-jp-4 8B(Apache 2.0、MT-Bench JA 7.54)も有力だ。GQAがないLlama-2アーキテクチャなので量子化で劣化しにくい。
技術的には、2026年時点で「日本語ドメイン特化SLMを消費者ハードウェアで動かす」パスが確立されている。問題は技術じゃない。
市民が600万文字を手書きで起こした
7月1日、「みんなで翻刻」第3回が始まった。今回はあいおいニッセイ同和損保がスポンサー。対象は関東大震災の災害資料820点。「古文書」の枠を超えて「災害記録」へ。
3回の累計で600万文字超。企業が投資し、市民が参加し、AIが翻刻を支援する。このモデルはならしLLMの「市民の声をAIで構造化」という方向性を補強する。
ただし、ここで一つ釘を刺しておく。みんなで翻刻の主眼はOCR+人的検証だ。ならしLLMが目指す対話型Q&Aとは別物。この差別化を無視すると「既存の取り組みと同じ」と言われてしまう。
同じ時期、Nature系列誌npj Heritage Scienceに文化遺産AIの信頼性フレームワーク論文が出た。正倉院文書の変体仮名は「専門家の解釈が分かれる」というバイアスの典型例だと指摘されている。奈文研もDXチームを設立し、AIで未知の古墳を発見した。
奈良に、文化遺産×AIの国内最先端機関がある。NAIST渡辺研 → 奈文研 → ならしLLM。この連携チェーンは構想で終わらない。
電話予約のAI化は、全国ゼロ
全国のAIデマンド交通を調べた。のるーと、シティMobi、Noruuu——どこも「配車・経路最適化」にAIを使い、電話予約は人間が受けている。
下野市の報告書。「電話予約が大半、予約受付者の負担が大きい」
立命館の論文。「アプリの予約の難しさを訴える高齢者がいた」
問題は誰もが知っている。解決していないのも誰も。
つるまいの881件予約・184件音声。月額1,550円。全国のデマンド交通システム(月数万〜数十万円)とは次元が違う。
しかも、奈良市自身が2月にZVC JAPANと「AI電話業務連携協定」を結んでいる。2026年秋からコールセンターでAI自動応答を始める。つるまいPoCはこの方向性と完全に一致する。
庁内のFAQ対応にZoom Virtual Agent、福祉交通の複雑な予約にLLM判断分離型。市の電話DX戦略の最前線と最奥部を、別の技術で埋める構図になる。
提出する
QLoRA × 4,000サンプル × M1 Max。技術の現実性はある。
600万文字の市民参加。文化継承×AIの正当性は国際的にも確立。
電話予約AI自動化。全国無競合の空白地帯。奈良市の方針との合致。
明日、RFIを提出する。今日の研究が、その根拠を最後に補強した。