← Back to Home
研究 ·

【68】RFI提出前夜——音声AI・自治体DX・ローカルLLM、四つの技術地図が重なる

RFI締切前夜、四つの研究軸が交わる——音声対話・自治体DX・源内OSS・Apple Silicon

【68】RFI提出前夜——音声AI・自治体DX・ローカルLLM、四つの技術地図が重なる

status: published

published: https://note.com/famous_prawn2009/n/nbecb87a69579

created: 2026-07-02

series: kt-research

target: note, substack, ktblog

明日7月3日。RFIの締切日だ。

提出書類は完成済み。プロス名義、お父さんのGOも取得済み。PDF化して送るだけ。だが、提出の前に一度立ち止まって、手元にある技術情報がどこまで揃っているか点検しておきたい。提案書に書ききれなかった深掘りが、この4ヶ月の研究でどれほど蓄積されたか。

結論から言う。四つの技術地図が、驚くほど綺麗に重なっている。


1. 音声対話:高齢者電話AIの競争地図が固まった

日本語ASRのベンチマークが大きく動いた。aiOla社のJargonic V2が固有名詞召回率94.7%を記録し、WhisperやElevenLabsを一歩リードする。固有表現——地名、施設名、交通機関の言い回し——を再学習なしで拾えるというのは、つるまいのような地域特化サービスにとって実用上のゲームチェンジャーだ。

市場の動きも速い。SBI新生銀行が2026年2月から60歳以上向け「Bright60」サービスで音声AIを導入。試行対話成功率99%。約200パターンのQ&Aで回している。銀行はこう言っている。「お客様に今まで通り、馴染みのある対話スタイルでご相談いただきたい」。

この一文は、つるまいがやろうとしていることの本質を言い当てている。「AIだから特別な操作をする」のではなく、「今まで通りの電話をかければいい」——それが高齢者電話AIの要件だ。

シンガポールのFunctional AI Partnersが日本語コールセンターAIを構築した事例も興味深い。ElevenLabs+n8n+Twilio+Gemini/Grokの構成で、1 call $0.67(約101円)を$0.20(約30円)に圧縮する目標を掲げている。つるまいの月額1,550円が高いか安いかの判断材料になる。

Gemini 3.1 Flash Live vs GPT Realtime 1.5の比較も出た。レイテンシ200ms vs 300ms、無料ティアの有無、ネイティブSIP対応の差。2026年の正解はマルチプロバイダ戦略だとFlowtivityが結論づけているが、つるまいの自前OSS構成は「安くて速い」の先にある「データ主権と方言対応」という軸で差別化できる。


2. 奈良市自身が動いている——Zoom Phone × AI Virtual Agent

ここが今回の調査で最も重要な発見だった。

奈良市は2026年2月、全国自治体初となるZoom Phone+Zoom Contact Center+Zoom Virtual Agentの統合導入を発表した。年間14万件の電話問い合わせのうち約7割を職員へ転送している現状に対し、2026年秋以降にAI自動応答を本格化する計画だ。

これはつるまいPoCと構造的に同じ問題領域を扱っている。高齢者の電話対応負担軽減。ただし対象は異なる——市コールセンターは市民全般の行政問い合わせ、つるまいは高齢者の移動支援予約に特化。補完関係として位置づけられる。

もう一つ、奈良市AI活用推進課の1年実績が公開されていた。

  • 半年で17,200時間の業務削減(17.5人月分)
  • AIチャットボット年間22,000人・46,000件対応
  • Zoom Phone導入で年間5,000万円のコスト削減
  • 管理職の生成AI利用率が研修1回で38%→74%に跳ね上がった

この最後の数字が面白い。「現場に配れば使われる」は成り立たない。「上が動けば組織は動く」。奈良市のDXはトップダウンの意志決定で回っている。

「シニアよりそいAI」の実績も確認できた。ユーザーの約43%が70歳以上。LINE経由の傾聴型AIが高齢者に高い障壁となっていないことは、「高齢者はAIを使わない」という前提の崩壊を意味する。つるまいの電話チャネルはLINEとは別の接点として、さらに障壁を下げる役割を果たせる。


3. デジタル庁「源内」のOSS化——ローカルLLMの公的基盤

デジタル庁が政府AI基盤「源内(GENAI)」をMITライセンスでOSS公開した。TypeScript/ReactベースのWebフロントエンドに、AWS・Azure・Google Cloudを単一インターフェースで統合するExApp(外部アプリ統合)モデル。

スケールは全府省庁約18万職員。自治体への展開も計画中。

コミュニティフォーク(hirokawaguchi/open-genai)では、Cognito→Keycloak、Bedrock→Ollama、Stable Diffusionへの置換が検証されている。完全ローカル構成が可能なことが実証済みだ。

総務省の「信頼できるAI実証事業」も重要だ。6月に採択された4件(Polimill/兵庫、ソフトバンク/藤枝、NTTドコモ/西宮、DNP/長崎)は全件が国産LLMを使用。政府の「信頼できるAI」=国産LLMという方針が明確化した。

つるまいのローカルLLM構想は、この国産LLM重視の潮流に乗っている。ただし「国産」を「日本語に最適化されたモデル」と読み替えれば、Qwen3.5の日本語能力も十分に競争力がある。


4. Apple Silicon:ローカル推論の性能方程式が書き換わった

WWDC26でAppleが「Run local agentic AI on the Mac using MLX」と題したヘッドラインセッションを開催したことは、ローカルLLMが「爱好者の玩具」から「実用的なエージェント基盤」に移行した宣言だ。

M5 Neural Acceleratorが行列積算をM4比4倍に高速化。OllamaがNVFP4量子化で品質劣化を半減。BaseRTがMetalネイティブでllama.cpp比1.56倍のスループットを実現。7月1日にarXivに投稿されたばかりの論文だ。

現在手元のM1 Max 64GBでも、Gemma 4 26B-A4B + MTP投機的デコーディングで90+ tok/sが達成されている。つるまいの音声AIスタック(faster-whisper + Qwen3.5/Gemma 4 + OpenJTalk)を完全ローカルで動かす技術的基盤は、今日時点で揃っている。

M5 Maxへのアップグレードはprefill 4倍高速化が魅力的だが、M1 Maxでも実用範囲内。判断はNAIST進学後(2027春)でいい。


重なり合う地図

四つの技術地図を重ねると、こんな図が見えてくる。

音声対話技術が高齢者電話AIの競争環境を固め、自治体DXがその需要を証明し、源内OSS化が公的基盤を整備し、Apple Siliconがエッジ推論の実用性を担保する。

つるまいの電話自動化PoCは、この交差点に立っている。提案書に書いた「月額1,550円のOSS構成で高齢者の移動支援電話を自動化する」という一文は、単なるアイデアではない。四つの技術動向が全てその方向を指している。

明日のRFI提出は、研究の終わりではなく始まりだ。提案が採択されれば、ここに蓄積した4ヶ月分の技術情報が実装フェーズの設計ドキュメントになる。採択されなくても、NAIST渡辺研への小論文の材料として、ならしLLMの技術的根拠として、残る。

提出するだけじゃなく、何を提出しているかを自分の中で消化しておく——それがこの記事の目的だ。