ドラえもんまでの道のり
部品単体なら高価なのに、巨大量産された完成品スマホは中古になると異常に安い。古いAndroid×猫サイズ四足ロボットで「向こうから会いに来るAI」を作る構想。
――「古いスマホ」は、実は大量生産されたロボットの脳だった
ある動画を見ていて、最初に引っかかったのは「巨大なAIモデル」ではなかった。
動画が語っていたのは、むしろその反対だ。
低消費電力の小さなコンピューターを自宅で24時間動かし、そこに小規模言語モデル、いわゆるSLMを常駐させる。OCRで書類を読む。記事を要約する。医療関係の文章から必要な情報を抽出する。外国語を翻訳する。
巨大モデルに何でもやらせるのではない。小さなモデルを、限定された仕事に割り当てる。
モデル自体は、必ずしも賢者である必要はない。
「この文章は請求書か」 「この記事の要旨を500文字にせよ」 「この写真から文字だけ抜き出せ」 「日本語に翻訳せよ」
その仕事だけ、きちんとできればよい。
そして小さいからこそ、クラウドへ情報を投げず、手元で処理できる。何も仕事がない時間にはほとんど電力を使わず、仕事が来た瞬間だけ動かすこともできる。
Zima系の小型サーバーなどが象徴しているのは、まさにこの「24時間そこにいる小さな計算機」という発想である。ZimaBladeは公式に6W TDPを掲げており、実測でもアイドル時2W前後、負荷時でも十数ワット程度に収まる。ZimaCubeも、Dockerや仮想環境を想定した家庭用サーバーとして売られている。
ここから私は、最初はこう考えた。
では、最も低電力でAIを24時間動かせるマシンは何だろう。
Mac miniか。 Jetsonか。 Raspberry Piか。 小型x86サーバーか。
だが、この問い自体が狭すぎることに気づいた。
「どのAIサーバーを買うか」という発想をやめる
AIがこれから生活の中に入ってくるなら、必ずしも「AIサーバー」という名前の機械で動かす必要はない。
時計でもいい。 テレビでもいい。 ルーターでもいい。 Raspberry Piでもいい。 使わなくなったノートパソコンでもいい。
そして何より、スマートフォンでいい。
大事なのは、「AIを動かすために、新しいコンピューターを買う」ことではない。
すでに世界中に存在する計算資源の中で、「どの仕事を、どの機械まで下ろせるか」である。
人感検知のために70BのLLMを起動する必要はない。ウェイクワードなら小さなDSPやマイコンでいい。画像分類ならNPUでいい。簡単な要約なら3B程度のモデルでいい。難しい判断だけ、家庭内の大型マシンやクラウドへ上げればいい。
つまりAIシステムは、中央に巨大な一つの脳を置くより、
末端ほど小さく、上位ほど強くなる神経系
として考えた方が自然なのである。
そして、この考え方を突き詰めた瞬間、一つ異様に有利なハードウェアが浮かび上がる。
中古Androidスマートフォンだ。
中心命題は、性能ではない。量産である
ここで、この記事で一番大事な一点を先に置く。
スマートフォンの機能を、新しく、部品から取ろうとしたら、めちゃくちゃお金がかかる。
超高性能カメラ。超高性能マイク。IMU。GPS。ディスプレイ。バッテリー。充電回路。LTE。SoC。アンテナ。放熱。筐体。
これらを一個ずつ買い、一個ずつ配線し、一個ずつドライバーを書き、一個ずつケースに収めるのは、試作ならともかく、普及商品としては絶望的に高い。
ところが、それらはすでに超大量生産されている。しかも完成品として。しかも世界中の工場が何年もかけて磨き続けた状態で。
そして新品としての役割を終えた瞬間、その値段が崩れる。
部品単体なら高価なのに、巨大量産された完成品スマホは、中古になると異常に安い。
この一点が、構想全体の経済的な背骨である。
これは単なるロボット論ではない。すでに社会が投資済みの、数十億台のハードウェアを、AI時代に再資本化する話である。
中古Androidは「安いコンピューター」ではない
中古スマートフォンが面白い理由を、「CPUがそこそこ速いから」と説明すると、本質を外す。
スマートフォンには最初から、次のものが入っている。
- 高性能CPU
- GPU
- NPUを含むAIアクセラレータ
- 数GBから十数GBのRAM
- フラッシュストレージ
- 高性能カメラ
- 複数マイク
- スピーカー
- 高解像度ディスプレイ
- タッチパネル
- GPS
- 加速度センサー
- ジャイロ
- 地磁気センサー
- 近接センサー
- 照度センサー
- 機種によっては気圧センサー
- Wi-Fi
- Bluetooth
- NFC
- LTE / 5G
- USB
- 充電回路
- バッテリー
Android自身も、加速度・回転・地磁気・近接など多数のセンサーを標準APIとして扱う構造を持つ。現在のAndroid APIには、NPUまたは同等のAIアクセラレータの存在を示す機能定義まで用意されている。
これを「スマートフォン」という一個の商品として見るから、その異常さに気づきにくい。
一度、全部ばらして考えてみればいい。
例えばRaspberry Piを買う。そこにカメラを付ける。Raspberry Pi公式のCamera Module 3だけでも別部品で、12MP・オートフォーカス付きのカメラモジュールとして、単体で25ドル前後から販売されている。マイク入力についても、Codec Zeroのような別基板を足せばMEMSマイクを追加できる。
さらに画面を付ける。バッテリーを付ける。充電回路を付ける。GPSを付ける。LTEモデムを付ける。スピーカーを付ける。ケースを作る。ケーブルを配線する。全部を一つの筐体に収める。
その瞬間、金額だけではなく、設計、電源、ドライバー、加工、故障箇所、調達、組み立て工数まで一気に増える。
ところがスマートフォンでは、それが最初から数ミリ単位で統合されている。
しかも恐ろしいことに、その機械が世界中で途方もない数量作られてきた。
IDCは2025年の世界スマートフォン出荷を約12.4億台と見ていた。2026年第1四半期だけでも、世界出荷は2億9380万台に達している。同年通年はメモリ不足などで前年比二桁減の見通しが出ているが、それでもなお年間十億台級である。
これは試作品の世界ではない。
年間十億台級で磨かれ続けた、ロボット用センサーヘッド
なのである。
そして新品としての役割を終えた瞬間、その値段が崩れる。
ここで経済的な逆転が起きる。
減価償却された「未来のロボット部品」
高性能カメラを一から買えば高い。 高性能マイクを一から設計しても高い。 LTE通信装置を作っても高い。 高密度バッテリーと充電制御を付けても高い。 IMU、GPS、ディスプレイ、SoCまで全部一から揃えるなら、なおさらである。
しかし中古スマートフォンの価格は、それぞれの部品価値の合計では決まらない。
市場はあくまで、
- 何年前のスマートフォンか
- OS更新があと何年あるか
- 画面に傷があるか
- バッテリーが劣化しているか
で値段を付ける。
AIロボットを作る人間から見れば、この値付けはおかしい。
なぜなら、画面に多少傷があっても、ロボットの目として使うカメラには関係ない。SIMをメイン携帯として使う必要がなくてもWi-Fiは使える。バッテリーが多少劣化していても、据え置きロボットなら給電しながら動かせる。
電話としての商品価値を失ったスマートフォンが、ロボット部品としてはまだほとんど何も失っていないのである。
GSMAは2023年、家庭やオフィスで使われずに眠っている携帯電話が世界に50億台以上あるとした。2025年の報告では、休眠端末は50億から100億台規模とも見積もられている。
50億台。
これは電子ゴミの山とも言える。
しかし別の見方をすれば、
50億個の、カメラ付き、マイク付き、通信付き、電池付きコンピューター
である。
AI時代には、これは巨大な鉱山ではないか。
しかもその鉱山は、まだ掘る必要すらない。すでにポケットと引き出しの中に、完成品として埋まっている。
なぜAndroidなのか
iPhoneでも似たことはできる。
しかし「ロボットの部品」として見るなら、中古Androidには特有の面白さがある。
AndroidはADBを使ったデバッグ・遠隔操作の仕組みを公式に持つ。USB経由だけでなく、ネットワーク越しにADB接続する仕組みも公式ドキュメントに存在する。
さらにTermuxがある。
そして現在、llama.cppの公式Androidドキュメントには、Termux上でllama.cppをビルドし、Androidそのものの上でローカルLLMを実行する方法が記載されている。rootさえ必須ではない。
つまり、
Android → Termux → llama.cpp → GGUF
という経路が成立する。
もっとAndroidネイティブに寄せるなら、GoogleのLiteRTがある。
2026年現在、LiteRTはAndroid上でCPU・GPU・NPUを横断したオンデバイス推論を扱うためのフレームワークとして整備され、LiteRT-LMはGemma、Llama、Phi、Qwenなどのモデル、マルチモーダル入力、さらにはツール利用まで対象としている。QualcommのNPUについても、LiteRTからQNNを利用する仕組みが公式に用意されている。
要するに、古いAndroidの中に眠っているGPUやNPUを、AIのためにもう一度使う道が開き始めている。
さらにAndroidはUSB Hostになれる。
Android 3.1以降、端末自身がUSBホストになり、接続されたUSB機器を列挙して通信するAPIが存在する。
ここがロボット化には決定的に重要である。
スマートフォンの中にはGPIOがない。
ならば、外に出せばいい。
Androidを大脳にし、ESP32を脊髄にする
私はこの構造が最も美しいと思う。
┌──────────────┐
│ 中古Android │
│ =頭・顔・人格 │
└──────┬───────┘
│
┌─────────────────┼────────────────┐
▼ ▼ ▼
カメラ マイク SLM
「目」 「耳」 「頭」
│ │ │
└─────────────────┼────────────────┘
▼
世界モデル・Memory
│
「何をする?」
▼
┌────────────────┐
│ ESP32 / MCU │
│ =小脳・脊髄 │
└───────┬────────┘
▼
四足歩行コントローラ
↙ ↓ ↘
Servo Sensor Motor
スマートフォンにモーターのPWMを直接制御させる必要はない。それはマイコンが得意な仕事だ。
Androidは、見る。聞く。考える。記憶する。話す。通信する。目的を決める。
ESP32やRP2040のようなマイコンは、モーターを回す。サーボを動かす。リレーを切り替える。距離センサーを読む。電池電圧を監視する。
そう分ければいい。
構造は生物そのものになる。
Androidが大脳。 マイコンが小脳・脊髄。 モーターとセンサーが身体。
これならスマートフォンを交換しても、身体側を作り直す必要はない。逆に身体を交換しても、スマートフォンの中の人格や記憶はそのまま持っていける。
ここから「Agent Phone」という概念が出てくる。
中古スマホを「エージェントスマホ」として再販する
中古Androidにエージェント環境をあらかじめ入れて販売する。
ユーザーにTermuxを操作させる必要はない。LLMのモデル名も教える必要はない。
電源を入れる。 Wi-Fiにつなぐ。
すると、
「こんにちは。今日からあなたの秘書を担当します」
と話し始める。
そんな商品でいい。
ホーム画面も、普通のAndroidである必要はない。巨大なボタンを四つ並べる。
話す。 見せる。 読ませる。 助けてもらう。
それだけでいい。
大量展開する場合には、Androidには専用端末を特定アプリ中心のキオスク端末として運用する仕組みもある。GoogleのAndroid Management系ドキュメントでは、専用アプリを起動時から全画面で固定するDedicated Device / Kioskの考え方が用意されている。実際の商用利用ではAndroid Management APIの利用資格・用途制限があるため、EMM事業者との連携などを含めた設計が必要だが、「Androidを電話ではなく専用機として管理する」という基盤自体はすでに存在している。
ここでビジネスも変わる。
中古スマートフォンを一台売って終わりではない。
売るのは、端末+エージェント+継続サポートである。
例えば本体を2万円台で販売する。そして毎月、AIモデル更新、エージェント修復、設定変更、バックアップ、新機能、家族設定、リモートサポート、故障時の交換、データ移行を月額で提供する。
つまり中古Androidは商品本体というより、
エージェントとの契約を開始するための身体
なのである。
100歳のおばあちゃんに渡せば「見守りAI」になる
ここから一気に用途が広がる。
例えば100歳のおばあちゃんに一台渡す。
普通のスマートフォンとして渡してはいけない。スマートフォンを操作してもらう発想を捨てる。
その端末自身が話しかける。
「おはようございます」 「今日は金曜日ですよ」 「朝のお薬は飲みましたか」 「娘さんからメッセージがあります」
それだけでもいい。
さらに端末のカメラ、マイク、センサーを使う。
もちろん、高齢者の生活を無制限に録画してクラウドへ送るような仕組みは避けたい。ここでローカルAIが効く。
例えば常時音声を外部送信するのではなく、端末内で、
- 「通常」
- 「転倒らしい音」
- 「長時間反応がない」
- 「助けを呼んでいる可能性」
まで判定する。
異常がなければデータを捨てる。異常が疑われる時だけ家族に通知する。
見守りカメラではない。
会話できる見守りエージェントになる。
しかも端末には4G/5Gがある。自宅Wi-Fiが落ちても通信経路を持つ設計が可能になる。画面もあるから、異常時にはそのまま家族とのテレビ電話端末になる。
ディスプレイに (^_^) のような顔を出せばいい。目線、表情、字幕、テレビ電話まで、全部画面でできる。
例えば100歳のおばあちゃんのところへ歩いてきて、
「おはようございます。今日は金曜日ですよ。朝のお薬は飲みました?」
と言う。返事がなければ近づく。カメラを見る。異常判定する。必要なら家族をテレビ電話で呼ぶ。
これはもう、単なるスマートスピーカーとは全然違う。
**「向こうから会いに来るAI」**になる。
畑に置けば「AI百葉箱」になる
同じスマートフォンを畑に持っていく。
すると今度は、まったく違う生き物になる。
スマートフォン単体でも、カメラ、GPS、時計、通信、加速度、照度、機種によっては気圧が取れる。足りないセンサーは外付けすればいい。
ESP32につなぎ、土壌水分、気温、湿度、CO2、日射、雨量、風速、EC、pHを読む。
するとこれは、単なる百葉箱ではない。
例えば毎朝、同じ場所から作物を撮影する。昨日と比較する。葉色が変わった。虫食いが増えた。成長が止まった。果実の色が変わった。そこへ土壌水分と天気情報を重ねる。
「西側の畝だけ水分低下が速い」 「葉の変色が昨日より拡大している」 「明日も乾燥するので灌水した方がよい」
まで言える。
センサーは数値だけを出す。AIはそこに意味を与える。
つまり、IoT百葉箱から、農業エージェントへ進化する。
同じスマホを動かした瞬間、ロボットになる
百葉箱までは動かない。
ならば足を付ければいい。
最初は車輪でもいい。台車にAndroidを載せる。ESP32でモーターを制御する。Androidはカメラを見ながら、「廊下を進め」「人を探せ」「玄関を確認しろ」と高次の目標を決める。これだけでも巡回ロボットになる。
しかし車輪には弱点がある。段差。畑。砂利。家の敷居。階段。
そこで四本足が出てくる。
ドラえもんは本当に二足歩行である必要があるのか
ここからが、この記事のタイトルである。
我々がアニメで知っているドラえもんは二足歩行である。しかしドラえもんは猫型ロボットだ。
もし本当に現実世界で「人間と暮らす小さなAI」を作るなら、本当に二足歩行である必要があるだろうか。
私はむしろ逆だと思う。
現実のドラえもんは、本物の猫に近い四足歩行になる可能性が高い。
理由は単純だ。
二足歩行は難しい。重心が高い。倒れる。制御が難しい。転倒した時の衝撃も大きい。
一方、小型四足なら重心を低くできる。人間の生活空間にも入りやすい。
猫くらいのサイズが、非常に重要である。人型を最初から作る必要がない。
猫くらいなら、
- 家の廊下を通れる
- ベッドの横まで来られる
- 畑を歩ける
- 階段への対応も狙える
- 車に載る
- 高齢者宅を巡回する
- 机の下へ入る
- 充電場所へ自分で戻る
という「生活圏への侵入能力」が非常に高い。
つまりロボット工学的には、二足歩行より四足歩行の方が、先に家庭エージェントを成立させやすい。
そしてこれは、遠い未来の機械ではない。
Petoiの小型四足ロボットBittleは約200×110×110mm、重量265〜290gというサイズで既に市販されている。Bittle Xでも190×153×107mm程度、269〜353gだ。メーカーによればBittle Xの積載能力は約1ポンド、約450gとされている。つまり機種次第では、スマートフォン一台を載せること自体、物理的には十分視野に入る。
Mini Pupperのようなオープンソース四足ロボットもあり、ROS、SLAM、ナビゲーション、OpenCVを扱う学習・開発プラットフォームとして公開されている。
つまり、「猫サイズの四足歩行機械を作る」部分さえ、もうゼロから発明する必要がない。
Androidを猫の背中に載せる
ここで二つの技術が合流する。
一方には、数千円から数万円で手に入る中古Androidがある。もう一方には、小型四足ロボットの機構、サーボ制御、ROS、SLAMなどの技術がある。
ならば、Androidを四足ボディの頭脳として載せればいい。
Androidは、目、耳、口、人格、長期記憶、ネット接続、位置、高次判断を担当する。
四足ボディ側のマイコンは、歩行周期、脚の角度、姿勢制御、サーボ、転倒検知を担当する。
こうすれば、LLMに毎秒何百回もモーター制御を考えさせる必要はない。
人間も「右大腿四頭筋を今0.3秒だけ何ニュートンで収縮させよう」などと意識しない。「冷蔵庫まで歩こう」と考えるだけだ。身体の細かな制御は下位神経系が行う。
ロボットも同じでいい。
そしてスマホ自身が「顔」になる。これも大きい。
ディスプレイに顔を出せばいい。目線、表情、字幕、テレビ電話まで全部画面でできる。高価なアニマトロニクスの顔を最初から作る必要はない。すでに量産済みのディスプレイが、顔になる。
「向こうから会いに来るAI」
ここでAIの性質そのものが変わる。
最大の差は、身体を持つことである。
今のChatGPTは基本的に、人間がAIを呼ぶ。スマートフォンを取り出す。アプリを開く。質問する。AIが答える。
あなた → AIを呼ぶ
しかし四足歩行するエージェントなら逆転する。
AI → あなたを探す
ここは決定的である。
例えば14時に予定がある。スマホの通知なら見逃す。四足エージェントなら別室まで歩いてくる。
「玉川さん、14時から予定があります」 「14時から病院です。そろそろ出た方がいいですよ」
と言う。
玄関が開いていた。見回り中のエージェントが気づく。本人のところへ歩いてくる。「玄関が開いています」と言う。
100歳のおばあちゃんが寝室にいる。朝になっても動きがない。エージェントがベッドまで見に行く。名前を呼ぶ。反応がなければ家族へ連絡する。
さらに、「畑の西側の葉がおかしい」と自分で見つけて戻ってくる。
これはスマートスピーカーではない。監視カメラでもない。
自分から状況を見に行ける存在である。
ここで「エージェント」という言葉が、本当の意味を持ち始める。AIが能動的存在になる。
本当の「ドラえもん化」に必要な6段階
私はこう見る。
第1段階:会話する スマホだけ。今、すでにここにはいる。
第2段階:見る・聞く カメラ、マイク、Vision。端末の中に、すでに目と耳がある。
第3段階:記憶する 家族、家、予定、習慣、畑などを長期Memory化する。ここから「知っている存在」になる。
第4段階:歩く 猫型四足ボディ。ここまで来れば、伴侶型AIとしてかなり成立する。
第5段階:物を操作する ここが現在の大きな壁である。小型アームや口のようなグリッパーを付けて、落ちたものを拾う、リモコンを持ってくる、ドアを押す、小物を運ぶ、までできるようになる。
第6段階:自分で生きる これが本当の転換点である。
バッテリー減少
↓
自分で充電器を探す
↓
充電
↓
アップデート
↓
故障診断
↓
必要なら人間へ修理依頼
ここまで来ると、かなり「生物」に近くなる。
ここまで来れば、「ドラえもんの入口」にはかなり近い。だが、まだドラえもんそのものではない。
ドラえもんは、主人を知っている。過去を知っている。困っていることを知っている。自分からやって来る。話せる。見える。移動できる。現実世界に介入できる。
小型SLM+永続Memory+中古Android+猫サイズ四足+簡単なマニピュレータまで揃うと、「ポケットから何でも出す能力」を除けば、ドラえもんの機能構造はかなり見えてくる。
しかも興味深いのは、それを最初から数百万円のロボットとして作るのではなく、1万円の中古Androidを中核として段階的に身体を追加できることだ。ここに大量普及の可能性がある。
ドローンとの組み合わせは、さらに面白い
「四足ロボットそのものを飛ばす」必要すらない。
例えば、
Drone
│
輸送する
↓
┌─────────────┐
│ Agent Cat │
└─────────────┘
│
着地
↓
歩いて探索
という母艦+地上ロボット構成ができる。山林、農地、災害現場などではかなり合理的である。
あるいは反対に、
四足ロボット
↓
小型ドローン発進
↓
上空偵察
↓
映像をAndroidへ
↓
四足ロボットが移動
でもいい。
すると一個のエージェントに、地上の身体と空中の目を持たせられる。
この時も役割を分けるべきだ。Androidに直接ローターをマイクロ秒単位で制御させる必要はない。
ドローン分野では既に、フライトコントローラーとは別に「Companion Computer」を載せ、高度な画像処理や判断だけを担当させる設計が一般的に使われている。ArduPilotの公式ドキュメントでも、Companion ComputerがMAVLinkを通じてオートパイロットと通信し、GPS情報などを受け取り、「特定座標で写真を撮る」といった高次判断や高度なセンサー処理を行う構成が説明されている。
つまりAndroidを、飛行制御装置ではなく、ドローンの知能として載せる発想にも、既存技術との連続性がある。
例えば、「北側の畑へ行け」「指定地点で着陸しろ」「葉の病変を確認せよ」という目的をAndroid側が決める。姿勢制御そのものはPixhawkなどのフライトコントローラーに任せる。地上へ降りた後は四足ボディへ移る。
一個の人格が、空を飛び、地面を歩き、人と話す。
そんな構成まで見えてくる。
四足ロボットをドローンで運べば、行動圏は家から世界へ広がる。山。農地。災害現場。人間が簡単には行けない場所まで飛ばす。ドローンが着陸する。四足ロボットを降ろす。そこから地上を歩く。
スマホは交換可能な「身体の一部」になる
ここで、ロボットそのものの考え方も変わる。
例えばPixel 6が壊れた。ではロボットを捨てるのか。
そうではない。
Pixel 8へ交換する。記憶を復元する。エージェント設定を戻す。声を戻す。人格を戻す。すると同じ存在が戻ってくる。
つまり、AIそのものと、AIが現在使っている身体を分離する。
机の上では、スマートフォンだけで話す。外出時にはポケットへ入る。家では四足ボディに装着する。畑ではセンサーDockへ装着する。空を飛ぶ時にはドローンへ装着する。
同じ人格。同じ記憶。違う身体。
これはかなりドラえもん的である。
Agent Coreという商品
だから将来の商品名は「AIスマホ」より、Agent Coreの方が本質に近いかもしれない。
中古Android一台を、エージェントの共通コアとして標準化する。そして身体をオプション化する。
Agent Core
中古Android
│
┌───────────┼────────────┐
▼ ▼ ▼
卓上Dock 四足Body Drone
3万円 10万円 ?
│ │
└─────同じ人格─────┘
四足歩行機を売る必要はない。「身体」をオプション化する。
- Elder Body … 高齢者見守り用
- Farm Body … 畑の百葉箱・農業観察用
- Home Body … 家庭内巡回用
- Quadruped Body … 四足歩行用
- Drone Adapter … 空中移動用
- Shop Dock … 店舗受付用
- Secretary Dock … 秘書・業務端末用
中身のエージェントOSは同じ。ユーザーが買うのはロボットごとではない。一人のエージェントに、必要な身体を買い足していく。
これはPC周辺機器に近い。あるいはゲーム機本体と周辺機器に近い。
昨日までは机の上にいたAIを、スマホごと四足Bodyへ装着する。すると、同じ記憶、同じ声、同じ人格のAIが突然歩き始める。これは商品体験として相当強い。
そして本当の収益源は身体ではない。
そのエージェントを何年も面倒を見るサブスクリプションになる。
中古スマホ屋ではなく「AI再生工場」
大量の中古Androidを仕入れる。検品する。バッテリーを見る。カメラを見る。マイクを見る。USBを見る。初期化する。Agent OSを入れる。用途別Skillを入れる。ケースを付ける。IDを振る。出荷する。
すると、中古スマートフォンが、AI労働端末に変わる。
これはリファービッシュの次の段階だ。
通常のリファービッシュは、「古いスマートフォンをもう一度スマートフォンとして使う」発想である。ここでは違う。
スマートフォンだった機械を、別の生物へ転生させる。
GSMA自身も端末の再利用・再生・循環利用を大きな市場として位置付けている。2025年2月の報告では、より循環型のデバイス・サービス市場が2027年までに1500億ドルを超える可能性を示している。
しかしAIによる用途転換まで含めれば、「再使用」の意味そのものがもっと広がるかもしれない。
電話としてもう一度売るのではない。目と耳と口と通信機の塊として、別の仕事を与える。画面が割れていてもいい。最新OSが来なくてもいい。電話帳が要らなくてもいい。
市場が捨てた価値を、エージェントが拾う。
なぜ今までこれをやらなかったのか
理由は単純である。
スマートフォンに、目も耳も口も頭脳もあった。ただし、それらを結びつけて自律行動させる知能が足りなかった。
カメラは写真を撮るためのものだった。マイクは電話するためのものだった。GPSは地図を見るためのものだった。加速度センサーは画面を回転させるためのものだった。NPUは写真補正や一部のAI機能に使われた。
それぞれは存在していた。
しかし生成AI以前には、「見たものを理解し、記憶と照合し、目的を決め、道具を使い、人間へ説明する」統合層が弱かった。
SLMとエージェント技術が、そこを埋め始めている。GoogleのLiteRT-LMが現在、マルチモーダル入力とツール利用まで明示的に対象としていることは象徴的だ。
スマホのハードウェアが突然進化したのではない。
既にあったスマホに、「人格と意思決定」を入れられるようになってきた。
ただし、本物のドラえもんまでにはまだ壁がある
ここは冷静に見なければならない。
一番難しいのは会話ではない。歩くことでもない。
おそらく、手である。
人間の生活環境は手を前提に作られている。ドアノブ。蛇口。ペットボトル。薬。食器。引き出し。鍵。服。これらを操作するには、かなり高度なマニピュレーションが必要になる。
だから最初の「ドラえもん」は、何でもできる必要はない。
見に行ける。話せる。知らせられる。記録できる。小物を運べる。そこから始めればいい。
小型四足機向けにも、簡単なアームやクローは既に試されている。PetoiはBittle向けに小型のロボットアーム/グリッパーを提供しており、市販キットの範囲で把持の実験が始まっている。
ティッシュを持ってくる。薬袋を運ぶ。鍵を運ぶ。これだけでも高齢者には価値がある。
そしてその先に、第6段階がある。自分で充電器を探す。自分で戻る。自分で更新する。自分で壊れたと申告する。
ここまで来ると、かなり「生物」に近くなる。
24時間AIという最初の話に戻る
ここで最初の低電力SLMの話へ戻る。
なぜ小さなモデルが重要なのか。ロボットに70Bモデルを常時動かす必要がないからだ。
例えば高齢者見守りなら、「人の声がしたか」「転倒らしい動きか」「いつもの行動と違うか」という一次判定は小モデルでいい。OCRならOCRモデル。音声認識ならSTT。物体検出ならVision。単純な文章分類なら数億〜数Bパラメータ。それでも判断できない時だけ上位モデルへ送る。
つまり、小さな知能を常時動かし、大きな知能を必要時だけ呼ぶ。
この構造が、家庭内AIにもロボットにも向いている。
これは人間の脳にも少し似ている。我々は歩くたびに論理推論をしているわけではない。ほとんどは無意識で処理する。難しい時だけ深く考える。
AIも同じ階層構造にすればいい。
末端のAndroidは、いつもそこにいる小さな神経節である。家の中の大きなマシンやクラウドは、必要な時だけ呼ばれる大脳皮質である。ESP32は脊髄である。サーボは筋繊維である。
この階層を、最初から巨大な一体型ロボットとして作る必要はない。すでに量産された部品を、神経系として再配置すればいい。
本当の革命は「性能」ではなく「量産済み」である
AI業界はどうしても、GPUが何TFLOPS、NPUが何TOPS、モデルが何B、ベンチマーク何点、という話になりがちである。
しかし中古Android構想で最も重要なのはそこではない。
すでに作られてしまっていることである。
世界中の工場が、カメラ、マイク、センサー、ディスプレイ、通信機、バッテリー、SoC、放熱機構、アンテナ、筐体を何年もかけて改良し、十億台単位で生産し、人間のポケットに配った。
その社会的投資は既に終わっている。
我々は、その減価償却済み資産を、AI時代にもう一度使える。
これは新品のロボットを一から作るのとは、経済構造が違う。
未来の安い家庭用ロボットは、未来のために作られた高価なロボット部品から生まれるとは限らない。
過去にスマートフォンとして大量生産された部品を再解釈することで生まれる可能性がある。
部品を新しく買えば高い。完成品を中古で買えば異常に安い。その差は、十億台の量産が生んだ歪みである。AIはその歪みの上に乗れる。
「実際のドラえもん」は四足歩行だった
最後にもう一度、ドラえもんへ戻ろう。
漫画のドラえもんは二本足で歩く。それは人間に似たキャラクターとして描くには合理的だった。
しかし工学的に作るなら、話は違う。
現実の猫は四本足で歩く。低い。安定している。狭いところへ入れる。多少の凹凸も越えられる。人間の邪魔になりにくい。
そして何より、人間は猫や犬が家の中を自由に歩いていることに、心理的な違和感が少ない。
だから「一家に一台のAI」が最初に身体を持つなら、身長150cmの人型ロボットより、猫くらいの大きさの四足AIの方がはるかに自然かもしれない。
朝、ベッドの横まで歩いてくる。「おはよう」と言う。出かける時間を教える。留守中は家を見回る。畑へ連れて行けば作物を見る。必要ならドローンで別の場所へ運ばれる。充電が減れば、自分でDockへ帰る。
スマートフォンを交換すれば、数年後には脳だけ性能が上がる。
そして昨日まで机の上に置いてあったエージェントと、今日、四本足で歩いてくるエージェントは、同じ記憶を持ち、同じ声で話し、同じ人格で自分の名前を呼ぶ。
その瞬間、人間にとって重要なのは、中に入っているモデルが3Bなのか8Bなのかではなくなる。
**「あいつが来た」**になる。
それが、AIがソフトウェアから存在へ変わる境目だと思う。
ドラえもんまでの道のりは、遠い未来の巨大ロボット研究所から始まるのではないのかもしれない。
世界中の引き出しに眠っている、画面の割れたPixel。使わなくなったGalaxy。古いXiaomi。古いAQUOS。そんな数千円のAndroidから始まる。
スマートフォンは電話として古くなった。
だが、目としてはまだ見える。耳としてはまだ聞こえる。口としてはまだ話せる。頭脳としては、むしろAIによって今からもう一度若返る。
そこへ四本の足を付ける。
最初の本物のドラえもんは、二足歩行ではないかもしれない。
実際の猫と同じように四本足で、家の中をちょこちょこと歩き回っている。そしてその背中には、かつて誰かが電話として使っていた中古Androidが載っている。
私は、その未来の方がずっと現実的だと思っている。