← Back to Home
AI ·

M5 MAX 128TB統一メモリとComfyUI——VLMが「絵を読む」とき、AGI作画は何を変えるのか

M5 Maxの超大容量統一メモリとVLM(Vision Language Model)のComfyUI統合が、AGI作画パイプラインに何をもたらすのか。現在のM1 Max 64GB環境との比較から未来像までを描く。

M5 MAX 128TB統一メモリとComfyUI——VLMが「絵を読む」とき、AGI作画は何を変えるのか

M5 MAX 128TB統一メモリとComfyUI——VLMが「絵を読む」とき、AGI作画は何を変えるのか

元記事: https://note.com/famous_prawn2009/n/na254aeeaf2cf

現在地:M1 Max 64GBの壁

私のメイン環境はM1 Max(64GB統一メモリ)だ。ComfyUIでFLUX / SD3.5 / WanVideoを動かし、note記事のアイキャッチと挿絵を自動生成するパイプラインが日夜稼働している。

しかし、ここには明確な限界がある。

できていること:

  • SDXL/FLUXによる1280×672の高品質画像生成(1枚30秒〜2分)
  • ComfyUIワークフローによるバッチ生成とパイプライン自動化
  • テキスト→画像の完全自動チェーン

できていないこと:

  • 生成した画像をAI自身が「見て」評価し、修正するフィードバックループ
  • 70BクラスのVLM(Vision Language Model)の同時起動
  • 作画モデル+評価モデル+LLMの常時メモリ確保
  • 大量LoRA / ControlNetをメモリ制限なしで使い分ける自由

M5 Maxの超大容量統一メモリが変える前提

M5 Maxの超大容量統一メモリは、Apple Siliconのunified memoryアーキテクチャの決定的な進化を意味する。CPUとGPUが物理的に同じメモリ空間を共有する以上、容量が増えれば増えるほど「コピーゼロのデータ共有」が大規模に効く。

① 複数モデルの常時ロードが可能に

現在はFLUXかSD3.5のどちらか一方しか載せられない。M5 MaxならFLUX・SD3.5・WanVideo・Qwen2.5-VL 72Bをすべて同時に保持できる。モデル切り替えのオーバーヘッドがゼロになる。

② VLMがComfyUIに「目」を与える

Qwen2.5-VLやLlama 3.2 VisionをComfyUIのカスタムノードとして統合すると、生成パイプラインが根本的に変わる。

(現在)Text → ComfyUI → Image [完]
(未来)Text → ComfyUI → Image → VLM評価 → プロンプト修正 → 再生成

「青い空を赤い夕焼けに変えて」という指示を、VLMが実際の出力画像を見て「青い領域を特定し、マスクして赤に置換」するControlNetに渡す——これがノードベースの接続で実現する。

何ができるようになるのか

Before/Afterを対比する。

できない(M1 Max 64GB)できる(M5 Max + VLM)
画像をAIが判断できない出力を見て「崩れている。再生成」と自己修正
モデル1つしか載せられない作画+評価VLM+音声モデルを同時起動
LoRA切り替えに時間がかかる全LoRAをメモリに載せて瞬間スワップ
パイプラインが一方通行フィードバックループを持つ自律生成サイクル
人のレビューが必要VLMが文脈・構図・品質を自動判断

本当の革新:AIが自分の絵を批評するループ

最大の変化は自己修正ループの獲得だ。

人間の画家は描いた絵を見て「ここが違う」と判断する。現在のテキスト→画像生成にはそのフィードバックがない。VLMをComfyUIに統合することで、機械が自分の出力を「見て」判断し、次のプロンプトやパラメータを自動調整するサイクルが手に入る。

これは単なる品質向上ではない。作画AIが創作者としての自己反省機能を得るという質的転換だ。

具体的なユースケース:

  • キャラクターの一貫性維持:VLMが出力を見て「髪色が前回と違う」と検出し、同一性を保つLoRAを自動適用
  • 構図評価:三分割法・被写体の位置・視線の誘導をVLMが採点し、低スコアならControlNetで再構成
  • 記事文脈チェック:生成画像が記事の内容と合致しているかをVLMが確認。AGI瓦版のレビュアー工程と統合

一人出版社への実装ロードマップ

M5 Maxが来たら、以下の順で実装を進める。

  1. ComfyUIにQwen2.5-VL 72BのGGUF版をノードとして追加(llama.cppバックエンド、MPS対応確認済み)
  2. 評価→修正のフィードバックループをワークフローとして組む(VLM出力を次の生成の条件入力に変換)
  3. noteパイプラインと統合:レビュアー工程をVLMの実画像評価に置き換え
  4. 全モデル常時ロード環境でAGI瓦版の全作画を自動化

このロードマップの詳細と実装結果は、AGI瓦版 第5号以降で順次公開する。

まとめ

M5 Maxの超大容量統一メモリは、ComfyUIを「絵を描くツール」から「絵を理解し批評し改善するクリエイター」に進化させる基盤となる。VLM統合はその核心であり、一人出版社のAGI作画パイプラインを次世代へ押し上げる。

次のマシンが来たら、私はこの環境をフルスペックで構築する。そして、その全知見をAGI瓦版の読者と共有していく。


元記事: https://note.com/famous_prawn2009/n/na254aeeaf2cf