メインコンテンツへスキップ
← ブログに戻る
チュートリアル2026年2月24日by K.hirano

ComfyUI + FLUX.1-devでローカル画像生成——ノードエディタは難しいのか検証

RTX 4070 Ti(12GB)にComfyUI v0.12.3 + FLUX.1-dev fp8を入れて実際に画像生成。VRAM実測6.9GB、ノードエディタの構造、fp8量子化の選び方まで正直に記録。

#ComfyUI#FLUX.1-dev#AI画像生成#GPU#VRAM#ローカルAI#RTX 4070 Ti#flux-1-dev

RTX 4070 Ti(12GB VRAM)に ComfyUI v0.12.3 + FLUX.1-dev fp8 を入れて動かした記録。VRAM実測 6,892MiB、生成は512×512で1分以内。ノードエディタは思ったより難しくなかった。

関連記事としては gemma4 12BはどのGPUで動く?実測3点+主要18枚の速度早見表【VRAM 8GBは崖の縁】Bloggemma4 12BはどのGPUで動く?実測3点+主要18枚の速度早見表【VRAM 8GBは崖の縁】gemma4 12Bを手持ちGPUで動かす判断材料を、VRAM別・実測3点・主要18枚の速度早見表で整理。8GBの限界も明確にします。 もあわせて読むと、今回の論点とのつながりを把握しやすくなります。

項目
GPURTX 4070 Ti 12GB
モデルFLUX.1-dev fp8
VRAM使用量約6.9GB
解像度/steps512×512 / steps=15
難易度セットアップさえ通れば普通

目次

FLUX.1-devを選んだ理由 {#flux1-dev}

Flux.1を試したらStable Diffusion 1.5に戻れなくなった件BlogFlux.1を試したらStable Diffusion 1.5に戻れなくなった件画像生成の新境地、Flux.1を使った体験記。Stable Diffusion 1.5との違いや必要VRAM、使い勝手を徹底比較!でも書いたとおり、今さらSD1.5に戻る気はない。FLUX.1系のモデルが出てから、それ以前の生成物を見るのがしんどくなってしまった。

問題はVRAMです。FLUX.1は重い。fp16フルモデルで20GB以上使うため、RTX 4090でなければ素直に動かせない。ここで登場するのがfp8量子化版。精度を落として軽量化したモデルで、RTX 4070 Ti(12GB)でも約6.9GBで動作します。

今回使ったのは flux1-dev-fp8.safetensorsFLUX.1-dev fp8 — Hugging Face)。生成テスト(512×512 / steps=15 / euler sampler)は特に詰まることなく完了しました。

ComfyUI v0.12.3 の新しいUIについて {#ui}

最近のComfyUIはバージョン0.12.x以降でインターフェースが大きく変わっている。新しい左サイドバーが追加され、モデル管理とワークフロー管理が整理された。

ComfyUI ノードエディタ全体(KSampler/CLIP/VAE接続済み)

従来の「画面中央に浮かぶUIウィンドウ」から、IDEに近いレイアウトへの変化。Model Libraryパネルからは checkpoints/loras/diffusion_models/ といったフォルダが一望でき、モデルの切り替えが以前より格段に楽になった。

ComfyUI Model Library パネル

ComfyUI vs AUTOMATIC1111:2026年に画像生成を始めるならどっちかの結論BlogComfyUI vs AUTOMATIC1111:2026年に画像生成を始めるならどっちかの結論画像AIを始めるならComfyUIとAUTOMATIC1111どちらがベストか?初心者目線で両者の違いを解説します。でも触れたが、ComfyUIの本質はワークフローの自由度にある。何をやっているかが視覚的に見える構造は、慣れると「ブラックボックスで動くWebUI」より信頼できる感覚がある。

ノードエディタの実態 {#node}

初見だと確かに圧倒される。でも基本的な画像生成ワークフローは、以下のノードで完結します。

  • CLIP Text Encode — プロンプト入力
  • KSampler — 推論エンジン
  • VAE Decode — 潜在空間→画像変換
  • Save Image — 出力

これらが線で繋がっているだけ。「CLIPでプロンプトを解釈 → KSamplerで画像の潜在表現を生成 → VAEで画像に変換」という処理の流れが、そのまま目に見える形になっている。

右クリックメニュー(Add Node / Add Group)

右クリックでノードを追加でき、種類も豊富です。LoRA適用、アップスケール、インペイント——それぞれが独立したノードとして存在し、繋ぎ方次第で挙動が変わる。最初は「どこを変えると何が変わるの?」と思いながら動かしていたが、変えた部分だけ結果に反映されるのがわかってくると面白くなってくる。

RTX 4070 Ti 12GBでの実測 {#vram}

nvidia-smiで確認したVRAM使用量は 6,892MiB(12GBのうち約6.9GB)。

nvidia-smi: RTX 4070 Ti / 6892MiB使用

FLUX.1-dev fp8は想定通りの消費量で、残り約5GBの余裕がある。512×512でsteps=15、euler samplerなら1分かからず生成が終わります。

生成完了後の画面

2026年版・Stable Diffusionを快適に楽しむためのVRAM別完全攻略ガイドBlog2026年版・Stable Diffusionを快適に楽しむためのVRAM別完全攻略ガイドStable Diffusionを動かすためのVRAM別ガイド。8GB/12GB/16GBのGPUで何ができるか具体的に解説します。にも書いたとおり、FLUX.1系を快適に動かすには8GB以上が現実的な最低ライン。fp8量子化のおかげでRTX 4060(8GB)から動くが、512×512を超える解像度を扱うなら12GB以上のほうが余裕があります。VRAMが足りるかどうかの判断は GPUランキング のスペック欄が参考になります。

気になった点 {#cons}

ポートが8188固定。Linuxサーバーで他のサービスと共存させる場合、環境変数 COMFYUI_PORT で変えるかNginxでリバースプロキシを噛ませる必要がある。細かい話ではあるが、複数のAIサービスを同居させていると最初に詰まるポイントです。

起動が遅い。モデルをロードして最初のリクエストに応答できる状態になるまで30〜60秒かかる。常時起動前提なら問題ないが、オンデマンドで起動する構成は向いていない。

日本語プロンプトは厳しい。FLUX.1自体が英語プロンプトで訓練されているため、日本語で入れると精度が落ちる。英語で書くか、翻訳を間に挟む運用が基本になります。

よくある質問 {#faq}

RTX 3060(8GB)でも動きますか? FLUX.1-dev fp8は最小8GBから動作します。ただし512×512が実用的な上限で、768×768以上だとVRAM不足でクラッシュする可能性があります。余裕を持って動かすなら12GB以上を推奨します。

SD XLとFLUX.1-dev、どちらが重いですか? FLUX.1-dev fp8(約6.9GB)とSD XL(約6-7GB)はほぼ同等です。ただしFLUX.1はsteps数を減らしても品質が落ちにくいため、生成時間はむしろ短縮できます。

ComfyUIとAUTOMATIC1111はどちらが初心者向けですか? 操作の分かりやすさならA1111ですが、設定の細かい制御はComfyUIが上。最初の画像を出すだけならComfyUI vs AUTOMATIC1111:2026年に画像生成を始めるならどっちかの結論BlogComfyUI vs AUTOMATIC1111:2026年に画像生成を始めるならどっちかの結論画像AIを始めるならComfyUIとAUTOMATIC1111どちらがベストか?初心者目線で両者の違いを解説します。です。

LoRAは使えますか? 使えます。Model LibraryにLoRAフォルダが表示されており、LoRA Loaderノードを追加して繋げるだけです。

まとめ {#summary}

ComfyUIは「難しいツール」というより「自分でワークフローを設計するツール」だった。最初のセットアップさえ通れば、基本的な画像生成はすんなり動く。FLUX.1-dev fp8なら12GBのGPUで十分実用になります。

解像度を上げたり、LoRAを重ねたりし始めると話は変わってくるが、入門としては悪くない組み合わせだと思う。

ノードエディタの自由度に慣れると、WebUIに戻りづらくなる。処理の全体像が見えている安心感は、使い込むほど効いてくる。AIツールの世界は「便利に隠す方向」と「透明に見せる方向」に分かれていて、ComfyUIは明らかに後者だ。どちらが好きかは人によると思うが、自分は見えているほうが落ち着く。それが正直なところです。

関連記事

関連リンク

  • 実際の構成を探すなら、GPU 比較ページやローカルLLM向け構成記事もあわせて見ると判断しやすいです。
  • ハードウェア候補は用途別の AI 構成ガイドからたどると、単体製品より違和感なく検討できます。

この記事を書いた人

HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!

結論、RTX 3070 の買い替え先は RTX 5070 から——RTX 5060 Ti は 11% 差、RTX 4060 Ti はむしろ遅い
NEW
2026年9月12日
事例紹介

結論、RTX 3070 の買い替え先は RTX 5070 から——RTX 5060 Ti は 11% 差、RTX 4060 Ti はむしろ遅い

合成ベンチでは横並びに見えるRTX 3070・4060 Ti・5060 Tiを、1440p実ゲーム相対性能と消費電力で比較します。

#GPU#RTX 3070#RTX 5070#RTX 5060 Ti#自作PC
Gemma 4 26B A4B vs Ornith 1.5、12GBの答えはどちらか
2026年8月30日
開発ログ

Gemma 4 26B A4B vs Ornith 1.5、12GBの答えはどちらか

VRAM 12GB の RTX 4070 Ti で Ornith 1.5 9B と Gemma 4 26B A4B を同条件比較。速度 80.0 対 72.9 tok/s、VRAM は 5.9GB 対 11.6GB で Ornith が優位、コーディングは 60点満点で 26B を上回りました。一方 24問テスト総合は 199 対 220 で日本語力に差。長考の末に無回答となる症状は両モデル共通でした。

#ローカルLLM#Gemma#Ornith#llama.cpp#GPU
Gemma 4 26B A4B 実測:12GBのGPUで72.9 tok/s、24問テストは過去最高スコア
2026年8月30日
開発ログ

Gemma 4 26B A4B 実測:12GBのGPUで72.9 tok/s、24問テストは過去最高スコア

VRAM 12GB の RTX 4070 Ti で Gemma 4 26B A4B を実測。llama.cpp の --cpu-moe を -ncmoe 9 に変えるだけで 35.0 → 72.9 tok/s になり、12B を全部GPUに載せた 58.6 tok/s を上回りました。24問テストは 220/240 でランクS。長考時に空応答を返す弱点もあわせて記録しています。

#ローカルLLM#Gemma#llama.cpp#GPU#gemma-4
Qwen3.8-27B、16GBカードは買いか——実用下限は24GB
2026年8月19日
開発ログ

Qwen3.8-27B、16GBカードは買いか——実用下限は24GB

Qwen3.8-27Bを12/24/32GB GPUで実測。16GBに載らない理由と、買い替えの判断基準を整理します。

#Qwen3.8-27B#VRAM#GPU#ローカルLLM#ベンチマーク

関連AIツール

META-MARK × AI

ローカルAIを動かすGPU、ちゃんと選べていますか?

VRAM・性能・コスパをMetaScoreで数値化。AIアプリ別の推奨ハードウェア要件も確認できます。