メインコンテンツへスキップ
← ブログに戻る
チュートリアル2026年9月25日by K.hirano

MiniMax H3はつなぎ目が飛ぶのに直せる——同seedで構図維持

RTX 4070 Ti 12GB で MiniMax H3 の動画を 40 秒まで延ばした実測。1 本の上限 15 秒を続きを生成する追加ノードでつなぎ、つなぎ目の構図飛びは同じ seed のまま指示文 2 行で解消、スワップ枯渇は区間を分けて回避した。

#MiniMax H3#ComfyUI#動画生成#ローカルAI#RTX 4070 Ti

こんにちは、META-MARK 管理人です。

Part1 では、MiniMax H3 を RTX 4070 Ti(VRAM 12GB)で動かし、5 秒の音声付き動画を 1 本 35 秒前後で作れることを確かめました。Part2 では、画風を変えても速度がほぼ変わらないことを確かめています。

今回のテーマは「長さ」です。「どこかのパラメータを変えると 40 秒もいける」という話を聞いて、12GB の GPU でどこまで伸ばせるかを試しました。結論から書くと、40 秒は作れました。しかも思った以上に実用的でした。 ただし、そこに至るまでに 2 つの壁がありました。

1 本で作れるのは 15 秒まで

まず、1 回の生成でどこまで長くできるかです。H3 の学習範囲は 124〜362 コマ(24fps で約 5〜15 秒)です。ComfyUI の設定上はもっと長い値も入力できますが、15 秒を超える長さは学習されておらず、品質の保証がありません。

そこで、学習範囲の中で長さを変えて測りました(SLA あり・4 steps・音声付き)。

長さ解像度生成時間予備メモリ(スワップ)の最大
5 秒960×544約 35 秒約 5GB
10 秒960×54489 秒5.1GB
15 秒960×544139 秒6.4GB
10 秒1152×640132 秒6.2GB

15 秒でも破綻しませんでした。「カップを持ち上げる → 置く → カウンターを拭く → 手を振る」という 4 つの動作を、最後まで順番どおりにこなしています。生成時間は、長さにほぼ比例して延びました。

15 秒の動画から約 2 秒おきに取った 8 コマ。ロボット店員がカップを持ち上げ、置き、カウンターを拭き、手を振る

1 回で作った 15 秒(960×544・生成 139 秒)

ここで分かったのは、12GB の機械の本当の限界は、GPU のメモリではなくメインメモリだ ということです。VRAM はどの長さでも約 11.7GB で頭打ちになります。ComfyUI は、GPU に載りきらないぶんをメインメモリへ逃がすからです。その結果、メインメモリ 32GB に加えて、SSD 上の予備メモリ(スワップ 8GB)まで使い込んでいきます。15 秒の時点で、スワップを 8GB 中 6.4GB 使っていました。

「パラメータで 40 秒」の正体はつなぎ用ノード

では、40 秒はどうやって作るのか。調べてみると、長さの設定を 40 秒にする話ではありませんでした。正体は、有志が作った「続きを生成する」追加ノード です。

今回使ったのは MiniMax H3 Video Extend(kat3ri 氏作)です。前の動画の最後の数コマを「直前の時間」として新しい動画に引き継ぎ、その続きを生成します。前の動画の最後の 1 コマを画像として渡して続きを作る方法(I2V のつなぎ)もありますが、それよりも動きや音が自然につながる、というのが作者の説明です。

このノードは、ComfyUI の本体の一部を、起動時にメモリ上で書き換えて動きます。第三者のプログラムを入れることになるため、中身を読み、外部との通信やコマンド実行がないことを確かめてから導入しました。作者自身も「実物での検証はまだ」と書いているので、結果は目で確かめる前提です。

作り方は「15 秒 → 続きを 15 秒 → さらに続きを 10 秒」で、合計 40.27 秒 です。3 つの区間はそれぞれ別の動作を指示しました。

  1. カップを持ち上げて、飲むふりをする
  2. カップを置き、布でカウンターを拭く
  3. 布をしまい、カメラに手を振ってお辞儀する

1 回目:40 秒はできたが、つなぎ目で「場面が飛んだ」

1 回目は、3 区間を 1 つのワークフローで続けて生成しました。所要時間は 380 秒(約 6 分半) です。メモリ不足で止まることもなく、40 秒の音声付き動画が完成しました。スワップは 8GB 中 7.2GB と、ほぼ限界でした。

ところが、見てみると問題がありました。2 つ目のつなぎ目(25 秒付近)は滑らかにつながっています。しかし 1 つ目のつなぎ目(15 秒付近)では、顔の寄りの画から、数コマで引きの画に切り替わりました。 窓の形やコーヒーマシンなど、店内の様子まで変わっています。まるで編集で場面を切り替えたように見えました。

原因は、2 区間目の指示に「カウンターを拭く」という別の動作と場面の説明を入れたことだと考えました。モデルが、そこで構図を作り直してしまったわけです。

2 回目:指示を 2 行足して、つなぎ目を直す

そこで、乱数の種(seed)は 1 回目と同じにしたまま、次の 2 点だけを変えました。

  • 2 区間目以降の指示を「Continuing the same shot:(同じカットの続き)」で始め、末尾に「同じ寄りの構図・同じロボット・同じ店内のまま、1 カットで、切り替えなし」と明記した
  • 引き継ぐコマの量(context_frames)を 2 から 4 に増やした

結果ははっきりしていました。1 つ目のつなぎ目でも、寄りの構図と店内がそのまま保たれ、カップを置いて拭く動作へ自然に続くようになりました。つなぎ目の破綻は、パラメータより指示文で直る部分が大きい というのが、今回いちばんの収穫です。

1 回目(左)と 2 回目(右)を、40 秒まるごと左右に並べた動画です。15 秒付近で、左だけ画面が引きに切り替わります。

動画を再生できない環境向けに、つなぎ目の前後のコマも並べておきます。

つなぎ目前後のコマを 4 段に並べた画像。上 2 段が 1 回目、下 2 段が 2 回目。1 回目は 15 秒付近で構図と背景が変わり、2 回目は保たれている

15 秒・25 秒付近のつなぎ目前後のコマ(上 2 段:1 回目/下 2 段:2 回目)

2 つ目の壁:メモリが尽きたので、区間を分けた

ただし、2 回目では別の壁に当たりました。引き継ぐコマを増やしたぶんメモリの使用量が増え、3 区間目の途中で、スワップ 8GB を使い切った のです。

この事態を見越して、スワップの使用量が 7.7GB を超えたら生成を自動で中断する見張り役を、横で動かしていました。これが働いて処理は止まり、マシンにも異常は出ていません。1・2 区間目の動画も保存できていました。

そこで作り方を変えました。3 区間目だけを、ComfyUI を再起動したまっさらな状態で、別に生成する 方式です。2 区間目の最後の 5 秒(124 コマ)を切り出して読み込ませ、その続きを作ります。この追加ノードには、既存の動画を読み込んで引き継ぐための変換ノードも用意されています。3 区間目は 125 秒で完成し、スワップの最大は 6.3GB に収まりました。

区間ごとにメモリがリセットされるので、この方式なら 40 秒を超えて延ばすことも可能 です。目安は、15 秒の区間 1 つあたり 2〜2.5 分です。

完成した 40 秒(2 回目)の動画です。H3 は映像と同時に音も生成します。各区間の指示には「カフェのジャズと雨音」を入れました。つなぎ目で音がどう聞こえるか、ぜひ耳で確かめてみてください。

完成した 40 秒の動画から 4 秒おきに取った 10 コマ。カップを持つ、置く、拭く、手を振るまでが同じ店内で続いている

完成した 40 秒(2 回目)の 4 秒おきのコマ

まとめ:12GB でも 40 秒は「実用的」

  • H3 の 1 本の上限は 15 秒です。12GB でも 15 秒までは 1 回で作れました(約 2 分 20 秒)
  • 15 秒を超える長さは、続きを生成する追加ノードでつなぎます。40 秒は約 6〜7 分で作れました
  • つなぎ目の構図飛びは、「同じカットの続き」「構図を保つ」という指示と、引き継ぐコマを増やすことで解消しました
  • 12GB 機の限界は GPU ではなくメインメモリです。長くするなら区間ごとに分けて生成し、スワップを見張るのが安全です

正直なところ、始める前は「40 秒なんて、つなぎ目だらけで使い物にならないだろう」と思っていました。実際には、指示を少し工夫するだけで 1 カットの長回しに見える 40 秒になりました。思った以上に実用的 です。短い CM や SNS 向けの動画なら、12GB の自宅 GPU で十分に作れる時代になったと感じます。

この記事の動画は、すべて MiniMax H3 で AI 生成したものです(元の静止画も画像生成 AI で作ったオリジナルです)。Powered by MiniMax H3.

検証日・環境

  • 検証日:2026-09-24
  • GPU:NVIDIA GeForce RTX 4070 Ti(12GB)/メインメモリ 32GB+スワップ 8GB/Ubuntu 24.04
  • ComfyUI 0.37.0/PyTorch 2.14.0+cu130
  • モデル:Fused Turbo int8(MATLOWAI)+ Qwen3-VL-32B nvfp4 テキストエンコーダ+映像 VAE int8+音声 VAE fp32
  • SLA:H3 SLA Attention ノード(sparsity 0.90・block 64)
  • 延長:ComfyUI-MiniMax-H3-Extend(MiniMaxH3VideoExtendPatched)
  • 生成条件:I2V・960×544・4 steps・seed 42/43/44(区間ごと)

出典

この記事を書いた人

HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!

ComfyUI + FLUX.1-devでローカル画像生成——ノードエディタは難しいのか検証
チュートリアル2026年2月24日

ComfyUI + FLUX.1-devでローカル画像生成——ノードエディタは難しいのか検証

RTX 4070 Ti(12GB)にComfyUI v0.12.3 + FLUX.1-dev fp8を入れて実際に画像生成。VRAM実測6.9GB、ノードエディタの構造、fp8量子化の選び方まで正直に記録。

#ComfyUI#FLUX.1-dev#AI画像生成#GPU#VRAM
RTX 4070 Tiで72秒の紹介動画を自作:クラウド代は声の約3円だけ
チュートリアル2026年9月27日

RTX 4070 Tiで72秒の紹介動画を自作:クラウド代は声の約3円だけ

RTX 4070 Ti(VRAM 12GB)の自宅 PC で、複製した自分の声と MiniMax H3・WhisperX・ACE-Step・Remotion を順に回し、72秒の紹介動画を作った実践記録。工程ごとの所要時間と費用(クラウド代は声の約3円)、字幕を誤字ゼロにする方法、書き出しが止まる罠、映像が暗いなど一発出しで残った課題まで。

#MiniMax H3#Remotion#WhisperX#ACE-Step#動画生成
RTX 4070 Ti 自宅サーバーに Qwen3-TTS を入れた実録 — API変更で3回詰まった話
チュートリアル2026年2月22日

RTX 4070 Ti 自宅サーバーに Qwen3-TTS を入れた実録 — API変更で3回詰まった話

自宅の RTX 4070 Ti に Qwen3-TTS をデプロイした記録。クラス名・メソッド名・戻り値の形式が全部変わっていて3回詰まった。同じ罠に落ちる人が減るよう全部書く。

#AI#TTS#Qwen3#Ubuntu#自宅サーバー
Qwen3-TTS に声クローン機能を追加した話 — Gradio UI・自分の声で TTS・ハマり全記録
チュートリアル2026年2月22日

Qwen3-TTS に声クローン機能を追加した話 — Gradio UI・自分の声で TTS・ハマり全記録

自宅 RTX 4070 Ti の Qwen3-TTS に Gradio UI と声クローンを追加した記録。モデルの種類の罠・64KB制限・VoiceClonePromptItemの落とし穴・Gradio初期化順序まで、5件のハマりを全部書く。

#AI#TTS#Qwen3#声クローン#Gradio

META-MARK × AI

ローカルAIを動かすGPU、ちゃんと選べていますか?

VRAM・性能・コスパをMetaScoreで数値化。AIアプリ別の推奨ハードウェア要件も確認できます。