RTX 4070 Tiで72秒の紹介動画を自作:クラウド代は声の約3円だけ
RTX 4070 Ti(VRAM 12GB)の自宅 PC で、複製した自分の声と MiniMax H3・WhisperX・ACE-Step・Remotion を順に回し、72秒の紹介動画を作った実践記録。工程ごとの所要時間と費用(クラウド代は声の約3円)、字幕を誤字ゼロにする方法、書き出しが止まる罠、映像が暗いなど一発出しで残った課題まで。
前編では、Google の Gemini 3.8 Flash TTS で管理人の声を複製し、「言い間違えない自分」でナレーションを作れることを確かめました。
今回はその続きです。複製した声を使って、実際に事業の紹介動画を1本、最後まで作りました。題材は、管理人が運営しているエンジニア専門の結婚相談所の紹介です。
ポイントは、声以外はすべて自宅のパソコンで作った ことです。使った GPU は RTX 4070 Ti(VRAM 12GB)1枚。映像も字幕も BGM も組み立ても、クラウドにお金を払っていません。
先に完成品をどうぞ。
SNS 向けに、縦型(9:16)版も同じ素材から書き出しました(作り方は後半で紹介します)。
全体の流れ
作業は5つの工程に分かれます。
| 工程 | 道具 | どこで動くか |
|---|---|---|
| 1. 声(ナレーション) | Gemini 3.8 Flash TTS(本人の声を複製) | クラウド(唯一の有料工程) |
| 2. 映像カット | MiniMax H3(動画生成 AI) | 自宅の AI サーバー(VRAM 12GB) |
| 3. 字幕のタイミング | WhisperX(文字起こし) | 自宅の AI サーバー |
| 4. BGM | ACE-Step 1.5(音楽生成 AI) | 自宅の AI サーバー |
| 5. 組み立て・書き出し | Remotion(React で動画を組む道具) | 自宅のワークステーション |
AI サーバーの GPU は1枚しかないので、H3・WhisperX・ACE-Step は 1つずつ順番に 動かします。同時には載りません。
工程1:声は前編の複製ボイスを使う
ナレーションは、前編で作った管理人の複製ボイスです。台本は「エンジニア専門の結婚相談所」という切り口で、結婚相談所が何をしてくれるのか、うちの強み(診断ツールとデータ)、そしてエンジニアへの呼びかけ、という流れにしました。
最初は落ち着いた口調(style: warm, confident and inviting)で作りましたが、聴き直すと少しナレーション感が強い。そこで style だけを「energetic and expressive, lively intonation, talking directly to a friend」に変えて作り直しました。台本は同じなのに 83.6秒 → 69.0秒 と、テンポが上がって話しかける調子になりました。動画にはこちらを使っています。
工程2:映像カットは H3 で5本
映像は MiniMax H3 で作りました。H3 は文章から音声つきの動画を作れるモデルで、公開されている重み(オープンウェイト)を自宅で動かせます。VRAM 12GB でも動かせる構成(int8 に圧縮した本体+疎アテンション)は、MiniMax H3 を 12GB GPU で動かした記事で詳しく書いています。
今回は台本の場面に合わせて、10秒のカットを5本作りました。
| カット | 内容 | 生成時間 |
|---|---|---|
| 1 | カフェで向かい合う二人(初めてのお見合い) | 126.0秒(初回・モデル読込込み) |
| 2 | カウンセラーとの面談 | 118.5秒 |
| 3 | ノート PC で診断結果を見る女性 | 114.2秒 |
| 4 | 夜のオフィスでコードを書くエンジニア | 113.6秒 |
| 5 | 扉をノックする手、開いた扉から差す光 | 113.3秒 |
解像度は 1152×640、1本あたり約2分。5本で約10分 です。
静止画を先に作らず、文章だけ(T2V)で出した5本を、ほぼ一発出しのまま 使っています。人物の顔や手が崩れるような破綻はなく、背景映像としては十分使える画質でした。ただし、細かく見ると気になる点もあります(後述の「正直な課題」)。
プロンプトは、場面の説明に「20代後半〜30代の日本人」「ゆっくり寄るカメラ」「映画のような実写風・自然光・文字やロゴなし」を共通で足しています。音は後で消すので「静かな環境音だけ」と指定しました。
H3 は「口パク」ができない
ひとつ大事な制約があります。H3 は、こちらが用意した音声に合わせて人物の口を動かすことはできません(H3 が付ける音声は H3 自身が作るもの)。
なので今回は、人物に台詞を言わせる場面は作らず、雰囲気を見せる映像(B ロール) として使いました。H3 が付けた音はすべて消して、ナレーションと BGM だけを流しています。
工程3:字幕は「時刻だけ AI、文字は台本」
字幕は、ナレーションを自宅の WhisperX(large-v3)で文字起こしして、時刻を取りました。WhisperX は日本語を 1文字ずつ 開始・終了の時刻つきで返してくれます。
ただし、文字起こしの本文には誤りが混じります。今回も、
- 「伴走」→「伴奏」
- 「頼る」→「耐える」
- 「仕様」→「使用」
- 「メタマリー」→「メタマリン」
と、固有名詞や同音異義語を取り違えていました。
そこで、表示する文字は台本そのもの、時刻だけを文字起こしから借りる 方式にしました。台本と文字起こしを文字単位で突き合わせ(Python の difflib)、台本の各文字に時刻を割り当てます。結果、台本の全374文字に時刻が付き、句読点で区切って31枚の字幕になりました。
台本があるナレーションなら、この方式で字幕の誤字はゼロにできます。
工程4:BGM は ACE-Step で37秒
BGM は ACE-Step 1.5 で作りました。「温かく前向きな企業 CM 風、柔らかいピアノ、アコースティックギター、軽い手拍子、控えめなキック」と指定して、76秒のインスト曲を2曲同時に生成。2曲で37秒 でした。
2曲のうち、音量の起伏が小さい(ラウドネスレンジ 3.6LU)ほうを採用しました。起伏が大きい曲は、ナレーションの邪魔をしやすいからです。
音量は、ナレーションより約18dB 小さくして、最初の1秒でフェードイン、最後の2秒でフェードアウトさせています。
工程5:Remotion で組み立てる
最後に、Remotion で全部を1本にまとめました。Remotion は、動画を React(Web 画面を作るのと同じ書き方)で組み立てる道具です。個人や従業員3名以下の会社なら、商用でも無料で使えます。
組み立てた内容は次のとおりです。
- オープニング:白地にロゴ
- カフェのカット
- 面談のカット+「紹介 → お見合い → 成婚まで伴走」が順に点灯
- 診断結果のカット+診断名カード3枚が順に出る
- 紺の画面に「データに裏打ちされた、あなただけの婚活。」
- コードを書くカット+「仕様 → 検証 → 改善」がタイプライター風に
- 扉をノックするカット
- エンドカード:「まずは無料相談から」

横型版の8場面(左上から右へ、上から下へ)
全編の右上に「AI 生成音声・イメージ映像」と表示しています。AI で作った人物を広告に使う以上、ここは外せません。
コードは、シーン表と受け入れ条件を書いた設計書を用意して、コーディング AI(Codex)に書いてもらいました。約300行です。管理人は見た目の確認と、細かい直し(字幕の改行位置など)だけを担当しています。
縦型版は、横長の映像を縦に切り抜くと人物が切れてしまうので、横長の映像を画面中央に帯で置き、背景に同じ映像をぼかして敷く 形にしました。
つまずいたところ
- 書き出しが無言で止まる:Remotion は初回の書き出し時にブラウザ(Chrome Headless Shell)をダウンロードします。これを途中で止めたら「ダウンロード中」の印(ロックファイル)が残り、以降の書き出しがずっと止まったままになりました。印を消したら即座に直りました
- 字幕の1文字だけの改行:「…戦略」の後ろの「で」だけが次の行に落ちる、という見た目の問題が出ました。長い字幕は読点の位置で2行に割るようにして解決
- オープニングの二重表示:ロゴの下の文字と字幕が同じ文言で重なっていたので、ロゴ側を消しました
正直な課題:ほぼ一発出しの限界
完成品を見返して、管理人が気になった点を正直に書いておきます。
- 全体的に映像が暗い。カット3(診断結果を見る女性)は「夕方の部屋」、カット4(コードを書くエンジニア)は「夜のオフィス」とプロンプトで指定したので、そもそも暗めの映像になっています。さらに組み立て側で、字幕を読みやすくするために映像の上へ暗いグラデーションを重ねているので、二重に暗くなりました。明るく前向きな紹介動画としては、もう少し明るいほうが合います
- 最後の扉が開いたり閉まったりする。カット5は「扉をノックすると、扉がゆっくり開いて光が差す」という指示でしたが、10秒の中で扉が開いたり閉まったりして、動きが落ち着きません。締めのカットなので目立ちます
どちらも直し方の見当はついています。
- 暗さは、プロンプトを「明るい昼間」「窓からの自然光」に寄せ、組み立て側のグラデーションを弱めれば改善できそうです
- 扉は、同じ指示で seed(乱数)を変えて数本出して選ぶか、「扉は開いたまま動かない」と動きを明示するのが近道です。1本2分なので、5本出しても10分です
今回はあえて「ほぼ一発出し」で、どこまでいけるかを見ました。詰める余地はまだあるけれど、ローカルでもそこそこいい感じに出せる、というのが管理人の正直な感想です。
かかった時間と費用
| 工程 | 所要時間 | 費用 |
|---|---|---|
| 声(Gemini TTS・69秒) | 約30秒(同じくらいの長さの別原稿で27秒) | 約$0.020(約3円) |
| 映像カット5本(H3) | 約10分 | 0円(電気代のみ) |
| 字幕のタイミング(WhisperX) | 数分(未計測) | 0円 |
| BGM 2曲(ACE-Step) | 37秒 | 0円 |
| 組み立て(Remotion・コード作成) | 約30分(コーディング AI) | 0円(サブスクリプションの範囲内) |
| 書き出し(横型+縦型) | 約5分 | 0円 |
| 合計 | 約1時間弱(待ち時間込み・確認や直しは別) | 約3円 |
※ 声の費用は前編と同じく、API の返答にある出力トークン数の多いほう(1秒32トークン)で計算した上限です。 ※ 書き出し(Remotion のレンダー)はワークステーション(Ryzen 7 8840U・専用 GPU なし)で、横型 1280×720 が67秒、縦型 1080×1920 が225秒でした。
外注すれば数万円〜の紹介動画が、クラウド代3円+自宅の電気代 で、1時間ほどで形になりました。しかも台本と声を差し替えれば、同じ型で2本目以降を量産できます。
VRAM 12GB でどこまでできるか
正直に書くと、12GB で困る場面はほとんどありませんでした。
- H3 は 1152×640・10秒までなら 12GB で完走します(15秒超はモデル自体が未学習なので、つなぎ方の工夫が要ります)
- WhisperX・ACE-Step は余裕で載ります
- ただし GPU は1枚なので、全部を順番に 回す必要があります。「H3 を止めて WhisperX、止めて ACE-Step」という切り替えの手間はかかります
できないことも書いておきます。
- 人物が台詞に合わせて口を動かす映像(口パク)は、今回の構成では作れません
- 映像の人物は毎回別人です。同じ人物を複数カットで出し続けたいなら、静止画を先に作って I2V(画像から動画)にするなどの工夫が必要です
まとめ
- 声以外は全部ローカル、VRAM 12GB の1枚で72秒の紹介動画が作れた
- 映像は H3 の T2V だけで広告の背景として十分な画質
- 字幕は「時刻だけ AI、文字は台本」で誤字ゼロ
- BGM は起伏の小さい曲を選び、声の約18dB 下に
- 費用は声の約3円だけ、所要は1時間弱
- ほぼ一発出しなので、映像の暗さや扉の動きなど詰める余地はある。それでも、ローカルでそこそこいい感じに出せる
前編の複製ボイスと組み合わせると、「自分の声で話す、自分の事業の紹介動画」が、ほぼ自宅だけで作れてしまいます。AI 生成であることの表示だけは忘れずに。
今回使った機材
GPU(AI サーバー)
管理人の AI サーバーは RTX 4070 Ti(VRAM 12GB)です。同じ 12GB クラスなら、今回の構成(H3 の int8 版・WhisperX・ACE-Step)はそのまま動く見込みです。
※ RTX 5070 での動作は未検証です。H3 は VRAM だけでなくメインメモリも多く使うので、メモリは 32GB 以上を推奨します。
マイク(前編の声の複製に使用)
複製ボイスの元になる録音は、ノイズリダクション付きの USB マイクで録りました。
※ PR:この節の Amazon リンクはアフィリエイトリンクです。経由して購入されると、当サイトに紹介料が入ります。
出典
- 前編:Gemini 3.8 Flash TTS で自分の声を複製してみた
- Remotion / Remotion License
- MiniMax H3(Hugging Face)
- WhisperX
- ACE-Step 1.5
検証日・環境
- 検証日:2026年9月27日
- AI サーバー:RTX 4070 Ti(VRAM 12GB)、メモリ 32GB、Ubuntu 24.04、ComfyUI 0.37.0
- 映像:MiniMax H3(Fused Turbo int8・SLA・4 steps・1152×640・10秒)
- 字幕:WhisperX large-v3(日本語)
- BGM:ACE-Step 1.5(Turbo)
- 組み立て:Remotion 4.0.529、Node.js v25.0.0
- 声:Gemini 3.8 Flash TTS(本人の声を複製)
関連リンク
- 12GB クラスの GPU を比べるなら、GPU 比較ページから候補を並べて見られます。
- 動画生成以外の用途も含めて構成を考えるなら、用途別の AI 構成ガイドからたどれます。
この記事を書いた人
HW系エンジニアとして20年以上、10,000件を超える顧客訪問と2,000件を超える単独ソリューション実績。AIツールを使った個人開発やIoT農園など、Raspberry Piを使ったオートメーション化なども実践中です!エンジニア専門結婚相談所も運営中、ClaudeCodeで解決できない心の課題も解決いたします!
関連記事
HeartMuLa 3B vs ACE-Step 1.5 徹底比較:ローカルAI音楽生成、歌詞はどこまで再現できるか
自宅サーバー(RTX 4070 Ti 12GB)でHeartMuLa 3BとACE-Step 1.5を実機比較。歌詞再現度をWhisperXで定量評価し、12GB VRAM環境で踏んだ導入の罠も記録しました。
MiniMax H3、画風検証は後回しでいい?速度差より広告の崩れに注目
RTX 4070 Ti 12GB で MiniMax H3 を使い、同じ構図の架空ビール CM を 3 画風×4 設定=12 本生成した比較。画風が変わっても生成時間はほぼ同じ、仕上がりは 3D アニメが最も安定。文字のないラベルに偽の文字が生える落とし穴と、音の指示の勘所まで。
MiniMax H3はつなぎ目が飛ぶのに直せる——同seedで構図維持
RTX 4070 Ti 12GB で MiniMax H3 の動画を 40 秒まで延ばした実測。1 本の上限 15 秒を続きを生成する追加ノードでつなぎ、つなぎ目の構図飛びは同じ seed のまま指示文 2 行で解消、スワップ枯渇は区間を分けて回避した。
Colabの代わりにGPUを借りる — RunPodとVast.aiの選び方と消し忘れ防止の3つの仕掛け
Google Colab から RunPod・Vast.ai へ移るときの判断材料。3社の公式料金を同じ日に撮影して比較し、A100 で音声付き動画14本を GPU 料金約$1.1で作った実費と、消し忘れを防ぐ自己消滅タイマー・stop ではなく削除などの事前準備をまとめました。
META-MARK
GPU・CPU・PCパーツをMetaScoreで比較できます。
1,000件超のパーツデータベース。性能・効率・コスパの3軸スコアで、カタログスペックに振り回されない選択を。