ローカルで動く動画生成AI——主要モデルとアプリを解説

スポンサーリンク

動画生成AIには、クラウドのサービスとして提供されるものだけでなく、モデル本体のデータ(重み)が公開されていて、自分のパソコンにダウンロードして動かせるものがあります。ローカルで動かす場合、生成回数の制限や1本ごとの課金はなく、入力したプロンプトや生成した動画が外部のサーバーに送られることもありません。

この記事では、2026年8月時点でローカルで動かせる主な動画生成AIのモデルと、それを動かすためのアプリを整理して解説します。

ローカルで動かせる主なモデル

重みが公開されていて、ローカル実行の候補としてよく名前が挙がるのは次の4つです。

モデル開発元規模音声精度・得意分野必要VRAMの目安
Wan 2.2アリババ5B/14Bほかなし総合的な画質はオープン系で最高評価。そのぶん生成は遅め5B版は8GB。14B版は量子化して16GB前後から
MiniMax H3MiniMax33B映像と同時生成人物の顔の一貫性と、カメラワークの指定に強い公式の基準なし。量子化+オフロードで8GB台の報告もあるが、実用は16GB以上
LTX-2.3Lightricks22B映像と同時生成生成が速い。実写の質感より、アニメ調やモーショングラフィックスが得意量子化して12GB前後から
HunyuanVideo 1.5テンセント8.3Bなし水・煙・布など、物理的な動きの自然さに定評公式の目安はオフロードありで14GB

Wan 2.2(アリババ)

ローカル動画生成の定番と呼ばれているモデルです。画質の評価はオープンなモデルの中で最も安定していて、比較記事でも品質の基準として扱われることが多い一方、生成速度は他のモデルより遅めです。パラメータ数の違う複数のバリアントがあり、5B版はVRAM 8GBのGPUにそのまま載ります。14B版は本来もっと多くのVRAMを必要としますが、量子化(モデルのデータを圧縮して軽くする処理)を使えば16GB前後のGPUでも動かせます。テキストから動画を作るタスクと、画像から動画を作るタスクの両方に対応しています。

MiniMax H3(MiniMax)

2026年8月に重みが公開された、この中では最も新しいモデルです。33Bという大きさで、映像と音声を1回の生成でまとめて作れます。仕様上は最長15秒・2K解像度まで対応します。精度面の特徴は人物の描写で、動きや表情が変わっても顔が同一人物として保たれる一貫性と、ドリーやオービットといったカメラワークをプロンプトで指定できる点が評価されています。公式のVRAM要件表は公開されておらず、必要なメモリは量子化の形式や設定によって大きく変わります。量子化とオフロード(VRAMに載り切らない分をシステムメモリに逃がす仕組み)を組み合わせて8GB台のGPUで動かした報告もありますが、生成時間との兼ね合いを考えると、実用ラインは16GB以上とされることが多いです。

LTX-2.3(Lightricks)

速度に振ったモデルです。同クラスの品質設定で比べると他のモデルの2〜3倍速いとされ、2026年3月の更新で4K・50fpsと、映像に同期した音声の生成に対応しました。精度の傾向としては、実写のような質感の再現よりも、アニメ調・スタイル化された映像やモーショングラフィックスで良い結果を出しやすいモデルです。ステップ数を減らして高速化した蒸留版も配布されています。

HunyuanVideo 1.5(テンセント)

2025年11月に公開された8.3Bのモデルで、この中では最も軽量です。精度面では物理的な動きの自然さに定評があり、水や煙のような流体、布の揺れ、物どうしの接触といった描写を得意とします。音声の生成機能はありません。公式の目安として、オフロードを使う構成でVRAM 14GBが示されています。

ライセンスの違い

4つのモデルは、重みが公開されているという点は同じでも、使用条件はそれぞれ異なります。

モデルライセンス注意点
Wan 2.2Apache 2.0商用利用も制限なし。この中では最も条件が緩い
MiniMax H3独自ライセンス米国・EU・英国・韓国が対象外。日本は対象内。商用利用の条件は原文確認が必要
LTX-2.3独自ライセンスバージョンや利用規模で条件が分かれる。商用利用前に原文確認が必要
HunyuanVideo 1.5独自ライセンス利用条件に制限があるため、商用利用前に原文確認が必要

あわせて知っておきたいのは、シリーズの最新版が必ずしもローカルで使えるわけではない、という点です。たとえばWanシリーズの最新版は2.7ですが、オープンなライセンスで重みが手に入るのは2.2までで、2.5はAPI限定の商用サービス、2.7も自由に使える形では配布されていません。性能ランキングに並ぶ最新モデルの一覧と、ローカルで動かせるモデルの一覧は別物です。

モデルを動かすためのアプリ

モデルの重みは単体では動かせないため、読み込んで実行するアプリが必要です。定番はComfyUIとWan2GPの2つで、どちらもオープンソースで無料です。

ComfyUIWan2GP
操作の形ノード(箱)を線でつないで処理を組む普通のWebアプリ。モデルを選んで生成ボタンを押す
自由度高い。処理の流れを自分で設計できる用意された範囲内
低VRAM向けの調整自分で設定を組む量子化やオフロードをアプリ側が自動で選ぶ
対応モデル広い。画像生成モデルも含むWan 2.1/2.2、MiniMax H3、LTX-2、HunyuanVideoなど
対応GPUNVIDIA中心NVIDIA(GTX 10XX世代以降)とAMDに対応

ComfyUI

画像生成・動画生成の分野で業界標準といえるアプリです。「テキストを読み込む」「モデルで生成する」「動画として保存する」といった処理の箱(ノード)を線でつなぎ、ワークフローと呼ばれる配線図を組み立てて使います。配線図はファイルとして配布・共有できるため、他の人が組んだワークフローを読み込めば、ゼロから組む必要はありません。処理の流れを細かく制御できるのが最大の強みで、新しいモデルへの対応も速い一方、ノード操作の習得という入り口のハードルがあります。

Wan2GP

「GPU貧乏のための動画生成ツール」を掲げるアプリです。ノードの配線はなく、ブラウザ上でモデルを選び、プロンプトを書いて生成ボタンを押すだけの作りになっています。名前にWanと付いていますが、対応モデルはWanシリーズに限らず、MiniMax H3、LTX-2、HunyuanVideoなどを1つのアプリで切り替えて使えます。特徴は低VRAM環境への最適化で、量子化形式の選択やオフロードの設定をアプリ側が自動で面倒を見てくれ、条件がそろえばVRAM 6GBから動きます。GTX 10XX世代の古いGPUやAMDのGPUにも対応しています。配布元はGitHubの公式リポジトリです。

ローカルの動画生成は、クラウドの最上位サービスと比べれば品質も速度もまだ差があります。それでも、量子化とオフロードの普及で必要なVRAMの下限は年々下がっていて、ゲーミングPCクラスの環境で動かせるモデルの選択肢は着実に増えています。モデルもアプリも更新の速い分野なので、導入の際は各モデルの配布ページで最新の要件とライセンスを確認してください。

コメント

タイトルとURLをコピーしました