動画生成AIには、クラウドのサービスとして提供されるものだけでなく、モデル本体のデータ(重み)が公開されていて、自分のパソコンにダウンロードして動かせるものがあります。ローカルで動かす場合、生成回数の制限や1本ごとの課金はなく、入力したプロンプトや生成した動画が外部のサーバーに送られることもありません。
この記事では、2026年8月時点でローカルで動かせる主な動画生成AIのモデルと、それを動かすためのアプリを整理して解説します。
ローカルで動かせる主なモデル
重みが公開されていて、ローカル実行の候補としてよく名前が挙がるのは次の4つです。
| モデル | 開発元 | 規模 | 音声 | 精度・得意分野 | 必要VRAMの目安 |
|---|---|---|---|---|---|
| Wan 2.2 | アリババ | 5B/14Bほか | なし | 総合的な画質はオープン系で最高評価。そのぶん生成は遅め | 5B版は8GB。14B版は量子化して16GB前後から |
| MiniMax H3 | MiniMax | 33B | 映像と同時生成 | 人物の顔の一貫性と、カメラワークの指定に強い | 公式の基準なし。量子化+オフロードで8GB台の報告もあるが、実用は16GB以上 |
| LTX-2.3 | Lightricks | 22B | 映像と同時生成 | 生成が速い。実写の質感より、アニメ調やモーショングラフィックスが得意 | 量子化して12GB前後から |
| HunyuanVideo 1.5 | テンセント | 8.3B | なし | 水・煙・布など、物理的な動きの自然さに定評 | 公式の目安はオフロードありで14GB |
Wan 2.2(アリババ)
ローカル動画生成の定番と呼ばれているモデルです。画質の評価はオープンなモデルの中で最も安定していて、比較記事でも品質の基準として扱われることが多い一方、生成速度は他のモデルより遅めです。パラメータ数の違う複数のバリアントがあり、5B版はVRAM 8GBのGPUにそのまま載ります。14B版は本来もっと多くのVRAMを必要としますが、量子化(モデルのデータを圧縮して軽くする処理)を使えば16GB前後のGPUでも動かせます。テキストから動画を作るタスクと、画像から動画を作るタスクの両方に対応しています。
MiniMax H3(MiniMax)
2026年8月に重みが公開された、この中では最も新しいモデルです。33Bという大きさで、映像と音声を1回の生成でまとめて作れます。仕様上は最長15秒・2K解像度まで対応します。精度面の特徴は人物の描写で、動きや表情が変わっても顔が同一人物として保たれる一貫性と、ドリーやオービットといったカメラワークをプロンプトで指定できる点が評価されています。公式のVRAM要件表は公開されておらず、必要なメモリは量子化の形式や設定によって大きく変わります。量子化とオフロード(VRAMに載り切らない分をシステムメモリに逃がす仕組み)を組み合わせて8GB台のGPUで動かした報告もありますが、生成時間との兼ね合いを考えると、実用ラインは16GB以上とされることが多いです。
LTX-2.3(Lightricks)
速度に振ったモデルです。同クラスの品質設定で比べると他のモデルの2〜3倍速いとされ、2026年3月の更新で4K・50fpsと、映像に同期した音声の生成に対応しました。精度の傾向としては、実写のような質感の再現よりも、アニメ調・スタイル化された映像やモーショングラフィックスで良い結果を出しやすいモデルです。ステップ数を減らして高速化した蒸留版も配布されています。
HunyuanVideo 1.5(テンセント)
2025年11月に公開された8.3Bのモデルで、この中では最も軽量です。精度面では物理的な動きの自然さに定評があり、水や煙のような流体、布の揺れ、物どうしの接触といった描写を得意とします。音声の生成機能はありません。公式の目安として、オフロードを使う構成でVRAM 14GBが示されています。
ライセンスの違い
4つのモデルは、重みが公開されているという点は同じでも、使用条件はそれぞれ異なります。
| モデル | ライセンス | 注意点 |
|---|---|---|
| Wan 2.2 | Apache 2.0 | 商用利用も制限なし。この中では最も条件が緩い |
| MiniMax H3 | 独自ライセンス | 米国・EU・英国・韓国が対象外。日本は対象内。商用利用の条件は原文確認が必要 |
| LTX-2.3 | 独自ライセンス | バージョンや利用規模で条件が分かれる。商用利用前に原文確認が必要 |
| HunyuanVideo 1.5 | 独自ライセンス | 利用条件に制限があるため、商用利用前に原文確認が必要 |
あわせて知っておきたいのは、シリーズの最新版が必ずしもローカルで使えるわけではない、という点です。たとえばWanシリーズの最新版は2.7ですが、オープンなライセンスで重みが手に入るのは2.2までで、2.5はAPI限定の商用サービス、2.7も自由に使える形では配布されていません。性能ランキングに並ぶ最新モデルの一覧と、ローカルで動かせるモデルの一覧は別物です。
モデルを動かすためのアプリ
モデルの重みは単体では動かせないため、読み込んで実行するアプリが必要です。定番はComfyUIとWan2GPの2つで、どちらもオープンソースで無料です。
| ComfyUI | Wan2GP | |
|---|---|---|
| 操作の形 | ノード(箱)を線でつないで処理を組む | 普通のWebアプリ。モデルを選んで生成ボタンを押す |
| 自由度 | 高い。処理の流れを自分で設計できる | 用意された範囲内 |
| 低VRAM向けの調整 | 自分で設定を組む | 量子化やオフロードをアプリ側が自動で選ぶ |
| 対応モデル | 広い。画像生成モデルも含む | Wan 2.1/2.2、MiniMax H3、LTX-2、HunyuanVideoなど |
| 対応GPU | NVIDIA中心 | NVIDIA(GTX 10XX世代以降)とAMDに対応 |
ComfyUI
画像生成・動画生成の分野で業界標準といえるアプリです。「テキストを読み込む」「モデルで生成する」「動画として保存する」といった処理の箱(ノード)を線でつなぎ、ワークフローと呼ばれる配線図を組み立てて使います。配線図はファイルとして配布・共有できるため、他の人が組んだワークフローを読み込めば、ゼロから組む必要はありません。処理の流れを細かく制御できるのが最大の強みで、新しいモデルへの対応も速い一方、ノード操作の習得という入り口のハードルがあります。
Wan2GP
「GPU貧乏のための動画生成ツール」を掲げるアプリです。ノードの配線はなく、ブラウザ上でモデルを選び、プロンプトを書いて生成ボタンを押すだけの作りになっています。名前にWanと付いていますが、対応モデルはWanシリーズに限らず、MiniMax H3、LTX-2、HunyuanVideoなどを1つのアプリで切り替えて使えます。特徴は低VRAM環境への最適化で、量子化形式の選択やオフロードの設定をアプリ側が自動で面倒を見てくれ、条件がそろえばVRAM 6GBから動きます。GTX 10XX世代の古いGPUやAMDのGPUにも対応しています。配布元はGitHubの公式リポジトリです。

ローカルの動画生成は、クラウドの最上位サービスと比べれば品質も速度もまだ差があります。それでも、量子化とオフロードの普及で必要なVRAMの下限は年々下がっていて、ゲーミングPCクラスの環境で動かせるモデルの選択肢は着実に増えています。モデルもアプリも更新の速い分野なので、導入の際は各モデルの配布ページで最新の要件とライセンスを確認してください。


コメント