PR|当サイトはアフィリエイト広告を利用しています

AI動画サービス比較ノート

AI VIDEO TOOLS / MODELS / PRICING / PR

生成モデルから探す

使いたいモデルが決まっている場合に、そのモデルでできることと、扱えるサービスを調べるためのページです。

最終更新 2026-08-19 / PRを含みます

モデル解説

21のモデルを1つずつ解説

作れる長さ、解像度、縦横比、参照できる画像の枚数、気をつけることをまとめています。

Gemini Veo 3.1

Google

Googleの動画生成モデルの上位版。映像と一緒に音声も生成でき、4Kまでの書き出しに対応します。

4秒/6秒/8秒/720p/1080p/4K

Gemini Veo 3

Google

Veo 3.1のひとつ前の版。音声の同時生成には対応しますが、解像度と参照画像の扱いは3.1より控えめです。

4秒/6秒/8秒/720p

Gemini Omni Flash

Google

文章でのやりとりを通じて動画を直したり作ったりできる、Googleのマルチモーダルモデル。音声も同時に生成します。

3秒〜10秒/720p

Kling V3

Kuaishou(快手)

Klingの最新版。音声の生成と、最初のコマ・最後のコマの指定に対応します。速度と品質で3つのモードを選べます。

3秒〜15秒/720p

Kling V3 Motion Control

Kuaishou(快手)

参照する動画の動きを、自分のキャラクターに移すためのモデル。画像と動画の両方を渡して使います。

画像の向きに合わせる場合は10秒、動画の向きに合わせる場合は30秒/公式に記載なし

Kling O3

Kuaishou(快手)

コマとコマの間をつなぐ動きを作るモデル。既存の動画を作り替える使い方にも対応します。

3秒〜15秒/720p

Seedance 2.5

ByteDance

Seedanceの新しい版。1回の生成で30秒までの映像を作れ、画像・動画・音声を合わせて最大50点まで参照させられます。映像と音声を同時に作ります。2026年7月31日提供開始。

4秒〜30秒(試験提供の長尺モードは最大180秒)/モデル本体は4K・10bitに対応。ただし提供するサービス側で上限が下がる。Gensparkは720pまで、PixVerseは480pと720p

Seedance v2

ByteDance

ByteDanceの動画生成モデル。音声の同時生成に加え、口の動きを声に合わせる処理にも対応します。

4秒〜15秒/1080pまで

Seedance Pro Fast

ByteDance

Seedanceの高速・低コスト版。最初のコマと最後のコマを指定できます。

5秒/10秒/1080p

PixVerse C1

PixVerse(Motiv AI)

PixVerseの新しい版。音声の同時生成と、場面のつなぎ(トランジション)に対応します。

1秒〜15秒/1080pまで

PixVerse V6

PixVerse(Motiv AI)

動きの自然さ、カメラワークの指定、効果(VFX)、場面のつなぎ、動画の延長に対応した版です。

5秒/8秒/720p/1080p

MiniMax H3

MiniMax

MiniMaxの新世代モデル。2Kの解像度に対応し、被写体を参照画像でそろえられます。以前のHailuo系モデルの後継にあたります。

5秒〜15秒/2K

Vidu Q3

Vidu

音声の同時生成に対応したViduの最新版。参照画像から映像を作る使い方が得意です。半額で使えるTurboの区分があります。

1秒〜16秒/720p/1080p

Wan V2.7

Alibaba

動きの表現と再現性を高めたWanの最新版です。

5秒/480p/720p

Wan 3.0

Alibaba

音声の同時生成と、映像に合わせて画角を選ぶ「アダプティブフレーミング」に対応したWanの新世代モデルです。

2秒〜30秒/1080pまで

Grok Imagine Video

xAI

xAIのGrok Imagine Video v1.5。参照画像を使うモードと、動画を延長する機能があります。

1秒〜15秒/1080pまで

FLUX 3 Video

Black Forest Labs

画像生成で知られるBlack Forest Labsの動画モデル。音声の同時生成に対応し、20秒までの長さを作れます。

5秒〜20秒/720p/1080p

Happy Horse

Alibaba

Alibabaの動画生成モデル。文章からの生成と参照画像からの生成に加え、動画の編集にも対応します。

3秒〜15秒/720p/1080p

Runway

Runway

表現性の高い映像づくりに向くモデル。画像から動画への生成に絞られています。

5秒/10秒/720p

Fal Lipsync V3

fal(sync-3)

動画の口の動きを、音声に合わせるためのモデルです。映像を新しく作るものではありません。複数の話者を区別できます。

元の動画に合わせる/元の動画に合わせる

ByteDance Video Upscaler

ByteDance

できあがった動画の画質と解像度を上げるためのモデルです。映像を新しく作るものではありません。

元の動画に従う(最長30秒)/元の動画より高くする

逆引き

モデルの系統から、扱えるサービスを探す

Google Veo を扱うサービス(7件)

Kling を扱うサービス(5件)

この系統のモデル解説

Seedance を扱うサービス(9件)

この系統のモデル解説

PixVerse を扱うサービス(5件)

この系統のモデル解説

MiniMax / Hailuo を扱うサービス(5件)

この系統のモデル解説

Vidu を扱うサービス(4件)

この系統のモデル解説

Wan を扱うサービス(6件)

この系統のモデル解説

Grok Imagine を扱うサービス(3件)

FLUX を扱うサービス(1件)

この系統のモデル解説

Runway を扱うサービス(2件)

この系統のモデル解説

Luma を扱うサービス(1件)

Gemini Omni Flash を扱うサービス(1件)

この系統のモデル解説

Happy Horse を扱うサービス(2件)

  • Genspark総合AI+AI動画生成
  • AKOOLAIアバター+AI動画生成

この系統のモデル解説

ToMoviee を扱うサービス(1件)

  • Filmora動画編集+AI動画生成

Stable Diffusion / ComfyUI を扱うサービス(1件)

生成モデルは入れ替わりが速く、数か月で提供が終わるものも、新しく加わるものもあります。ここに載せているのは確認した時点の内容です。特定のモデルを目当てに契約する場合は、申し込み前に公式サイトで現在の対応状況をご確認ください。

18サービスの比較表を見る

この記事を書いた人

ノモト

ノモト

生成AIナビ/AI動画サービス比較ノート 運営

1997年からWeb制作と個人サイト運営に携わり、アフィリエイト、ネットショップ運営、講座制作を続けています。現在はAIを仕事と制作の道具として実際に使いながら、試した内容と結果を記録しています。