音声と動画の同時生成
後から加えるのではなく、映像とともに音声を生成します。
ByteDanceのSeedance 2.0は、最初と最後のフレームまたは参照画像から、480Pからネイティブ4Kまでの映像と音声を1回の処理で生成します。
作成を始めるには、デスクトップのブラウザでこのページを開いてください。
Seedance 2.0はByteDanceの動画モデルで、音声が別工程ではない点が特徴です。
生成動画の多くは無音で届き、後から音楽が付くため、映像に音楽を重ねただけに感じられます。Seedance 2.0は音声と映像を同時生成し、環境音、動作音、リズムを後から大まかに合わせるのではなく、画面で実際に起きることに同期させます。Virseはフレーム駆動と参照素材駆動を分け、それぞれにFast版を用意した4モデルを提供します。
描かれた場所に合う音が必要ならSeedance 2.0を使ってください。音声を後回しの判断ではなくショットの一部にした広告映像、商品モーション、アニメーション、キャラクター中心のシリーズ、SNS動画を作れます。

Seedance 2.0はByteDanceが開発したAI動画生成モデルです。被写体、動作、カメラ、テンポ、音についての文章の指示に従い、同期した2チャンネル音声付きの動画を生成します。
このモデルには3つの主な強みがあります。
生成時間は4~15秒、アスペクト比は21:9~9:16です。Virseには4モデルがあり、Seedance 2.0とSeedance 2.0 Fastは開始フレーム、終了フレーム、または両方を受け取り、Seedance 2.0 ReferenceとSeedance 2.0 Fast Referenceは代わりに提供された参考素材から作成します。

後から加えるのではなく、映像とともに音声を生成します。
1回の生成の長さで、前の結果から続けることで延長できます。
拡大ではない真の4K出力で、その下に480P、720P、1080Pもあります。
画像、動画クリップ、音声をすべて入力として提供できます。
フレーム駆動と参照素材駆動の経路に、それぞれFast版があります。
同じ文章の指示から21:9~9:16に対応します。
映像とともに音声を生成するため、足が着地した瞬間に足音が鳴ります。この同期は無音のクリップに後から音を付ける方法では難しく、同時生成モデルを選ぶ主な理由です。
多くの動画モデルは画像を受け付けますが、このモデルは動画クリップや音声も参照素材にでき、動きの特徴や音の質感を説明せずに示せます。
4つのモデルは明確に分かれています。開始と終了の構図が決まっているならフレームを使い、被写体を維持する必要があり説明より見せる方が簡単なら参照素材を使います。
480Pはタイミングや動きを試す際に完成版の予算を使い切らないためにあります。上のサイズに移っても指示は変わりません。
Seedance 2.0 FastとFast Referenceは低いサイズを低コストで提供し、探索段階の試作に適しています。
実写風の映像と同じように、2Dカートゥーン、3Dアニメーション、イラスト表現の動きも扱えます。
参照素材を使う動画には、まず素材が必要ですが、整った一式として届くことはほとんどありません。キャラクター、商品写真、動きの参考は、それぞれ違う場所から集めます。 Virseでは動画を作る空間にそれらを集められます。キャンバス上のどの画像モデルで作った静止画も、書き出して再アップロードせずに、Seedance 2.0の参照素材やフレームへ直接使えます。
画像モデルでキャラクターや商品の静止画を作り、Seedance 2.0から直接参照します。
480Pでタイミングと動きを固め、同じ指示を1080Pまたは4Kで再実行します。
キャンバスを離れたりブリーフを書き直したりせずに、Seedance 2.0と30以上の他の画像・動画モデルを切り替えられます。
シーケンス内のすべてのクリップで同じ参照素材を再利用し、全体の一貫性を保ちます。
背景音を映像とともに生成する、短いブランド映像。
決められた構図で始まり終わる、回転、登場演出、細部の撮影。
ショット間で一貫した見た目を保つイラスト・アニメーション映像。
1人の出演者をショットごとに認識できる一連のクリップ。
480Pで下書きし1080Pで仕上げる縦長・横長の映像。
制作に入る前に、絵コンテを動く参考映像に変換。
構図が決まっていればフレーム駆動、連続性には参照素材駆動、試作にはFastを選びます。
開始・終了フレーム、または参照素材をアップロードし、それぞれの役割を説明します。
何が動き、カメラがどう動作し、どのような音になるかを説明します。
承認済みの指示を一文字も変えずに1080Pまたは4Kで使います。
効果的なSeedance 2.0のプロンプトには通常6つの要素が含まれます。
こう書く代わりに
腕時計の商品動画、映画のように。
こう書く
Image 1の時計の文字盤を、強い頭上の単一光源の下で画面いっぱいに映して開始。磨いたベゼルに反射が移動する中、ケースの周りをゆっくり時計回りに回る。中間でカメラを引き、暗い石の上の時計全体を見せる。Image 2の構図で終了。カットなしで連続した動きを維持する。終始静かな室内音、カメラが止まる際に低い金属音1回。
Image 1の栓を閉じた香水瓶から開始し、濃いバーガンディーの背景の中央に置く。 クリップの最初の3分の1でゆっくり寄り、光がガラスの表面を移動する。 瓶を静止させカメラを安定させたまま、1回の連続した動きで栓を持ち上げる。 栓が瓶の上に浮かぶImage 2の構図で終了。かすかな室内の環境音と、栓が上がる瞬間に柔らかなガラスの響き1回。
Image 1のキャラクターをImage 2のイラストスタイルで動かす。 手描きの森の空き地の左から歩いて入り、中央で止まり、樹冠から光が差すと上を見る。 参照素材の線、配色、比率を終始維持する。カメラは固定。 鳥の声を含む重層的な森の環境音。見上げる際に、軽く上昇する音楽フレーズ。
Image 1のモデル、Image 2のジャケット、Image 3の屋上を使用。 モデルがカメラへ向くミディアムショットから始め、街の輪郭が背後に入るにつれてゆっくり右へ移動する。 顔とジャケットの形、色、質感を参照どおりに維持する。 曇天の日光。風、遠い交通音、下に控えめな電子音楽。
| 比較項目 | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| クリップの長さ | 4〜15秒 | 最大30秒 |
| 参照入力 | 画像、動画、音声 | より幅広いマルチモーダル参照素材 |
| ストーリーの連続性 | 単独ショットと短いシーケンス | 長い物語のための複数回の延長 |
| 編集の制御 | クリップ全体をプロンプト単位で制御 | 特定の瞬間をタイムスタンプ単位で制御 |
| Virse内のエントリー | 4つ、フレーム型と参照型に分かれる | 1つ |
| 適した用途 | 選んだサイズで指定のショットを作成 | 長く構造化された物語 |
同時生成モデルでは音について何も言わないのは中立ではなく、モデルに決めさせることです。シンプルでも音の組み合わせを指定してください。
終了時の構図を制約すると、特定の構図で終える必要があるショットのずれを大幅に減らせます。
各画像、動画、音声ファイルの役割を明示すると、モデルがそれらを平均化して混ぜるのを防げます。
最小サイズで構図、テンポ、カメラ移動を固め、納品用の予算は一度だけ使ってください。