Seedance 2.5 と MiniMax H3:30 秒動画、キャラクターの変化、実際のコストを検証

Vincent読了 12 分 ·

Seedance 2.5 と MiniMax H3:30 秒動画、キャラクターの変化、実際のコストを検証

Seedance 2.5 は、20~30 秒の連続ショット、キャラクターの連続性、大量の参照素材を使う制作に適しています。一方、MiniMax H3 はローカルの ComfyUI ワークフロー、カスタマイズ、短い動画の大量反復に向いています。Seedance は公式に1 回の生成で最大 30 秒に対応し、H3 の公式対象は4~15 秒です。

本当の問題は生成のやり直しです。キャラクターの変化や、相互作用の失敗、GPU 時間、音声の修正、つなぎ合わせ、連続性の修復によって、安い生成も高くつくことがあります。実験的なローカルワークフローでは H3 を 20~30 秒まで延ばせますが、長くなるほど必要な計算量と一貫性のリスクが増します。制作では、生成 1 秒当たりより、使えるクリップ 1 本当たりのコストが重要です。

繰り返し使える創作ワークフローに向けて、Virse は、チームが参照素材、修正、プロジェクトの文脈を 1 つの共有ビジュアルキャンバスで管理できるよう支援します。マルチエージェントの協働と長期記憶により、ブランドのルール、美的な好み、制作意図を保持しやすくなり、Seedance と H3 の出力を比較、改善して使える素材へ仕上げられます。MiniMax H3、Seedance 2.5、Seedance 2.0は現在、Virse で利用でき、同じ創作ワークフロー内で複数の主要動画モデルを試して比較できます。

Virseのクリエイティブ作業画面

Seedance 2.5 と MiniMax H3:主な違いは?

Seedance 2.5 は、長い動画と大量の参照素材を使う制作ワークフローを重視します。H3 は開放性、ローカル展開、設定可能なマルチモーダル生成を重視します。公式には、Seedance は 1 回で最大 30 枚の画像、10 本の動画、10 件の音声を受け付けます。H3 は最大 9 枚の画像、3 本の動画、3 件の音声ファイルに対応し、混合ファイルの合計上限は 12 件です。

制作上のニーズ

Seedance 2.5

MiniMax H3

公式の出力時間

最大 30 秒

4~15 秒

長い連続ショット

より適している

15 秒超は実験的

マルチモーダル参照素材

最大 50 素材

混合素材は最大 12 件

ローカルワークフロー

主な強みではない

公開ウェイトとローカル H3-Base

ComfyUI

主なワークフローではない

公式対応

編集

タイムスタンプ、カメラ、グリーンバック、参照による編集

マルチモーダルの参照と編集

ネイティブな音声・動画

対応

対応、ネイティブステレオ

最適な制作上の役割

長い動画の制御

反復とカスタマイズ

Seedance 2.5 は連続性の継ぎ目を減らす

5 秒のクリップ 6 本をつないだ 30 秒のシーケンスには、顔、照明、衣装、カメラ速度、物体の位置が変わり得る境界が 5 つ生まれます。調査した制作事例では、短いクリップのつなぎ合わせから Seedance の 30 秒 1 回生成に切り替えることで、目に見える照明の変化や被写体のずれが減りました。

別の事例では、約 30 秒の生成 2 本から 58 秒の完成動画を作りました。長い生成の価値は単に尺ではなく、修復が必要なつなぎ目を減らすことにあります。

H3 は反復制作の主導権をクリエイターに与える

H3 のオープンな公開は H3-Base のローカル展開に対応し、推奨フレームワークに ComfyUI を挙げています。生成のやり直しを毎回クラウド生成の追加購入にせず、多数のバリエーションを試したいチームにとって魅力的です。

引き換えに、インフラが必要になります。VRAM、システム RAM、Torch、CUDA、オフロード、量子化、アテンション方式、加速設定が、創作ワークフローの一部になります。

MiniMax H3 は 30 秒を生成できるのか、それとも 15 秒が本当の上限か?

H3 の公式生成範囲は 4~15 秒です。MiniMax は基本出力を 768P とし、任意の 2K 再生成ワークフローも用意しています。ただし、記録のあるローカル H3 実験を調べると、公式対応範囲外で 20 秒、25 秒、30 秒に延ばすクリエイターが見られました。

公式の時間制限と H3 の実験的な延長を比較

H3 の実験的な長尺化はコストが大きくなる

768×1280、20 ステップのあるH3 ワークフローでは、おおよそ次の時間が報告されました。

動画の長さ

生成時間

5 秒

2 分

10 秒

6 分

15 秒

12 分

20 秒

20 分

30 秒

43 分

これは単一の設定であり、普遍的なベンチマークではありません。ただし、長いH3 生成ではやり直しのコストが不釣り合いに大きくなり得るという制作上の問題を示しています。

別の RTX 5090 実験では、0.7MP、20 ステップで約 30 秒の動画を約15 分 49 秒で生成しましたが、SageAttention 2 と EasyCache を使用していました。加速が使われているため、この結果をMiniMax H3の直接的なベースライン比較には使えません。

動画が長くなると H3 の生成時間は急増する

15 秒は単なる数字ではなく実用上の境界

調査では、顔の同一性が約12 秒後に崩れ始める I2V の事例も見つかりました。そのため、H3 の 20~30 秒生成は実験的な能力と考えます。ローカルで反復する制作では、5~15 秒がより実用的な範囲です。

Seedance 2.5 と H3:動き、カメラ制御、キャラクターの一貫性

Seedance 2.5 は長く連続するキャラクターとカメラのシーケンスに自然に適したワークフローを持ちます。H3 は尺と被写体の相互作用を制御したときに最も力を発揮します。

Seedance 2.5 は 30 秒を制作の余地に変える

ByteDance は Seedance 2.5 を、30 秒のストーリーテリング、滑らかなトランジション、複数回の延長、連続性の向上を軸に位置付けています。実務では、短い生成を複数つなぐと継ぎ目が目立つような、ファッションウォーク、商品映像、環境を見せるカメラ移動、物語のショットに役立ちます。

ただし、長尺化ですべてが解決するわけではありません。ByteDance 自身も、複雑な動きの物理表現と複数被写体の相互作用には改善の余地があるとしています。そのため、30 秒の枠は無関係な絵コンテの展開を詰め込むより、1 つのまとまった動作に使います。

複数のキャラクターが関わると H3 は難しくなる

記録のある RTX 4090 ワークフローでは、単純なシーンの出力は 10 本中およそ 6~7 本が使えると評価されていました。2 人のキャラクターの相互作用が必要になると、信頼性は約半分に下がりました。

これは標準化された成功率ベンチマークではありませんが、調査で見られたより広い傾向と一致します。単独の被写体や単純なカメラ移動は、複数キャラクターによる長い振り付けより反復しやすいという傾向です。

Seedance 2.5 と H3:参照素材、編集、修正

現在、Seedance 2.5 の方が参照入力の容量は大きく、両モデルとも基本的なテキストから動画への生成を超えて、マルチモーダル制御と編集へ進んでいます。

Seedance は最大 50 件の参照素材に対応

Seedance 2.5 は 1 回の生成で30 枚の画像、10 本の動画、10 件の音声クリップを受け付けます。また、タイムスタンプ単位の変更、カメラ視点の編集、グリーンバック編集、参照に基づく編集にも対応します。

ブランド制作では、単に美しい映像を生成する以上の意味があります。チームは同じ創作上の文脈で、キャラクター、商品、環境、動き、音、ビジュアル言語を参照できる可能性があります。

ただし、参照が増えても完全な一貫性が自動的に保証されるわけではありません。今回の調査には、50 件の参照が少数の参照より常に優れると示す独立した成功率ベンチマークはまだありません。

Seedance 2.5 と H3:マルチモーダル参照容量

H3 はマルチモーダル参照生成に対応するが入力容量は小さい

H3 は公式に最大9 枚の画像、3 本の動画、3 件の音声クリップに対応し、混合ファイルは合計 12 件までです。参照ワークフローでは、キャラクター、動き、カメラ表現、スタイル、声、編集リズムを利用できます。

そのため H3 はローカル実験で非常に柔軟ですが、複雑な制作構成向けの参照容量は現在 Seedance の方が大きくなっています。

H3 のハードウェアと速度:RTX 3060、4090、5090 の結果

H3 は一般消費者向けハードウェアで動作しますが、VRAM だけでは制作速度を予測できません。解像度、生成モード、システム RAM、ソフトウェア設定、加速方法によって性能は大きく変わります。

RTX 3060 12GB で H3 は動く

記録のある RTX 3060 12GB 構成では、次の生成が行われました。

  • 864×480
  • 5 秒
  • 124 フレーム
  • 20 ステップ
  • 9 分未満

別の 12GB ワークフローでは、システム RAM 使用量が約 42GBに達しました。さらに別の 3060 システムでは、5 秒の T2V タスクに約 4 分かかった一方、比較可能なR2V ワークフローには約21 分かかりました。

参照素材が制作ワークフローの中心なら、この差は重要です。

RTX 3060 の H3:T2V と R2V の生成時間を比較

RTX 4090 と 5090 では異なるボトルネックが見える

ある 4090 ワークフローでは、5 秒、0.4MP のクリップを約2~3 分で生成しました。5090 ならさらに多くのことができますが、高解像度が自動的に効率的になるわけではありません。1920×1088、15 秒のある実験では約68 分かかり、それでもぼやけやノイズが残りました。

ソフトウェアも同じくらい重要な場合があります。別の 16GB GPU の記録事例では、Torch/CUDA 環境を修正すると反復時間が約120~400 秒から約 21 秒に短縮されました。

実用上のルールは簡単です。比較の際は、H3 の速度と性能だけを見ず、GPU、尺、解像度、ステップ数、加速設定を必ず確認してください。

H3 のソフトウェア設定で反復時間は大きく変わる

Seedance 2.5 と H3 のコスト:使えるクリップ当たりの費用が重要な理由

H3 は直接的な生成費用を減らせる一方、Seedance はインフラや連続性にかかる費用を減らせます。失敗した出力や制作労力を含めれば、どちらも自動的に安いとは言えません。

MiniMax が現在掲載している H3 API の出力料金は、768P が 1 秒当たり 0.08 ドル、2K が 1 秒当たり 0.13 ドルで、768P から 2K への再生成は 1 秒当たり 0.05 ドルです。ローカル H3 なら、支出をより自前の計算資源に振り向けられます。

ただし、ローカル生成でも次を消費します。

  • GPU 時間
  • 電力
  • システム RAM
  • 失敗したレンダリングの時間
  • 技術的な保守
  • 操作者の注意

Seedance はこの構図を逆にします。クラウド生成では試行ごとの現金費用が明確になりますが、成功した 30 秒クリップ 1 本が、複数の短い生成、トランジション、連続性の修復を置き換えられる場合があります。

制作の判断では、私は次を使います。

使えるクリップ当たりのコスト = 生成費用 + 計算時間 + やり直し + 失敗映像 + 修復 + つなぎ合わせ + インフラ上の手間

この指標は 1 秒当たりの価格よりはるかに有用です。

出力モード別 H3 API 料金

Seedance 2.5 と H3:音声、文字組み、解像度

両モデルとも音声と動画のネイティブ生成に対応しますが、文字組みや UI モーションでは H3 に特に注目する価値があります。また、どちらの解像度の主張も、宣伝上の略称ではなく実際のワークフローを通じて判断すべきです。

ネイティブ音声は時間を節約もするが修正を増やすこともある

H3 は公式にネイティブステレオ音声を生成し、Seedance 2.5 も音声・動画の共同生成モデルです。

調べたユーザーの質問では、H3 の音声について、不要な発話、意味不明な会話、予期しない歌声、クリップ間の弱い連続性といった問題が繰り返し見られました。正確なセリフやブランド用サウンドでは、最終的な音声制作を動画生成から切り離します。

文字組みや UI モーションで H3 を試す価値がある

調査した専門的な事例のいくつかでは、その特定の例において、H3 が Seedance より安定した文字、自然に組み込まれたテキスト、滑らかな UI イージングを生成していました。

証拠は定性的で、条件をそろえたベンチマークではないため、H3 が文字で常に優れているとは言いません。ただし、UI アニメーション、キネティックタイポグラフィ、タイトルシーケンス、ミュージックビデオのグラフィックでは、専用の A/B テストを行う価値があります。

宣伝される解像度と使える解像度を混同しない

H3 の公式出力は 768P で、2K 再生成ワークフローにも対応します。Seedance は提供事業者によって機能が異なる場合があり、調査には 720p に制限された事業者のワークフローも含まれていました。

問うべきなのは「このモデルは 2K や 4K に対応しているか」ではなく、実際に使う事業者やローカルワークフローが、その解像度で必要なショットを、納得できる品質と時間のバランスで生成できるかです。

Seedance 2.5 と MiniMax H3、どちらを選ぶべきか?

連続性、長いショット、多数のマルチモーダル参照、編集制御が最も重要なら Seedance 2.5 を選びます。ローカルでの主導権、ComfyUI のカスタマイズ、大量の短尺実験を重視するなら H3 を選びます。

私なら、5~10 秒の広告コンセプトでは H3 から始めます。ローカルワークフローなら、実験の失敗を受け止めやすいためです。

私なら、20~30 秒の連続した商品、ファッション、物語のショットでは Seedance 2.5 から始めます。1 秒ごとの生成費用を下げるより、連続性の継ぎ目を減らす方が時間の節約につながる場合があるためです。

対象がUI アニメーションと文字組みなら、早い段階で H3 を試しましょう。大量の参照素材を使う複雑な制作では、Seedance の大きなマルチモーダル入力容量が構造上の強みになります。

特に、同じプロンプト 1 つだけでベンチマークを取らないでください。同じ創作意図を使い、モデルごとにワークフローを最適化し、複数回試して、実際に使える出力の割合を比較しましょう。

よくある質問

H3 は本当に 30 秒の動画を生成できるか?

H3 の公式出力範囲は4~15 秒です。調査した実験的なローカルワークフローでは 20~30 秒まで延ばしていましたが、公式対応範囲外であり、大幅に多くの計算資源が必要になり、一貫性のリスクも高まる場合があります。

H3 は 12GB VRAM で動くか?

はい。調査には、RTX 3060 12GB で 5 秒、864×480 のクリップを 20 ステップ、9 分未満で生成するワークフローが含まれます。ただし、システム RAM、Torch、CUDA、オフロード、解像度、生成モードによって性能は大きく変わります。

キャラクターの一貫性では Seedance 2.5 は H3 より優れているか?

対象が長く連続する制作ショットなら、最大 30 秒と大規模な参照セットに対応する Seedance 2.5 の方が強いワークフローを持ちます。H3 も短く制御されたクリップでは高い能力を保ちますが、調査した事例では、尺や複数キャラクターの相互作用が増えるほど難しさが増していました。

Seedance 2.5 と H3、安いのはどちらか?

H3 はローカル生成や API により、直接の現金支出を抑えられる場合がありますが、ハードウェアの時間や失敗レンダリングにもコストがあります。Seedance は 1 回の試行費用が高くても、つなぎ合わせやインフラ作業を減らせる場合があります。生成 1 秒当たりの価格ではなく、使えるクリップ当たりのコストを比較してください。

結論

Seedance 2.5 と MiniMax H3 は、万能な品質の王座を争っているのではなく、異なる制作ワークフローを最適化しています。私が Seedance 2.5 を出発点に選ぶのは、20~30 秒の連続ショット、大規模なマルチモーダル参照セット、編集の多い専門制作です。一方、H3 がより魅力的なのは、ローカルでの主導権、ComfyUI のカスタマイズ、短尺の反復制作、文字組み、大量の創作探索です。最も有力な判断指標は、最大尺、解像度、API 価格ではありません。各モデルが時間、計算資源、参照素材、やり直しを、実際に使える水準の素材へどれだけ確実に変えられるかです。

シェアX でシェアLinkedIn でシェア

Virse ブログの他の記事