ネイティブマルチモーダル
1つの画面でテキスト、画像、動画、音声を入力できます。
テキスト、画像、動画、音声を入力できるGoogleのネイティブマルチモーダル動画モデル。Virseではフレーム駆動版と参照素材駆動版を提供しています。
作成を始めるには、デスクトップのブラウザでこのページを開いてください。
Gemini Omni Flashは2026年6月に発表されたGoogleの高速動画モデルで、理解しておきたいのは受け付ける入力です。
多くの動画モデルは画像1枚と1段落の文章を受け取ります。このモデルはネイティブマルチモーダルで、テキスト、画像、動画、音声を、後付けの別々のアダプターではなく同じ画面から入力できます。これは機能一覧ではなく構造上の性質であり、異なる方向を示す入力をモデルが整合的にまとめる仕組みに表れます。Googleは対話による調整も重視して設計しており、ブリーフを書き直す代わりに対話を続けてクリップを調整できます。
入力素材が多様で、画像制作にすでにGoogleを使っているならGemini Omni Flashを使ってください。Nano BananaやGemini画像モデルの静止画を動かし、参考素材からショットを作り、クリップへの応答で調整を繰り返せます。

Gemini Omni FlashはGoogle DeepMindが開発したAI動画生成モデルで、処理速度を設計上の優先事項とするGemini Flashシリーズの一員です。2026年6月に、動画生成と対話型動画編集の費用効率に優れた選択肢として発表されました。
このモデルには3つの主な強みがあります。
Virseには2つのモデルが掲載されています。Gemini Omni Flashは開始フレーム、終了フレーム、または両方と文章の指示を受け取ります。Gemini Omni Flash Referenceは代わりに提供された参考画像から作成します。Virseで提供されるのは720P構成で、毎回の生成でネイティブ音声を作成するため、ここでは音声の演出指示はブリーフに含まれません。

1つの画面でテキスト、画像、動画、音声を入力できます。
フレーム駆動版と参照素材駆動版が、Virseに別々に掲載されています。

Virseで提供するサイズです。音声は映像とともにネイティブ生成されます。
Flash系のモデルです。動画では、静止画以上にその速さが重要です。
指示を書き直さず、続けて指示することで結果を調整します。
生成したすべてのクリップに埋め込まれる、知覚できない信号です。

ネイティブマルチモーダルとは、テキスト、画像、動画、音声を別々のエンコーダーに渡さず、同じモデルで処理することです。後からつなぎ合わせたシステムでは競合する入力も、整合させて扱います。

Googleのより高負荷な動画モデルVeo 3.1はフレーム駆動です。Gemini Omni Flashには参照画像を使う経路が加わり、Googleファミリー内でこの種の連続性を制御する唯一の方法となっています。

1か所を直すためにブリーフを一から書き直すのではなく、反復調整に向けて設計されています。最初の結果は出発点という設計思想です。

Flashシリーズは処理の速さを重視します。生成が遅いと集中が完全に途切れる動画制作では、静止画以上にそれが重要です。

Nano Banana Pro、Nano Banana 2、Gemini 2.5 Flash Imageで作ったフレームは同じファミリー由来のため、静止画から動画へ移る際にも視覚的な特徴がつながります。

SynthIDはすべてのクリップに自動で埋め込まれ、映像に何も表示せず、設定を有効にする必要もなく、AI生成であることを識別できます。
制作工程全体で同じモデルファミリーを使い続けるのは、単なる好みに思えるかもしれません。しかし、プロジェクトの途中で提供元を変え、動画版が静止画に合わない理由を探るのに午後を費やすと、その意味がわかります。 Virseでは、同じファミリーで進めるのが最も手軽な方法です。キャンバス上のGoogleの画像モデルで生成したフレームを、書き出さずに直接Gemini Omni Flashへ渡せるため、静止画から動画への移行がその場で完結します。
Nano BananaやGeminiの画像フレームを、同じキャンバス上で直接動画モデルへ渡します。

各調整結果は元になったバージョンの隣に置かれるため、対話型の作業過程を後から確認できます。

キャンバスを離れたりブリーフを書き直したりせずに、Gemini Omni Flashと30以上の他の画像・動画モデルを切り替えられます。

追加の負荷に見合うかを知りたいときは、同じフレームを隣でVeo 3.1にも実行させてください。


Googleファミリーの他のモデルで生成した画像に動きを加えます。

説明ではなく参考画像で被写体を定義するショット。

解像度より処理速度が重要な短いクリップ。

指定した開始フレームからのシンプルな登場演出や回転。

制作を決める前にショットのアイデアを確かめる、動きのある参考映像。

最初から完璧に指定するのではなく、複数回にわたって調整するクリップ。
フレームがあるなら標準版を使います。クリップ間で被写体を維持する必要があるならReference版を使います。
構図となる画像、または各画像の役割を明示した参考画像セットを追加します。
シーン内の動き、カメラの動作、テンポを説明します。音声は映像とともに生成されるため、セリフや環境音の指示を含めると役立ちます。
元のブリーフを書き直さず、追加の指示で結果を調整します。
効果的なGemini Omni Flashのプロンプトには通常4つの要素が含まれます。
こう書く代わりに
窓を開ける人物、心地よい自然な動き、映画のような表現。
こう書く
上げ下げ窓の下枠に両手を置いて立つ人物を、腰の高さから後ろ向きに捉える。1回の滑らかな動きで窓を完全に開くまで押し上げ、その後手を下ろす。カメラは終始固定し、前進も横移動もしない。窓が開き、腕を体の横に下ろした状態で終了。

Image 1から開始:窓辺に紅茶のカップが置かれ、湯気が立ち、カーテンは静止している。 クリップの前半で右からのそよ風がカーテンを持ち上げ、その後落ち着く。湯気は終始立ち続ける。 カメラは固定の近接ショットを維持し、移動もカットもなし。 Image 2で終了:カーテンは落ち着き、カップはそのまま。

Image 1の人物、Image 2のエプロン、Image 3のベーカリーのカウンターを使用。 彼はパンを載せたトレイをカウンターに置き、体を起こし、エプロンで手を拭く。 カウンターの客側から固定のミディアムショット。カメラは動かない。 顔、髪、エプロンの色と形を見本どおりに正確に維持する。両手を体の横に下ろして終了。

塗装されたレンガ壁に立てかけた自転車を正面から見る。 シーン内では何も動かない。カメラは一定の速さでゆっくり左へ移動し、自転車を画面内に保ちながら、その右側の出入口を見せる。 終始均一な曇天の光。 自転車が右端、出入口が中央にある構図で終了。
| 比較項目 | Gemini Omni Flash | Veo 3.1 |
|---|---|---|
| 入力形式 | テキスト、画像、動画、音声 | テキストとフレーム |
| 参照素材駆動版 | あり、別途掲載 | なし |
| Virseでの出力 | 720P、無音 | 720p~4K、音声は任意 |
| デザイン目標 | 仕上がりの速さ | 出力の上限 |
| シーケンスの構築 | 対話による調整 | シーン延長 |
| 選ぶべき場面 | 入力が多様、または被写体を維持する必要がある場合 | 長さ、音声、4Kが必要な作品 |
終わりのない説明ではなく、動きの始まりと終わりを明確にしてください。
Reference版では、どの画像が被写体を、どの画像が背景設定を提供するのか指定してください。
Nano BananaやGemini 2.5 Flash Imageの画像は、視覚的な特徴を変えずにこのモデルへ引き継げます。
このモデルは追加の指示を受けるよう作られています。ブリーフ全体を書き直すと、うまくいった部分まで失います。
Googleファミリーの画像モデルで作ったフレームを動かすか、参考画像セットからショットを作成できます。どちらもキャンバスを離れずに行えます。