Gemini Omni Flash AI動画生成ツール

テキスト、画像、動画、音声を入力できるGoogleのネイティブマルチモーダル動画モデル。Virseではフレーム駆動版と参照素材駆動版を提供しています。

作成を始めるには、デスクトップのブラウザでこのページを開いてください。

名前のOmniは入力側を指す

Gemini Omni Flashは2026年6月に発表されたGoogleの高速動画モデルで、理解しておきたいのは受け付ける入力です。

多くの動画モデルは画像1枚と1段落の文章を受け取ります。このモデルはネイティブマルチモーダルで、テキスト、画像、動画、音声を、後付けの別々のアダプターではなく同じ画面から入力できます。これは機能一覧ではなく構造上の性質であり、異なる方向を示す入力をモデルが整合的にまとめる仕組みに表れます。Googleは対話による調整も重視して設計しており、ブリーフを書き直す代わりに対話を続けてクリップを調整できます。

入力素材が多様で、画像制作にすでにGoogleを使っているならGemini Omni Flashを使ってください。Nano BananaやGemini画像モデルの静止画を動かし、参考素材からショットを作り、クリップへの応答で調整を繰り返せます。

The Omni in the Name Is the Input Side

Gemini Omni Flashとは?

Gemini Omni FlashはGoogle DeepMindが開発したAI動画生成モデルで、処理速度を設計上の優先事項とするGemini Flashシリーズの一員です。2026年6月に、動画生成と対話型動画編集の費用効率に優れた選択肢として発表されました。

このモデルには3つの主な強みがあります。

  • テキスト、画像、動画、音声入力を受け付けるネイティブマルチモーダル対応
  • 指示を続けてクリップを調整する対話型の改善
  • すべての出力に埋め込まれるSynthIDの来歴情報

Virseには2つのモデルが掲載されています。Gemini Omni Flashは開始フレーム、終了フレーム、または両方と文章の指示を受け取ります。Gemini Omni Flash Referenceは代わりに提供された参考画像から作成します。Virseで提供されるのは720P構成で、毎回の生成でネイティブ音声を作成するため、ここでは音声の演出指示はブリーフに含まれません。

What Is Gemini Omni Flash?

Gemini Omni Flashの仕様早見表

ネイティブマルチモーダル

1つの画面でテキスト、画像、動画、音声を入力できます。

2つのエントリー

フレーム駆動版と参照素材駆動版が、Virseに別々に掲載されています。

720P Output

720P出力

Virseで提供するサイズです。音声は映像とともにネイティブ生成されます。

Flashクラスの速度

Flash系のモデルです。動画では、静止画以上にその速さが重要です。

対話による調整

指示を書き直さず、続けて指示することで結果を調整します。

SynthID による来歴管理

生成したすべてのクリップに埋め込まれる、知覚できない信号です。

Gemini Omni Flash AI動画生成ツールの主な機能

Two Entries

すべての入力形式を1つの画面で

ネイティブマルチモーダルとは、テキスト、画像、動画、音声を別々のエンコーダーに渡さず、同じモデルで処理することです。後からつなぎ合わせたシステムでは競合する入力も、整合させて扱います。

Refinement by Conversation

最上位モデルにはない参照素材駆動版

Googleのより高負荷な動画モデルVeo 3.1はフレーム駆動です。Gemini Omni Flashには参照画像を使う経路が加わり、Googleファミリー内でこの種の連続性を制御する唯一の方法となっています。

Refinement by Conversation

対話で仕上げる

1か所を直すためにブリーフを一から書き直すのではなく、反復調整に向けて設計されています。最初の結果は出発点という設計思想です。

Speed as the Design Target

速度を設計目標に

Flashシリーズは処理の速さを重視します。生成が遅いと集中が完全に途切れる動画制作では、静止画以上にそれが重要です。

Refinement by Conversation

Google画像モデルとの一貫性

Nano Banana Pro、Nano Banana 2、Gemini 2.5 Flash Imageで作ったフレームは同じファミリー由来のため、静止画から動画へ移る際にも視覚的な特徴がつながります。

Speed as the Design Target

設定不要の来歴管理

SynthIDはすべてのクリップに自動で埋め込まれ、映像に何も表示せず、設定を有効にする必要もなく、AI生成であることを識別できます。

VirseでGemini Omni Flashを使って制作

制作工程全体で同じモデルファミリーを使い続けるのは、単なる好みに思えるかもしれません。しかし、プロジェクトの途中で提供元を変え、動画版が静止画に合わない理由を探るのに午後を費やすと、その意味がわかります。 Virseでは、同じファミリーで進めるのが最も手軽な方法です。キャンバス上のGoogleの画像モデルで生成したフレームを、書き出さずに直接Gemini Omni Flashへ渡せるため、静止画から動画への移行がその場で完結します。

今作った静止画を動かす

Nano BananaやGeminiの画像フレームを、同じキャンバス上で直接動画モデルへ渡します。

Provenance Without Configuration

調整の流れを見える状態に保つ

各調整結果は元になったバージョンの隣に置かれるため、対話型の作業過程を後から確認できます。

Animate the Still You Just Generated

30以上のクリエイティブモデルにアクセス

キャンバスを離れたりブリーフを書き直したりせずに、Gemini Omni Flashと30以上の他の画像・動画モデルを切り替えられます。

Keep the Iteration Thread Visible

より高負荷な選択肢と比較

追加の負荷に見合うかを知りたいときは、同じフレームを隣でVeo 3.1にも実行させてください。

Compare Against the Heavier Option

Gemini Omni Flashで何を作成できますか?

Animated Stills

静止画のアニメーション化

Googleファミリーの他のモデルで生成した画像に動きを加えます。

Reference-Driven Clips

参照素材に基づくクリップ

説明ではなく参考画像で被写体を定義するショット。

Short Social Video

短いSNS動画

解像度より処理速度が重要な短いクリップ。

Product Motion

商品のモーション

指定した開始フレームからのシンプルな登場演出や回転。

Concept Previz

コンセプトのプレビズ

制作を決める前にショットのアイデアを確かめる、動きのある参考映像。

Iterative Sequences

反復調整するシーケンス

最初から完璧に指定するのではなく、複数回にわたって調整するクリップ。

VirseでGemini Omni Flashを使う方法

  1. 適切なモデルを選ぶ

    フレームがあるなら標準版を使います。クリップ間で被写体を維持する必要があるならReference版を使います。

  2. 入力素材を読み込む

    構図となる画像、または各画像の役割を明示した参考画像セットを追加します。

  3. 起こることを説明する

    シーン内の動き、カメラの動作、テンポを説明します。音声は映像とともに生成されるため、セリフや環境音の指示を含めると役立ちます。

  4. やり直さずに調整する

    元のブリーフを書き直さず、追加の指示で結果を調整します。

Gemini Omni Flashのプロンプトの書き方

効果的なGemini Omni Flashのプロンプトには通常4つの要素が含まれます。

  • 開始時の状態
  • 動くもの
  • カメラ
  • 終了時の状態

こう書く代わりに

窓を開ける人物、心地よい自然な動き、映画のような表現。

こう書く

上げ下げ窓の下枠に両手を置いて立つ人物を、腰の高さから後ろ向きに捉える。1回の滑らかな動きで窓を完全に開くまで押し上げ、その後手を下ろす。カメラは終始固定し、前進も横移動もしない。窓が開き、腕を体の横に下ろした状態で終了。

Gemini Omni Flashのプロンプト例

gemini-omni-flash-prompt-examples-tea-curtain-19.jpg

フレームからフレームへ

Image 1から開始:窓辺に紅茶のカップが置かれ、湯気が立ち、カーテンは静止している。 クリップの前半で右からのそよ風がカーテンを持ち上げ、その後落ち着く。湯気は終始立ち続ける。 カメラは固定の近接ショットを維持し、移動もカットもなし。 Image 2で終了:カーテンは落ち着き、カップはそのまま。

Reference-Driven Continuity

参照駆動の連続性

Image 1の人物、Image 2のエプロン、Image 3のベーカリーのカウンターを使用。 彼はパンを載せたトレイをカウンターに置き、体を起こし、エプロンで手を拭く。 カウンターの客側から固定のミディアムショット。カメラは動かない。 顔、髪、エプロンの色と形を見本どおりに正確に維持する。両手を体の横に下ろして終了。

Simple Camera Move

シンプルなカメラ移動

塗装されたレンガ壁に立てかけた自転車を正面から見る。 シーン内では何も動かない。カメラは一定の速さでゆっくり左へ移動し、自転車を画面内に保ちながら、その右側の出入口を見せる。 終始均一な曇天の光。 自転車が右端、出入口が中央にある構図で終了。

Gemini Omni FlashとVeo 3.1の比較

比較項目Gemini Omni FlashVeo 3.1
入力形式テキスト、画像、動画、音声テキストとフレーム
参照素材駆動版あり、別途掲載なし
Virseでの出力720P、無音720p~4K、音声は任意
デザイン目標仕上がりの速さ出力の上限
シーケンスの構築対話による調整シーン延長
選ぶべき場面入力が多様、または被写体を維持する必要がある場合長さ、音声、4Kが必要な作品

Gemini Omni Flashでより良い結果を得るためのヒント

クリップごとに完結した動作を1つ

終わりのない説明ではなく、動きの始まりと終わりを明確にしてください。

参照素材の役割を指定

Reference版では、どの画像が被写体を、どの画像が背景設定を提供するのか指定してください。

フレームは同じファミリーで作成

Nano BananaやGemini 2.5 Flash Imageの画像は、視覚的な特徴を変えずにこのモデルへ引き継げます。

書き直さずに調整

このモデルは追加の指示を受けるよう作られています。ブリーフ全体を書き直すと、うまくいった部分まで失います。

Gemini Omni Flashのよくある質問

Gemini Omni Flashとは?
Gemini Omni FlashはGoogle DeepMindのネイティブマルチモーダル動画モデルで、高速な動画生成と対話型編集のために2026年6月に発表されました。テキスト、画像、動画、音声入力を受け付けます。
ここでの「ネイティブマルチモーダル」とは?
テキスト、画像、動画、音声を別々の部品の組み合わせではなく、同じ画面から1つのモデルで処理するという意味です。入力は個別に処理されるのではなく、互いに整合させられます。
Gemini Omni Flashは無料ですか?料金はいくらですか?
Gemini Omni FlashはVirseの有料プランで利用できます。生成は秒単位で月間クレジット枠から課金され、上位プランではフェアユースの範囲内で従量制の制限なく利用できます。現在の料金はVirseの料金ページに掲載されています。
Gemini Omni Flashは音声を生成しますか?
はい。Gemini Omni Flashは映像とともにネイティブ音声を生成し、Virseで提供するモデルは毎回音声を生成します。選択できる無音構成はありません。
Gemini Omni Flash Referenceとは?
フレームの代わりに参照画像を受け取る別モデルで、一連のクリップで被写体を認識可能な状態に保つ必要がある作業向けです。
Veo 3.1との違いは何ですか?
Veo 3.1は4Kに対応し、音声を生成し、シーン延長で長さを増やせます。Gemini Omni Flashはより高速で、より多くの入力形式に対応し、Veo 3.1にはない参照素材駆動版を提供します。
透かしは追加されますか?
知覚できない来歴信号であるSynthIDを埋め込みます。見える映像上には何も表示されません。
VirseでGemini Omni Flashを使うには?
どちらかのモデルを選び、フレームまたは参照画像を追加し、動きを説明して生成します。

同じファミリーで、フレームから動画へ

Googleファミリーの画像モデルで作ったフレームを動かすか、参考画像セットからショットを作成できます。どちらもキャンバスを離れずに行えます。