Multimodal Secara Native
Teks, gambar, video, dan audio diterima melalui satu antarmuka.
Model video Google yang multimodal secara native, menerima teks, gambar, video, dan audio, ditawarkan di Virse sebagai entri berbasis bingkai dan berbasis referensi.
Buka halaman ini di peramban desktop untuk mulai berkarya.
Gemini Omni Flash adalah model video cepat Google, diumumkan Juni 2026, dan hal penting untuk dipahami adalah jenis masukannya.
Kebanyakan model video menerima gambar dan paragraf. Model ini multimodal secara native—teks, gambar, video, dan audio masuk melalui antarmuka yang sama, bukan adaptor terpisah yang ditambahkan kemudian. Ini sifat arsitektur, bukan daftar fitur, terlihat dari cara model menyelaraskan masukan yang mengarah ke hal berbeda. Google juga merancang penyempurnaan melalui percakapan: klip disesuaikan dengan melanjutkan percakapan, bukan menulis ulang arahan.
Gunakan Gemini Omni Flash ketika masukan beragam dan alur gambar sudah memakai Google. Animasikan gambar Nano Banana atau Gemini, arahkan bidikan dari materi referensi, dan perbaiki klip dengan menanggapinya.

Gemini Omni Flash adalah model pembuatan video AI dari Google DeepMind, bagian lini Gemini Flash yang memprioritaskan kecepatan penyelesaian. Model diumumkan Juni 2026 sebagai pilihan hemat biaya untuk pembuatan video dan penyuntingan melalui percakapan.
Model ini memiliki tiga keunggulan utama:
Virse menyediakan dua entri. Gemini Omni Flash menerima bingkai pertama, terakhir, atau keduanya, beserta arahan tertulis. Gemini Omni Flash Reference memakai gambar contoh yang diberikan. Entri di Virse adalah konfigurasi 720P yang merender audio native pada setiap pembuatan, sehingga arahan audio bukan bagian dari arahan di sini.

Teks, gambar, video, dan audio diterima melalui satu antarmuka.
Berbasis bingkai dan berbasis referensi, terdaftar terpisah di Virse.

Ukuran yang ditawarkan di Virse. Audio dibuat secara native bersama gambar.
Model lini Flash, yang kecepatannya lebih penting pada video daripada gambar diam.
Sesuaikan hasil dengan melanjutkan instruksi, bukan menulisnya ulang.
Sinyal tak kasatmata tertanam dalam setiap klip yang dibuat.

Multimodalitas native berarti teks, gambar, video, dan audio ditangani model yang sama, bukan diteruskan melalui encoder terpisah. Masukan yang akan bertentangan dalam sistem rakitan justru diselaraskan.

Veo 3.1, model video Google yang lebih berat, berbasis bingkai. Gemini Omni Flash menambahkan jalur gambar referensi, satu-satunya cara mendapatkan kontrol kontinuitas semacam itu dalam keluarga Google.

Alih-alih menulis ulang arahan dari awal untuk memperbaiki satu hal, model dibuat untuk penyesuaian bertahap—hasil pertama diasumsikan sebagai titik awal.

Lini Flash mengoptimalkan kecepatan penyelesaian. Pada video, ketika pembuatan lambat memutus konsentrasi sepenuhnya, hal itu lebih penting daripada pada gambar diam.

Bingkai dari Nano Banana Pro, Nano Banana 2, atau Gemini 2.5 Flash Image berasal dari keluarga yang sama, menjaga karakter visual selama perpindahan dari diam ke bergerak.

SynthID tertanam otomatis dalam setiap klip, menandainya sebagai hasil AI tanpa tampilan pada gambar atau sesuatu yang perlu diaktifkan.
Memakai satu keluarga model sepanjang proses terdengar seperti preferensi, sampai Anda berganti penyedia di tengah proyek dan menghabiskan sore untuk mencari sebab versi animasi tidak cocok dengan gambar diam. Virse menjadikan jalur dalam satu keluarga sebagai pilihan termudah. Bingkai dari model gambar Google mana pun di kanvas langsung masuk ke Gemini Omni Flash tanpa ekspor, sehingga perpindahan dari diam ke bergerak terjadi di tempat.
Kirim bingkai Nano Banana atau Gemini langsung ke model video pada kanvas yang sama.

Setiap penyempurnaan berada di samping versi asalnya, sehingga alur kerja percakapan dapat ditinjau kembali.

Beralih antara Gemini Omni Flash dan lebih dari 30 model gambar serta video lain tanpa meninggalkan kanvas atau menulis ulang arahan.

Jalankan bingkai yang sama melalui Veo 3.1 di sampingnya untuk menilai apakah beban tambahannya sepadan.


Gerakan ditambahkan pada gambar yang dibuat model lain dalam keluarga Google.

Bidikan dengan subjek yang ditentukan lewat gambar contoh, bukan deskripsi.

Klip cepat ketika waktu penyelesaian lebih penting daripada resolusi.

Pengungkapan dan rotasi sederhana dari bingkai pembuka yang ditentukan.

Referensi bergerak untuk ide bidikan sebelum menetapkan keputusan.

Klip yang disempurnakan dalam beberapa putaran, bukan ditentukan sempurna sejak awal.
Jika sudah punya bingkai, gunakan entri standar. Jika subjek harus konsisten antarklip, gunakan Reference.
Masukkan komposisi, atau kumpulan contoh dengan tugas setiap gambar dijelaskan.
Jelaskan gerakan adegan, perilaku kamera, dan tempo. Audio dirender bersama gambar, jadi petunjuk dialog dan suasana layak disertakan.
Sesuaikan hasil dengan instruksi lanjutan, bukan menulis ulang arahan awal.
Prompt Gemini Omni Flash yang berguna biasanya mencakup empat unsur:
Alih-alih menulis
Seseorang membuka jendela, gerakan alami yang bagus, sinematik.
Tulis
Seseorang berdiri di jendela geser vertikal dengan kedua tangan pada bingkai bawah, dilihat dari belakang setinggi pinggang. Ia mendorong jendela ke atas dalam satu gerakan mulus hingga terbuka penuh, lalu menurunkan tangan. Kamera tetap diam, tanpa maju atau bergeser. Akhiri dengan jendela terbuka dan lengan di sisi tubuh.

Mulai dari Gambar 1: secangkir teh di ambang jendela, uap naik, tirai diam. Angin mengangkat tirai dari kanan sepanjang separuh pertama klip, lalu tirai turun. Uap terus naik sepanjang klip. Kamera mempertahankan bidikan dekat statis, tanpa gerakan atau potongan. Akhiri pada Gambar 2: tirai sudah turun, cangkir tidak berubah.

Gunakan orang pada Gambar 1, celemek dari Gambar 2, dan konter toko roti pada Gambar 3. Ia meletakkan nampan roti di konter, berdiri tegak, dan mengelap tangan pada celemek. Bidikan sedang tetap dari sisi pelanggan konter, kamera tidak bergerak. Pertahankan wajah, rambut, serta warna dan potongan celemek persis seperti yang ditampilkan. Akhiri dengan tangannya di sisi tubuh.

Sepeda bersandar pada dinding bata bercat, dilihat lurus dari depan. Tidak ada yang bergerak dalam adegan. Kamera bergeser perlahan ke kiri dengan kecepatan konstan, menjaga sepeda dalam bingkai dan memperlihatkan pintu di kanannya. Cahaya mendung merata sepanjang klip. Akhiri dengan sepeda di tepi kanan dan pintu di tengah.
| Dimensi | Gemini Omni Flash | Veo 3.1 |
|---|---|---|
| Jenis masukan | Teks, gambar, video, dan audio | Teks dan bingkai |
| Entri referensi | Ya, terdaftar terpisah | Tidak |
| Hasil di Virse | 720P, tanpa suara | 720p hingga 4K, audio opsional |
| Target desain | Kecepatan penyelesaian | Batas output |
| Penyusunan rangkaian | Penyempurnaan melalui percakapan | Perpanjangan adegan |
| Pilih ketika | Masukan beragam atau subjek harus konsisten | Karya membutuhkan durasi, audio, atau 4K |
Berikan awal dan akhir gerakan yang jelas, bukan deskripsi terbuka.
Pada entri Reference, sebutkan gambar yang menyediakan subjek dan yang menyediakan latar.
Gambar Nano Banana atau Gemini 2.5 Flash Image diteruskan ke model ini tanpa perubahan karakter visual.
Model dibuat untuk instruksi lanjutan. Menulis ulang seluruh arahan membuang hal yang sudah berhasil.
Animasikan bingkai yang sudah dibuat model gambar keluarga Google, atau arahkan bidikan dari kumpulan referensi—keduanya tanpa meninggalkan kanvas.