기본 멀티모달 지원
하나의 인터페이스에서 텍스트, 이미지, 영상, 오디오를 받습니다.
텍스트, 이미지, 영상, 오디오를 입력받는 Google의 기본 멀티모달 영상 모델로, Virse에서 프레임 기반 모델과 레퍼런스 기반 모델로 제공됩니다.
데스크톱 브라우저에서 이 페이지를 열어 창작을 시작하세요.
Gemini Omni Flash는 2026년 6월 발표된 Google의 빠른 영상 모델이며, 알아둘 핵심은 어떤 입력을 받느냐입니다.
대부분의 영상 모델은 사진 한 장과 문단 하나를 받습니다. 이 모델은 기본 멀티모달 구조로 텍스트, 이미지, 영상, 오디오를 나중에 붙인 개별 어댑터 대신 같은 인터페이스로 받습니다. 이는 기능 목록이 아니라 아키텍처의 특성이며 서로 다른 방향의 입력을 일관되게 조율하는 방식에 드러납니다. Google은 브리프를 다시 쓰는 대신 대화를 이어 클립을 조정하는 대화형 개선도 설계했습니다.
입력 자료가 다양하고 이미지 제작 과정에서 이미 Google을 사용한다면 Gemini Omni Flash를 쓰세요. Nano Banana나 Gemini 이미지 모델의 정지 이미지에 움직임을 더하고 참고 자료로 샷을 만들며 클립에 응답해 반복 개선하세요.

Gemini Omni Flash는 Google DeepMind가 개발한 AI 영상 생성 모델이며 처리 속도를 설계 우선순위로 삼는 Gemini Flash 제품군에 속합니다. 2026년 6월 영상 생성과 대화형 영상 편집을 위한 비용 효율적인 선택지로 발표되었습니다.
이 모델은 세 가지 주요 강점을 중심으로 구축되었습니다.
Virse에는 두 모델이 있습니다. Gemini Omni Flash는 첫 프레임, 마지막 프레임 또는 둘 모두와 서면 브리프를 받습니다. Gemini Omni Flash Reference는 대신 제공된 예시 이미지로 작업합니다. Virse에서 제공되는 모델은 매번 기본 오디오를 렌더링하는 720P 구성이라 여기서는 오디오 연출이 브리프에 포함되지 않습니다.

하나의 인터페이스에서 텍스트, 이미지, 영상, 오디오를 받습니다.
Virse에 프레임 기반과 레퍼런스 기반 모델이 별도로 나열됩니다.

Virse에서 제공하는 크기입니다. 오디오는 영상과 함께 기본적으로 생성됩니다.
Flash 제품군 모델이며 영상에서는 정지 이미지보다 이 속도가 더 중요합니다.
지시를 다시 쓰지 않고 이어서 말하며 결과를 조정합니다.
생성한 모든 클립에 삽입되는 눈에 띄지 않는 신호입니다.

기본 멀티모달 지원은 텍스트, 이미지, 영상, 오디오를 별도 인코더에 넘기는 대신 같은 모델에서 처리한다는 뜻입니다. 따로 조합한 시스템에서 충돌할 입력도 서로 조율해 처리합니다.

Google의 더 무거운 영상 모델 Veo 3.1은 프레임 기반입니다. Gemini Omni Flash는 참고 이미지 경로를 추가하며, Google 제품군 안에서 이런 연속성 제어를 할 수 있는 유일한 방법입니다.

한 가지를 고치려고 브리프를 처음부터 다시 쓰는 대신 반복해서 조정하도록 만들어졌습니다. 첫 결과를 출발점으로 삼는다는 설계 전제입니다.

Flash 제품군은 처리 속도를 최적화합니다. 생성이 느리면 집중이 완전히 끊기는 영상 작업에서는 정지 이미지보다 이 점이 더 중요합니다.

Nano Banana Pro, Nano Banana 2, Gemini 2.5 Flash Image로 만든 프레임은 같은 제품군에서 나오므로 정지 이미지에서 모션으로 넘어갈 때 시각적 특성이 이어집니다.

SynthID는 모든 클립에 자동으로 삽입되어 화면에 표시하거나 따로 켤 필요 없이 AI 생성물임을 식별합니다.
작업 과정 전체에서 같은 모델 제품군을 쓰는 것은 취향처럼 들립니다. 하지만 프로젝트 도중 공급업체를 바꾸고 애니메이션이 정지 이미지와 맞지 않는 이유를 찾느라 오후를 보내면 달라집니다. Virse에서는 같은 제품군을 사용하는 것이 가장 간편합니다. 캔버스의 어느 Google 이미지 모델로 만든 프레임이든 내보내기 없이 Gemini Omni Flash로 바로 전달할 수 있어 정지 이미지에서 모션으로 그 자리에서 전환됩니다.
같은 캔버스에서 Nano Banana 또는 Gemini 이미지 프레임을 영상 모델로 바로 전달하세요.

각 개선본이 원본 버전 옆에 놓이므로 대화 방식의 작업도 나중에 검토할 수 있습니다.

캔버스를 벗어나거나 브리프를 다시 쓰지 않고 Gemini Omni Flash와 30개 이상의 다른 이미지 및 영상 모델 사이를 오가세요.

추가 부담이 그만한 가치가 있는지 알고 싶다면 같은 프레임을 옆에서 Veo 3.1에도 실행해 보세요.


Google 제품군의 다른 모델로 생성한 이미지에 움직임을 더합니다.

설명 대신 예시 이미지로 피사체를 정의하는 샷.

해상도보다 처리 속도가 중요한 빠른 클립.

지정한 시작 프레임에서 간단하게 드러나거나 회전하는 연출.

제작을 확정하기 전에 샷 아이디어를 확인하는 움직이는 참고 영상.

처음부터 완벽히 지정하는 대신 여러 차례 다듬는 클립.
프레임이 준비되어 있다면 표준 모델을 사용하세요. 여러 클립에서 피사체를 유지해야 한다면 Reference를 사용하세요.
구도 이미지 또는 각 사진의 역할을 명시한 예시 모음을 넣으세요.
장면의 움직임, 카메라 동작, 속도를 설명하세요. 오디오는 영상과 함께 렌더링되므로 대사와 주변음 지시를 넣으면 좋습니다.
원래 브리프를 다시 쓰지 말고 후속 지시로 결과를 조정하세요.
유용한 Gemini Omni Flash 프롬프트에는 보통 네 가지 요소가 포함됩니다.
이렇게 쓰는 대신
창문을 여는 사람, 보기 좋은 자연스러운 움직임, 영화 같은 표현.
이렇게 쓰세요
아래쪽 창틀에 양손을 얹고 미닫이 수직창 앞에 서 있는 사람을 허리 높이에서 뒤쪽으로 본다. 한 번의 부드러운 움직임으로 창문을 완전히 열릴 때까지 밀어 올린 뒤 손을 내린다. 카메라는 내내 정지하고 앞으로나 옆으로 이동하지 않는다. 창문이 열리고 팔을 몸 양옆에 내린 상태로 끝낸다.

Image 1에서 시작: 창턱 위 찻잔에서 김이 오르고 커튼은 정지해 있다. 클립 전반부에 오른쪽 바람이 커튼을 들어 올린 뒤 가라앉는다. 김은 내내 계속 오른다. 카메라는 움직임과 컷 없이 고정된 근접 샷을 유지한다. Image 2에서 끝: 커튼이 가라앉고 찻잔은 변하지 않는다.

Image 1의 인물, Image 2의 앞치마, Image 3의 빵집 카운터를 사용한다. 그가 빵을 담은 쟁반을 카운터에 놓고 몸을 편 뒤 앞치마에 손을 닦는다. 카운터 고객 쪽에서 촬영하는 고정 미디엄 샷으로 카메라는 움직이지 않는다. 얼굴, 머리카락, 앞치마의 색상과 재단을 예시 그대로 정확히 유지한다. 손을 몸 양옆에 내린 상태로 끝낸다.

칠한 벽돌벽에 기대 놓은 자전거를 정면에서 본 모습. 장면 안의 어떤 것도 움직이지 않는다. 카메라가 일정한 속도로 천천히 왼쪽으로 이동하며 자전거를 프레임 안에 유지하고 오른쪽 출입구를 드러낸다. 내내 고른 흐린 날의 빛. 자전거는 오른쪽 가장자리, 출입구는 중앙에 놓인 상태로 끝낸다.
| 비교 항목 | Gemini Omni Flash | Veo 3.1 |
|---|---|---|
| 입력 유형 | 텍스트, 이미지, 영상, 오디오 | 텍스트와 프레임 |
| 레퍼런스 기반 모델 | 있음, 별도 항목으로 제공 | 없음 |
| Virse에서의 출력 | 720P, 무음 | 720p~4K, 오디오 선택 가능 |
| 설계 목표 | 처리 속도 | 출력 한계 |
| 시퀀스 구성 | 대화형 개선 | 장면 확장 |
| 선택할 상황 | 입력이 다양하거나 피사체를 유지해야 할 때 | 길이, 오디오 또는 4K가 필요한 작업 |
끝이 정해지지 않은 설명 대신 움직임의 시작과 끝을 명확히 지정하세요.
Reference 모델에서는 어떤 이미지가 피사체를, 어떤 이미지가 배경을 제공하는지 설명하세요.
Nano Banana 또는 Gemini 2.5 Flash Image의 이미지를 시각적 특성 변화 없이 이 모델에 전달할 수 있습니다.
후속 지시를 받도록 만들어진 모델입니다. 브리프 전체를 다시 쓰면 이미 잘된 부분도 버리게 됩니다.
Google 제품군 이미지 모델로 만든 프레임에 움직임을 더하거나 레퍼런스 모음으로 샷을 만드세요. 어느 쪽이든 캔버스를 벗어날 필요가 없습니다.