Gemini Omni는 Google DeepMind가 더 큰 Gemini 프로젝트의 일부로 만든 AI 영상 모델 패밀리입니다. 텍스트 프롬프트나 이미지를 주면 완성된 영상이 돌아옵니다. 설계된 숏, 움직이는 카메라, 그리고 립싱크된 대사가 담긴 네이티브 사운드까지 — 전부 한 번의 생성 과정에서 만들어집니다.
구글은 2026년 5월 I/O 키노트에서 Omni를 발표하고, 첫 공개 모델인 Gemini Omni Flash를 6월 30일 프리뷰로 출시했습니다. 대화형 편집을 지원하는 720p 텍스트 투 비디오 모델로, 독립 평가인 LMArena Video Arena에서 텍스트 투 비디오 1위(블라인드 사람 투표 1515 Elo)로 데뷔했습니다. 후속작 Gemini Omni 1.1 Flash는 2026년 8월 27일 정식 출시되었습니다.
Gemini Omni가 다른 점
- 네이티브 사운드, 나중에 입히지 않습니다. 음악, 효과음, 음성이 영상과 함께 생성되고 동작과 동기화됩니다. 대사를 따옴표로 감싸면 캐릭터가 입 모양까지 맞춰 말합니다.
- 대화형 편집. 완성된 클립이 대화의 끝이 아닙니다. "골든아워로 바꿔 줘" 또는 "재킷을 트렌치코트로 바꿔 줘"라고 말하면 모델이 그 변화만 반영해 장면을 다시 생성합니다.
- 레퍼런스와 연장. Omni 1.1 Flash는 생성당 이미지 레퍼런스와 최대 3개의 짧은 영상 클립을 받고, 첫 프레임과 마지막 프레임 사이를 보간하며, 완성된 장면을 10초 단위로 최대 40초까지 연장합니다.
어디에서 쓸 수 있나
OmniRender는 브라우저에서 Omni 모델을 돌립니다. 대기 명단도 설치도 없습니다. 무료 플랜에는 카드 없이 매달 360p 영상 몇 개가 포함되고, 월 14달러부터의 유료 플랜은 더 많은 영상, 720p~4K 출력, 영상 레퍼런스, 상업용 라이선스를 더합니다. 개발자는 Omni API로 같은 모델을 호출할 수 있습니다.
워터마크와 출처
Gemini Omni로 생성된 모든 클립에는 구글의 보이지 않는 SynthID 워터마크와 C2PA 출처 메타데이터가 담깁니다. 영상에 보이는 도장 없이도 AI 생성 영상임을 식별할 수 있습니다.
첫 클립을 만들 준비가 됐다면 Gemini Omni Flash 사용법을 확인하세요