Gemini Omni to rodzina modeli wideo AI od Google DeepMind, zbudowana w ramach szerszego projektu Gemini. Podaj jej prompt tekstowy albo obraz, a zwróci gotowy film: zaplanowane ujęcia, ruchomą kamerę i natywny dźwięk z dialogami zsynchronizowanymi z ustami — wszystko wygenerowane w jednym przebiegu.
Google ogłosił Omni na keynote I/O w maju 2026 i wypuścił pierwszy publiczny model, Gemini Omni Flash, jako wersję zapoznawczą 30 czerwca 2026 — model tekst-na-wideo w 720p z edycją konwersacyjną, który zadebiutował na 1. miejscu w kategorii tekst na wideo w niezależnym rankingu LMArena Video Arena, z 1515 Elo w ślepym głosowaniu ludzi. Jego następca, Gemini Omni 1.1 Flash, osiągnął ogólną dostępność 27 sierpnia 2026.
Co wyróżnia Gemini Omni
- Natywny dźwięk, nie dodatek. Muzyka, efekty dźwiękowe i mowa powstają razem z obrazem i są zsynchronizowane z akcją. Umieść kwestię w cudzysłowie, a twoja postać ją wypowie, z dopasowanym ruchem ust.
- Edycja konwersacyjna. Gotowy klip to nie koniec rozmowy. Powiedz „zrób z tego złotą godzinę” albo „zamień kurtkę na trencz”, a model wygeneruje scenę na nowo tylko z tą zmianą.
- Referencje i przedłużenia. Omni 1.1 Flash przyjmuje referencje obrazów i do 3 krótkich klipów wideo na generację, interpoluje między pierwszą a ostatnią klatką i przedłuża gotowe sceny krokami co 10 sekund do 40 sekund.
Gdzie możesz go używać
OmniRender uruchamia modele Omni w przeglądarce: bez listy oczekujących, bez instalacji. Darmowy plan zawiera kilka filmów w 360p miesięcznie bez karty, a płatne plany od 14 $/mies. dodają więcej filmów, wyjście od 720p do 4K, referencje wideo i licencję komercyjną. Deweloperzy mogą wywoływać te same modele przez API Omni.
Znaki wodne i pochodzenie
Każdy klip wygenerowany przez Gemini Omni nosi niewidoczny znak wodny SynthID od Google i metadane pochodzenia C2PA, dzięki czemu materiał wygenerowany przez AI pozostaje rozpoznawalny bez widocznej pieczątki na twoim filmie.
Gotowy na pierwszy klip? Oto jak używać Gemini Omni Flash