Gemini Omni 1.1 Flash je nejnovější multimodální AI video model od Googlu navržený pro tvorbu a úpravu videí pomocí textových, obrázkových a video vstupů. Ve srovnání s předchozími video nástroji s umělou inteligencí se zaměřuje na lepší konzistenci scén, konverzační úpravy a filmové ovládání. V tomto průvodci prozkoumáme jeho funkce, reálné případy použití, prompty, omezení a to, jak si můžete Gemini Omni 1.1 vyzkoušet prostřednictvím ChatGoat AI.

Co se změnilo od verze Omni 1.0 k Omni 1.1
Původní Gemini Omni Flash, představený na Google I/O v květnu 2026, přinesl základní myšlenku: jeden model, který přijímá text, obrázek, zvuk nebo video jako vstup a v jediném průchodu generuje synchronizovaný video výstup. Verze 1.1 tyto základy nenahrazuje – přidává vrstvy ovládání, o které vývojáři od spuštění žádali.
| Schopnost | Gemini Omni 1.0 | Gemini Omni 1.1 |
|---|---|---|
| Prodloužení scény | Analyzoval pouze poslední sekundu záběru | Analyzuje až 10 sekund předchozího záběru pro konzistentnější pokračování |
| Maximální nepřetržitá délka | ~10 sekund na jedno vygenerování | Až 40 sekund celkově, přidáváno v 10sekundových krocích |
| Ovládání snímků | Není k dispozici | Nastavení prvního a posledního snímku pro vygenerování pohybu mezi nimi |
| Referenční vstup | Text/obrázek/zvuk | Přidává až 3 sekundy externího videa jako referenci pro styl/pohyb |
| Režim konceptu | Pouze standardní generování | Režim konceptu v 360p, o ~60 % rychlejší a přibližně za třetinu ceny oproti 720p |
| Maximální rozlišení | 1080P | Až 4K (pomocí upscalingu, nikoli nativní generování) |
Čísla, ve kterých se všichni pletou
Velká část zpráv zveřejněných v prvních 24 hodinách naznačuje, že Gemini Omni 1.1 dokáže vygenerovat jeden nepřetržitý 40sekundový klip ve 4K. Nedokáže to a je důležité zde být přesní, protože to přímo ovlivňuje plánování produkčního workflow:
- Každé jednotlivé vygenerování
- trvá 3–10 sekund při 24 FPS, nikoli 40. Číslo 40 sekund je celkový součet dosažený opakovaným prodlužováním klipu v 10sekundových krocích, přičemž model pokaždé znovu analyzuje konec předchozího segmentu.
- 4K je upscalované, nikoli nativně generované. Model generuje v nižším rozlišení a k dosažení 1080p nebo 4K využívá upscaling od Googlu. Dokumentace k API to uvádí výslovně. Pokud potřebujete nativní detaily ve vysokém rozlišení (jemný text, složité textury), počítejte se stejnými omezeními, jaká má jakýkoli proces upscalingu.
- Interpolace prvního/posledního snímku je skutečně nová a užitečná pro švihy kamery, zoom přechody a smyčkové klipy – funguje však na jednom 3–10sekundovém segmentu, nikoli na celé prodloužené sekvenci.
Nic z toho nečiní Omni 1.1 méně užitečným – stále se jedná o významný posun v ovládání, což bylo pro produkční týmy skutečné úzké hrdlo. Znamená to jen, že „40 sekund 4K videa“ je výsledek pracovního postupu, nikoli jednoho vygenerování.
Ceny
Gemini Omni 1.1 Flash se účtuje za sekundu výstupu a cena se mění v závislosti na rozlišení:
| Rozlišení | Cena za sekundu |
|---|---|
| 360P (koncept) | $0.03 |
| 720P | $0.10 |
| 1080P | $0.15 |
| 4K (upscalované) | $0.30 |
Režim konceptu v 360p existuje speciálně proto, aby týmy mohly levně zkoušet různé prompty a kompozice předtím, než se rozhodnou pro render v plném rozlišení – 10sekundový klip ve 4K stojí 3,00 $, zatímco stejný klip v 360p vyjde na 0,30 $.
Gemini Omni 1.1 vs. Seedance 2.5 a MiniMax H3
Dva modely, které jsou v současnosti nejčastěji přímo srovnávány s Omni 1.1, nejsou obvyklí konkurenti Googlu – jsou to Seedance 2.5 od ByteDance a H3 s otevřenými váhami od MiniMaxu, přičemž oba byly vydány v rozmezí několika stejných týdnů a oba mají agresivní cenovou politiku.
| Model | Silná stránka | Maximální výstup | Možnosti úprav | Dostupnost |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash | Konverzační úpravy v rámci jedné relace; sjednocený vstup textu/obrázku/zvuku/videa v jediném průchodu | 3–10 s na jedno vygenerování, možnost celkového prodloužení až na 40 s v 10sekundových krocích | První/poslední snímek, prodloužení scény, referenční video pro styl | Uzavřený, pouze API / AI Studio |
| Seedance 2.5 | Dlouhé vyprávění příběhů a generování silně založené na referencích – až 50 referenčních obrázků, videí a zvukových souborů v jednom požadavku | Až 30 sekund v jediném průchodu (podle specifikace ByteDance) | Ovládání prvního snímku a prvního i posledního snímku, vícekolové úpravy na úrovni časových značek | Uzavřený, zaváděn prostřednictvím BytePlus/Jimeng/Doubao |
| MiniMax H3 | Agresivní poměr cena/výkon, nativní rozlišení 2K se synchronizovaným stereo zvukem generovaným ve stejném průchodu | Až 15 sekund nativně | Ovládání prvního/posledního snímku, přenos pohybu z videa na video | Otevřené váhy (komunitní licence) + hostované API |
Několik věcí, které stojí za to zmínit, než si vyberete:
- Nativní délka je oblast, ve které má Seedance 2.5 na papíře navrch. Vlastní specifikace ByteDance uvádí až 30 sekund v jediném průchodu generování, na rozdíl od 10sekundových segmentů u Omni 1.1 spojených do celkových 40 sekund. Zda toto tvrzení o nativních 30 sekundách platí konzistentně u všech poskytovatelů, v současnosti testují první uživatelé – dokud si to sami nevyzkoušíte, považujte to za teoretický údaj z katalogu.
- MiniMax H3 je jediný z této trojice, který má otevřené váhy, vydané pod vlastní komunitní licencí MiniMaxu (nikoli pod standardní permisivní licencí jako MIT nebo Apache 2.0). To je důležité, pokud je součástí vašich plánů lokální nasazení nebo doladění (fine-tuning) – Omni 1.1 ani Seedance 2.5 tuto možnost nenabízejí.
- Ceny se u všech tří modelů výrazně liší podle poskytovatele. Přímé sazby API a brány třetích stran (fal, Replicate, BytePlus, Atlas Cloud atd.) uvádějí pro stejný model výrazně odlišné ceny za sekundu, někdy až 2–3násobné. Nevěřte jedinému uváděnému číslu pro Seedance 2.5 nebo H3, aniž byste si ověřili konkrétního poskytovatele, u kterého vám bude služba skutečně účtována – ceny Omni 1.1 jsou konzistentnější, protože jediným poskytovatelem je Google.
- Skutečnou konkurenční výhodou Omni 1.1 je stále konverzační smyčka úprav přímo v relaci – výměna objektu, změna osvětlení, oprava ruky bez nutnosti resetovat stav generování. Seedance 2.5 nabízí úpravy na úrovni časových značek s podobným cílem; H3 spoléhá spíše na přenos pohybu z videa na video než na iterativní ladění promptů.
Pokud již srovnáváte Seedance 2.5 s MiniMax H3 pro své produkční pipeline, stojí za to zařadit Omni 1.1 do užšího výběru, a to zejména pro projekty, které vyžadují přesné ovládání kamery na základě prvního/posledního snímku spíše než maximální nativní délku klipu nebo nejnižší cenu za sekundu.
Jak získat přístup k Gemini Omni 1.1
Gemini Omni 1.1 Flash je model určený pro vývojáře. Zatím pro něj neexistuje dedikovaná aplikace pro běžné uživatele – přístup v současnosti funguje přes:
- Google AI Studio – nejrychlejší způsob, jak model otestovat bez psaní kódu. Získáte pole pro zadávání promptů, ovládání snímků a možnosti pro koncept/upscaling.
- Gemini API (
gemini-omni-1.1-flash) – pro integraci do vlastního produktu nebo workflow.gemini-omni-flash-previewje starší verze pro náhled; verze 1.1 je stabilní vydání. - Gemini Enterprise Agent Platform – pro týmy, které již využívají Google Cloud a chtějí model propojit se stávajícími workflow agentů.
Všechny tyto možnosti vyžadují projekt na Google Cloud, povolenou fakturaci a alespoň základní znalost API klíčů nebo Agent Studia. Pokud chcete pouze prozkoumat, co dokážou základní modely Gemini – uvažování, porozumění obrázkům, multimodální chat – bez nutnosti zakládat vývojářský účet, je to jednodušší výchozí bod předtím, než se rozhodnete pro video API.
Zde do pracovního postupu vstupuje nástroj jako ChatGOAT AI. ChatGOAT vám poskytuje bezplatný přístup k modelům Gemini přímo v prohlížeči (včetně Gemini 3.7 Flash) vedle GPT 5.6 Sol, Grok 4.6 a DeepSeek, plus vestavěný AI generátor obrázků – bez zakládání účtu, nastavení fakturace či API klíčů. Pokud plánujete video projekt s Gemini Omni 1.1, můžete použít generátor obrázků v ChatGOAT k hrubému načrtnutí referencí pro první a poslední snímek ještě předtím, než se dotknete API – protože funkce interpolace snímků u Omni 1.1 vyžaduje přesně tento typ vstupu. Samotné video sice nevygeneruje, ale usnadní vám přípravu referenčních materiálů.
AI video generátor Gemini Omni 1.1: Jak vytvářet filmová videa pomocí promptů
Získat z Omni 1.1 technicky správné video je snadné. Získat však video, které působí skutečně filmově – se záměrným pohybem kamery, konzistentním osvětlením a záběrem, který vypadá jako zrežírovaný, nikoli jen vygenerovaný – závisí téměř výhradně na tom, jak strukturujete prompt.
Struktura promptu, která funguje
Ke každému promptu přistupujte jako k popisu záběru, nikoli jako k obecnému požadavku. Filmový prompt pro Omni 1.1 by měl obsahovat tyto prvky v následujícím pořadí:
- Subjekt a akce – kdo nebo co je v záběru a co dělá
- Pohyb kamery – jak se kamera chová (statická, nájezd, švenk, jeřáb, z ruky)
- Typ záběru a kompozice – široký, střední, detail, záběr přes rameno
- Osvětlení a atmosféra – zlatá hodinka, ostré studiové světlo, zataženo, neon
- Reference stylu – filmový materiál, vizuální styl režiséra nebo žánr („natočeno na 35mm film“, „tlumené barvy“, „malá hloubka ostrosti“)
Prompt, který popisuje pouze subjekt („žena procházející se v noci městem“), dává modelu příliš mnoho volnosti a obvykle vede k tuctovým pohybům. Přidání pokynů pro kameru a osvětlení je to, co posune výsledek směrem k něčemu použitelnému.
Příklad – slabý prompt:
"Auto jedoucí po horské silnici."
Příklad – filmový prompt:
"Veterán bez střechy jedoucí po klikaté pobřežní horské silnici během zlaté hodinky. Kamera namontovaná nízko na dronu, sledující jedoucí auto z boku, mírné rozmazání pohybu na kolech. Teplé sluneční světlo z nízkého úhlu, dlouhé stíny, malá hloubka ostrosti s jemně rozostřenou silnicí v popředí."
Druhá verze dává modelu Omni 1.1 konkrétní chování kamery a logiku osvětlení, čímž se skutečně projeví vylepšení modelu ve fyzice a konzistenci pohybu.
Použití ovládání prvního a posledního snímku pro filmový pohyb
Toto je nejužitečnější nástroj Omni 1.1 speciálně pro režii pohybu kamery. Místo toho, abyste pohyb kamery popisovali pouze slovy, můžete:
- Vygenerovat nebo nahrát první snímek – úvodní kompozici záběru
- Vygenerovat nebo nahrát poslední snímek – kde by kamera a subjekt měly skončit
- Zadat prompt pro pohyb mezi nimi – „pomalý nájezd kamery s přeostřením z pozadí na objekt“
Tím se nejednoznačný pokyn („dramatický zoom“) promění v definovaný počáteční a koncový stav, mezi nimiž model provede interpolaci. Výsledkem jsou mnohem konzistentnější a profesionálněji vypadající pohyby kamery než při generování pohybu od nuly. Je to obzvláště účinné u odhalovacích záběrů, reprezentativních produktových záběrů a přechodů mezi dvěma prostředími.
Nejprve koncept: Workflow pro filmové prompty
Vzhledem k tomu, že formulace promptu má obrovský vliv na výsledek, negenerujte svůj první pokus hned v plném rozlišení:
- Napište 2–3 varianty promptu, přičemž pokaždé změňte pouze popis pohybu kamery nebo osvětlení
- Vygenerujte všechny tři v konceptu v 360p (0,03 $/sekunda), abyste levně porovnali kompozici a kvalitu pohybu
- Vyberte verzi s nejlepší kompozicí a upravte formulaci promptu na základě toho, co se skutečně vygenerovalo
- Proveďte upscaling pouze u finální vybrané klapky na 1080p nebo 4K
Jedná se o stejnou iterační smyčku, kterou profesionální inženýři promptů obecně používají u video modelů, ale zde na tom záleží více, protože generování ve 4K stojí desetinásobek ceny konceptu v 360p.
Běžné termíny pro filmové prompty, které stojí za to používat
- Pohyby kamery: nájezd/odjezd (dolly in/out), švenk vlevo/vpravo (pan left/right), náklon nahoru/dolů (tilt up/down), záběr z jeřábu (crane shot), z ruky (handheld), statický záběr (static lockdown), jízda kamery (tracking shot)
- Kompozice záběru: široký celkový záběr (establishing shot), polocelek/střední záběr (medium shot), detail (close-up), velký detail (extreme close-up), záběr přes rameno (over-the-shoulder)
- Osvětlení: zlatá hodinka, modrá hodinka, kontrastní/ostré světlo, měkké rozptýlené světlo, reálné/přirozené osvětlení scény (practical lighting), silueta v protisvětle
- Pokyny pro objektiv/styl: malá hloubka ostrosti, anamorfní odlesk, filmové zrno, desaturované barvy, vzhled 35mm filmu
Pokud si chcete vyzkoušet formulaci filmových promptů předtím, než se zavážete k platbám za sekundu u Omni 1.1, můžete si vizuální styl – osvětlení, kompozici, barevnou paletu – nejprve nanečisto vytvořit jako statické snímky pomocí generátoru obrázků v ChatGOAT AI. Stejné popisné výrazy pak přenesete do promptu pro Omni 1.1. Vyladit vzhled na statickém obrázku je mnohem levnější než jej iterovat v rámci placeného generování videa.
Praktické případy použití
- Produktová demo videa: Použijte snímek produktu jako první snímek a produkt při používání jako poslední snímek. Nechte Omni 1.1 vygenerovat pohyb mezi nimi.
- Koncepty pro sociální sítě: Iterujte levně v 360p, měňte vždy jeden prvek promptu a upscalujte pouze verzi, kterou si nakonec ponecháte.
- Storyboarding: Nejprve načrtněte klíčové snímky jako statické obrázky (zde dobře poslouží generátor obrázků s AI) a poté je vložte do Omni 1.1 jako počáteční/koncové reference.
- Pokračování scény: Prodlužte děj stávajícího klipu bez nutnosti generovat vše od nuly – užitečné pro epizodický nebo seriálový obsah.
Omezení, která byste měli znát před integrací
- Nejedná se o generátor dlouhých videí na jeden záběr – pokud potřebujete více než 10 sekund, naplánujte si segmentované prodlužování.
- 4K výstup je upscalovaný; nespoléhejte na něj u obsahu vyžadujícího nativní věrnost ve vysokém rozlišení.
- Vyžaduje nastavení Google Cloud / vývojářského prostředí – pro tento konkrétní model v současnosti neexistuje žádná spotřebitelská video aplikace bez nutnosti psaní kódu (no-code).
- Cena při vyšších rozlišeních u delších spojených klipů rychle roste, proto se vyplatí od začátku zařadit do procesu iteraci v režimu konceptu.
FAQ
Je Gemini Omni 1.1 k dispozici zdarma?
Ne. Účtuje se za sekundu vygenerovaného videa, od 0,03 $/s v 360p až po 0,30 $/s ve 4K. Google AI Studio může v závislosti na vašem účtu nabízet omezené bezplatné kredity.
Dokáže Gemini Omni 1.1 vygenerovat celé 40sekundové video na jeden požadavek?
Ne. Každé generování vytvoří 3 až 10 sekund. Číslo 40 sekund označuje celkovou délku, které lze dosáhnout prodlužováním klipu v 10sekundových krocích.
Je 4K výstup nativní, nebo upscalovaný?
Upscalovaný. Vlastní dokumentace společnosti Google označuje výstupy v 1080p a 4K jako upscalované z generování v nižším rozlišení.
Jaký je rozdíl mezi Gemini Omni 1.1 a Gemini Omni Flash Preview?
gemini-omni-1.1-flash je stabilní verze připravená pro produkční nasazení. gemini-omni-flash-preview je starší předběžná verze (preview), která se postupně vyřazuje ve prospěch verze 1.1.
Musím umět kódovat, abych ho mohl používat?
Není to nutné – Google AI Studio poskytuje vizuální rozhraní. Plná integrace do produktu však vyžaduje Gemini API.
Jak se liší od prostého používání chatovacího modelu Gemini?
Standardní chatovací modely Gemini zpracovávají textové, obrázkové a logické úlohy. Omni 1.1 je v rodině modelů Gemini určen speciálně pro generování a úpravu videa – pro běžnou multimodální konverzaci, generování obrázků a každodenní pomoc s AI je jednodušším výchozím bodem nástroj jako ChatGOAT AI (postavený na Gemini a dalších špičkových modelech).

