Google erweitert sein KI-Modell-Portfolio mit zwei leistungsstarken Neuheiten. Nano Banana 2 Lite soll das schnellste und kosteneffizienteste Bildmodell der Nano-Banana-Familie werden, während Gemini Omni Flash Entwickler erstmals direkt mit hochwertiger Videoerzeugung und konversationellem Editing verbindet. Erfahren Sie, wie diese Modelle zusammenspielen und welche Möglichkeiten sie für Kreative und Entwickler eröffnen.
Neue Bild- und Videomodelle für Entwickler
Mit Nano Banana 2 Lite und Gemini Omni Flash stellt Google zwei Werkzeuge vor, die mediengestützte Workflows erheblich beschleunigen. Nano Banana 2 Lite fokussiert auf maximale Geschwindigkeit und geringe Kosten bei der Bildgenerierung. Gemini Omni Flash ergänzt dies durch native Videogenerierung und natürlichsprachliche Bearbeitungsfunktionen.
Beide Modelle sind ab sofort in Google AI Studio, der Gemini API und der Gemini Enterprise Agent Platform verfügbar. Nano Banana 2 Lite erreicht zudem Verbraucherprodukte wie den KI-Modus in der Google-Suche, die Gemini-App und weitere Dienste.
Nano Banana 2 Lite: Maximale Geschwindigkeit, minimale Kosten
Nano Banana 2 Lite wurde für schnelle Ideenfindung und entwicklerfreundliche Hochgeschwindigkeitsprozesse konzipiert. Das Modell liefert Text-zu-Bild-Ergebnisse in nur vier Sekunden und kostet umgerechnet etwa 0,034 US-Dollar pro Bild in 1K-Auflösung.
Trotz des Fokus auf Tempo und Wirtschaftlichkeit bietet das Modell zuverlässige Prompt-Treue, starke Charakterkonsistenz und lesbare Texteinbettungen innerhalb der Bilder. Google empfiehlt das Modell als direkten Ersatz für die erste Nano-Banana-Version.
Die Nano-Banana-Familie im Überblick
Google strukturiert seine Bildmodelle in einer klaren Hierarchie:
- Nano Banana 2 Lite: Optimierter Durchsatz für Echtzeit-Workflows mit extrem geringer Latenz.
- Nano Banana 2: Ausgewogener Allrounder mit hoher Qualität bei vergleichsweise niedriger Latenz.
- Nano Banana Pro: Spezialist für komplexe Profi-Anwendungen mit präziser Steuerung.
- Nano Banana (Legacy): Ältere Version auf Basis von Gemini 2.5 Flash Image.
Zusätzlich zu den Entwicklerplattformen ist Nano Banana 2 Lite auch in Googles Verbrauchersoftware integriert. Dazu zählen unter anderem der KI-Modus in der Suche, die Gemini-App, NotebookLM, Google Fotos, Stitch, Google Flow und Google Ads.
Gemini Omni Flash: Videoproduktion per Konversation
Gemini Omni Flash vereint multimodales Reasoning mit Videogenerierung. Entwickler können Videos aus Text-, Bild- und Video-Eingaben erstellen und diese per natürlicher Sprache iterativ bearbeiten. Der Preis liegt bei 0,10 US-Dollar pro Sekunde generierten Outputs.
Besondere Stärken liegen in der konversationellen Videobearbeitung, der multimodalen Referenzierung über verschiedene Eingabetypen sowie der synchronisierten Einbindung von Text und Grafiken in Bewegungsabläufe.
Aktuelle Einschränkungen
Bei der Nutzung von Omni Flash sollten Entwickler einige Grenzen beachten. Aktuell unterstützt das Modell maximal zehn Sekunden Videolänge. Audioreferenzen und Szenenerweiterungen sind in der API noch nicht enthalten.
Zudem können Videoreferenzen bis zu drei Sekunden Länge zwar hochgeladen, aber noch nicht korrekt verarbeitet werden. Auch die Charakterkonsistenz bei Szenenwechseln oder Kamerafahrten weist derzeit Schwächen auf.
Von der Idee zum Film: Modelle kombiniert nutzen
Der größte Nutzen entsteht durch die Verkettung beider Modelle. Entwickler generieren mit Nano Banana 2 Lite ein Bild und übergeben dieses als Referenz an Gemini Omni Flash, um daraus ein animiertes Video zu erstellen. Über die Interactions API lassen sich bis zu drei aufeinanderfolgende Bearbeitungsschritte mit Session-Kontext abbilden.
Google präsentiert drei Demo-Anwendungen, die diesen Workflow verdeutlichen:
- Anywhere: Ein Selfie oder Foto wird in Sekundenschnelle an ein bekanntes Wahrzeichen transportiert und anschließend animiert.
- Space Lift: Ein Raumfoto wird durch Nano Banana 2 Lite neu visualisiert und anschließend durch Omni Flash als cinematischer Rundgang zum Leben erweckt.
- Omni Product Studio: Statische Produktbilder werden automatisch in dynamische E-Commerce-Videos überführt.
Sicherheit und Transparenz
Beide Modelle setzen auf Googles sicherer Infrastruktur auf und verwenden SynthID-Watermarking. Über die Gemini-App, Gemini in Chrome oder die Google-Suche lässt sich KI-generierter Inhalt verifizieren.
Quelle
Originalmeldung und weitere Details finden Sie im DeepMind Blog.