Agentic Video Understanding für Gemini: Bis zu 88 % weniger Token bei Videoanalysen

AI generated

Google DeepMind hat eine neue agentische Funktion für die Videoverarbeitung in Gemini vorgestellt. Mit Agentic Video Understanding sollen Entwickler Videoanalysen deutlich effizienter durchführen können. Das Besondere: Das Modell entscheidet dynamisch, welche Videosegmente relevant sind, und reduziert dabei den Token-Verbrauch um bis zu 88 Prozent.

Was bedeutet Agentic Video Understanding?

Agentic Video Understanding ist ein neues Feature für die Modelle Gemini 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite. Es ermöglicht den KI-Modellen, Videos nicht mehr ausschließlich mit einer festen Bildrate zu verarbeiten, sondern gezielt nach relevanten Momenten zu suchen. Dadurch verbessert sich die Genauigkeit der Analyse bei gleichzeitig deutlich geringerem Ressourcenverbrauch.

Bisherige Verfahren arbeiteten mit einer statischen Verarbeitung, meist bei einem Bild pro Sekunde. Diese Methode erfasst vor allem bei langen Videos oft nicht alle kritischen Details oder verursacht hohe Kosten. Die agentische Herangehensweise ändert dies grundlegend.

Dynamische Analyse statt statischer Verarbeitung

Statt das gesamte Video in einem festen Takt zu durchlaufen, übernimmt Gemini nun eine aktive Rolle. Das Modul entscheidet selbst, welche Segmente es sich ansehen möchte, in welcher Geschwindigkeit und über welche Modalität. Dabei greift es auf visuelle Frames, Audio oder Transkripte zurück.

Entwickler können diese Funktion bereits über die Gemini API in Google AI Studio oder der Gemini Enterprise Agent Platform nutzen. Die Aktivierung erfolgt über den Parameter processing: „agentic“. Das Unternehmen betont, dass keine zusätzlichen Feature-Gebühren anfallen.

Bemerkenswerte Effizienzgewinne

Die Benchmark-Ergebnisse sind beeindruckend. Laut Google DeepMind sinken die Kosten für Videoanalysen um bis zu 66 Prozent, während der Token-Verbrauch sogar um bis zu 88 Prozent reduziert wird. Gleichzeitig steigt die Genauigkeit um bis zu sieben Prozent. Besonders bei langformatigen Inhalten wie 90-minütigen Vorlesungen oder mehrstündigen Aufzeichnungen zeigt sich der Vorteil.

Gemini 3.7 Flash bietet hier das beste Verhältnis aus Qualität und Kosteneffizienz. Das Modell liegt damit an der Grenze des optimalen Zusammenspiels von Präzision und Preis, der sogenannten Pareto-Front.

Anwendungsbereiche im Überblick

Die neue Technologie eröffnet Entwicklern vielfältige Möglichkeiten bei der Verarbeitung anspruchsvoller Videoinhalte. Zu den wichtigsten Einsatzgebieten zählen:

  • Sub-second moment retrieval: Das Auffinden sekundenbruchteiler Statusänderungen oder exakter Schnittpunkte, die bei herkömmlicher Verarbeitung leicht übersehen werden.
  • Nadel-im-Heuhaufen-Suche: Komplexe Anfragen über mehrstündige Videos hinweg, ohne Millionen von Tokens zu verbrauchen.
  • Anomalieerkennung: Gezielte Überprüfung interessanter Zeitfenster mit höherer Bildrate zur Inspektion schneller Bewegungen.
  • Präzises Zählen: Verlässliches Erfassen wiederholter Bewegungen oder einzelner Objekte über die Zeit.

Integration in Google-Produkte

Neben der API-Nutzung für Entwickler plant Google, die Technologie auch in Verbraucherprodukte zu integrieren. In Kürze soll Agentic Video Understanding in der Gemini App für alle Nutzer verfügbar sein. Auch die YouTube-Funktion Ask YouTube wird in den kommenden Monaten davon profitieren und qualitativ hochwertigere, visuell abgestützte Antworten liefern.

Fazit

Mit Agentic Video Understanding stellt Google DeepMind einen bedeutsamen Fortschritt in der KI-gestützten Videoanalyse vor. Die Kombination aus drastisch reduzierten Kosten, geringerem Token-Verbrauch und verbesserter Genauigkeit macht das Feature für Entwickler besonders attraktiv. Wer die neuen Möglichkeiten testen möchte, kann dies direkt in Google AI Studio tun.

Quelle: Google DeepMind Blog

Dieser Inhalt wurde mithilfe künstlicher Intelligenz erstellt.
Becker Julian