Google integriert Computer Use nativ in Gemini 3.5 Flash

Google erweitert seine KI-Plattform Gemini um eine leistungsstarke Neuerung: Die sogenannte Computer-Use-Funktion ist ab sofort nativ in Gemini 3.5 Flash integriert. Entwickler können damit Agenten erstellen, die visuell wahrnehmen, komplexe Zusammenhänge verstehen und eigenständig Aktionen in Browsern sowie auf Desktop- und Mobilgeräten ausführen. Diese Weiterentwicklung verspricht deutlich verbesserte Performance für anspruchsvolle Automatisierungsaufgaben im Enterprise-Bereich.

Native Integration statt eigenständigem Modell

Bisher war Computer Use lediglich als separates Modell verfügbar. Mit dem Update fließt die Fähigkeit direkt in Gemini 3.5 Flash ein. Das Modell beherrscht bereits Function Calling sowie die Nutzung eingebauter Tools wie die Google-Suche und Maps. Durch die native Einbindung von Computer Use lassen sich nun zuverlässig eigene Agenten entwickeln, die langfristige Aufgaben in verschiedenen Umgebungen übernehmen können.

Enterprise-Automatisierung und Softwaretests

Die Integration richtet sich besonders an Unternehmen und Entwickler, die komplexe Workflows automatisieren möchten. Zu den Kernanwendungen gehören kontinuierliche Softwaretests und die Automatisierung von Wissensarbeiten über verschiedene professionelle Anwendungen hinweg. Über die Gemini API und die Gemini Enterprise Agent Platform lässt sich die Technologie direkt in bestehende Infrastrukturen einbinden.

Sicherheitsvorkehrungen für den Produktiveinsatz

Gezieltes Training und Schutzmechanismen

Um Risiken wie Prompt Injection in Live-Umgebungen zu minimieren, setzt Google auf gezieltes adversariales Training. Zusätzlich stehen zwei optionale Sicherheitsvorkehrungen zur Verfügung:

  • Die explizite Bestätigung durch den Nutzer für sensible oder irreversible Aktionen.
  • Der automatische Stopp von Aufgaben, wenn eine indirekte Prompt Injection erkannt wird.

Defense-in-Depth für maximale Kontrolle

Google empfiehlt Entwicklern, diese Sicherheitsfunktionen mit weiteren Maßnahmen zu kombinieren. Dazu gehören sichere Sandboxing, menschliche Überprüfung im Loop sowie strikte Zugriffskontrollen. Detaillierte Hinweise zu den Sicherheitsmaßnahmen finden sich in der offiziellen Best-Practices-Dokumentation.

So können Entwickler sofort loslegen

Die neuen Möglichkeiten stehen bereits zur Verfügung. Interessierte können die Funktionen in einer Demo-Umgebung von Browserbase ausprobieren. Für den direkten Einstieg in die Entwicklung liefern Google eine Referenzimplementierung sowie umfassende Dokumentationen über die Gemini API und die Gemini Enterprise Agent Platform.

Quelle: https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash/

Becker Julian