LONDON / LONDON (IT BOLTWISE) – Google rollt Gemini 3.5 Flash als UI-steuernde KI aus, die ab sofort Bildschirme analysiert und mehrschrittige Aufgaben eigenständig ausführt. Damit kann die KI Desktop-Anwendungen, mobile Apps und Browser bedienen – vom modernen Web bis zu Legacy-Programmen. Branchenbenchmarking zeigt mit 78,4% eine starke Performance nahe an OpenAI, während DeepMind vor „Agentenfallen“ im offenen Netz warnt. Gleichzeitig setzt Google auf Nutzerfreigaben, Sandboxing und Aufsichtskonzepte, um die neue Autonomie abzusichern.

Google bringt Gemini 3.5 Flash in eine neue Rolle: Die Künstliche Intelligenz soll nicht nur Inhalte verstehen oder Text generieren, sondern künftig auch Bildschirminhalte auswerten und darauf basierend Programme steuern. Seit dem 24. Juni 2026 rollt das Unternehmen die Funktion schrittweise aus; im Kern sitzt eine UI-„Steuer“-Schicht zwischen Modell und Nutzeroberfläche. Praktisch heißt das, dass die KI Desktop-Anwendungen, mobile Apps und Browser bedienen kann, indem sie Interaktionen plant, ausführt und dabei mehrstufige Abläufe bis zum Abschluss durchzieht. Für Unternehmen verschiebt sich damit die Frage von „Chatten wir richtig?“ zu „Wer kontrolliert den Ausführungsfluss?“
Technisch ordnet sich das in den Trend ein, Künstliche Intelligenz stärker in die digitale Arbeitsumgebung einzubetten. Anstatt nur Prompts zu beantworten, greift das Modell auf UI-Signale zurück: Es erkennt Zustände auf dem Bildschirm, interpretiert, welche Aktionen als Nächstes sinnvoll sind, und führt diese über die sichtbare Oberfläche aus. Der Anbieter nennt dabei sowohl moderne Webanwendungen als auch ältere Legacy-Programme als Ziel, was auf eine robuste Generalisierung hindeutet – dort, wo klassische Automationsskripte häufig an DOM-Strukturen oder festen Layoutannahmen scheitern. Vergleichbar mit „Computer-Use“-Ansätzen anderer Anbieter geht es um die Kopplung von Wahrnehmung (UI) und Handlung (Interaktion).
Die Leistungsdaten sollen genau diese Kopplung quantifizieren. Google bezieht sich auf den OSWorld-Verified UI Control Benchmark, einen Test für Benutzeroberflächensteuerung, und erreicht 78,4 Prozent. Im Vergleich liegt GPT-5.5 von OpenAI mit 78,7 Prozent nur knapp vorne – ein Unterschied, der in der Praxis je nach Anwendungsfall weniger relevant sein kann als die Frage, wie stabil die KI bei Fehlpfaden bleibt. Für Entwickler ist entscheidend, dass Gemini 3.5 Flash über die Gemini-API und die Enterprise Agent Platform verfügbar sein soll. Damit sinkt die Hürde für Pilotprojekte, aber auch die Verantwortung steigt, weil mehr Autonomie in produktive Workflows gelangt und nicht nur in „Proof-of-Concept“-Umgebungen.
Der Preispunkt ist dabei eher moderat gesetzt: Google nennt 1,50 Euro pro Million Input-Tokens, also ein leichter Anstieg gegenüber den zuvor genannten 1,25 Euro. Gleichzeitig bleibt der Kontextumfang von einer Million Tokens erhalten, was insbesondere bei mehrschrittigen Automatisierungen relevant ist: Je länger der Verlauf, desto eher müssen Modelle Entscheidungen an späteren Stellen auf Basis früherer UI-Schritte treffen, statt nur auf dem aktuellen Bildschirm zu basieren. Im Vergleich zu einzelnen Konkurrenzangeboten wird die Kostenkurve laut Vorlage als günstiger eingeordnet. Unternehmen profitieren davon vor allem dann, wenn sich teure „Autonomie-Zyklen“ sauber messen und begrenzen lassen, etwa über Abbruchkriterien und rollenbasierte Berechtigungen.
Mit der Fähigkeit, selbstständig zu handeln, steigt allerdings das Risiko, dass sich Systeme in ungewollte Richtungen bewegen. DeepMind-Senior-Scientist Nenad Tomašev warnt vor sogenannten „Agentenfallen“ im offenen Web: speziell präparierte Umgebungen, die KI-Agenten ausnutzen sollen. Berichten zufolge dokumentierte ein Forscher aus Kalifornien bereits einen finanziellen Verlust, nachdem eine KI auf eine solche Falle hereingefallen war. Das ist aus Security-Sicht ein typischer Wechsel von der klassischen Prompt-Injection hin zu „Action“-Risiken: Nicht nur Informationen werden manipuliert, sondern Handlungen werden in den falschen Ablauf gedrückt. Für IT- und Security-Teams wird dadurch die Sicherheitsarchitektur zur zentralen Produktanforderung.
Google adressiert das mit einem siebenstufigen Sicherheitskonzept, das mehrere Schutzebenen kombiniert. Dazu zählt „menschliche Kontrolle“, insbesondere bei sensiblen oder irreversiblen Aktionen, bei denen eine Nutzerbestätigung Pflicht sein soll. Ergänzend setzt der Anbieter auf technische Absicherung wie Sandboxing, Eingabereinigung und einen automatischen Aufgabenabbruch bei erkannten Angriffsmustern. Darüber hinaus wird administrative Aufsicht über Erlaubnis- und Sperrlisten sowie Überwachungstools zur Verhaltenskontrolle genannt. Diese Kombination erinnert an Best Practices aus Identity- und Endpoint-Security: Autonomie wird nicht komplett „weggenommen“, sondern auf definierte Grenzen reduziert. Das ist zugleich eine pragmatische Antwort auf die reale Compliance-Praxis in Unternehmen.
Auch regulatorisch wird das Thema durch die EU AI Act Bewegung schneller konkret. Mit dem AI Act existieren bereits klare Vorgaben für den Einsatz risikobehafteter KI-Systeme in Unternehmen, und die Erwartungshaltung Richtung dokumentierbare Risikoklassen wächst. Für die Praxis heißt das: UI-automatisierte Agenten werden nicht nur als „Convenience-Feature“ betrachtet, sondern als Teil eines Systems, das überwacht, protokolliert und im Zweifelsfall angehalten werden muss. Ein kostenloser Umsetzungsleitfaden wird in der Vorlage erwähnt, doch die eigentliche Relevanz liegt in der strukturierten Bewertung: Wo trifft der Agent Entscheidungen, welche Daten fließen, und wie wird sichergestellt, dass keine verbotenen Aktionen stattfinden? Genau hier wird technische Kontrolle zur juristischen Notwendigkeit.
Parallel zur UI-Autonomie liefert Google zusätzliche Hooks in bestehende Plattformen. Seit dem 26. Juni ergänzt „Select From Screen“ den Chrome-Browser: Nutzer können Bereiche einer Webseite markieren und direkt an Gemini senden, vorausgesetzt ist ein angemeldetes Google-Konto. Das wirkt wie ein UX-Brückentool, das die Eingabequalität verbessert und die häufige Lücke zwischen „UI sehen“ und „UI beschreiben“ schließt. In Workspace erweitert Google zudem Google Vids um eine persönliche Avatar-Funktion, bei der Nutzer ein digitales Abbild aus Gesicht und Stimme erstellen; Aufnahmen sollen im Konto gespeichert und nach drei Jahren Inaktivität gelöscht werden, wobei die Verfügbarkeit regional eingeschränkt ist. Solche Funktionen erhöhen den Unternehmensnutzen, stellen aber ebenfalls Datenschutzfragen in den Vordergrund.
Am Markt kommt hinzu, dass Google die Verfügbarkeit über Ende Juni hinaus fest in Richtung Enterprise verankert, unter anderem für Großbritannien über die Enterprise Agent Platform. Als Referenz nennt die Vorlage die Partnerschaft mit HSBC: Die Bank setzt die KI in der Vermögensverwaltung in über 200 Anwendungsfällen ein und erwartet Einsparungen von mehr als 90 Millionen Euro. Solche Zahlen sind für CFOs ein starker Treiber, aber sie erhöhen den Erwartungsdruck an Governance, weil Agenten nicht nur Texte liefern, sondern echte Arbeitsschritte anstoßen. Wettbewerber wie OpenAI und auch Anthropic bleiben dabei die Referenzpunkte: Schon die letzte Juni-Woche wird als Phase turbulenter Talentbewegungen beschrieben, bei der laut Vorlage mehrere Spitzenforscher zu Anthropic wechselten. In Summe zeigt das: Die KI-Autonomie entwickelt sich nicht isoliert, sondern im direkten Wettbewerb um stabile, sichere Agentensysteme.
Der Ausblick ist damit weniger „Welche Funktion kommt als Nächstes?“ und mehr „Welche Betriebsmuster setzen sich durch?“. Für Entwickler bedeutet Gemini 3.5 Flash vor allem eine neue Architekturklasse: Agenten, die auf UI-Ebene arbeiten, brauchen Instrumentierung (Tracing), Kontrollmechanismen (Policy/ACL), sowie Sicherheitsanalysen gegen Action-Risiken. Für Unternehmen wird entscheidend sein, Pilotbereiche zu wählen, in denen Rückabwicklung möglich ist und Nutzerfreigaben automatisierbar bleiben. Gleichzeitig deutet das Benchmark-Niveau nahe am Wettbewerb darauf hin, dass sich die Leistungssprünge künftig eher über Zuverlässigkeit, Sicherheitsgrenzen und Integrationsfähigkeit unterscheiden werden als über reine Modellwerte. Mit Blick auf die nächsten Monate ist zu erwarten, dass sich UI-Agenten stärker in Plattformen wie Browser und Produktivitätssuiten verankern und damit noch breiter in den Unternehmensalltag vordringen – vermutlich mit noch strengeren Regeln für Datennutzung, Logging und Freigabeprozesse.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Gemini 3.5 Flash steuert Screens: Autonomie im UI wird mit 78,4% messbar" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Gemini 3.5 Flash steuert Screens: Autonomie im UI wird mit 78,4% messbar" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Gemini 3.5 Flash steuert Screens: Autonomie im UI wird mit 78,4% messbar« bei Google Deutschland suchen, bei Bing oder Google News!