LONDON (IT BOLTWISE) – Google rollt Gemini 3.5 Transcribe als neues Transkriptions-Feature innerhalb der Gemini Audio-Familie aus. Die KI soll dabei Fachjargon automatisch erkennen und Transkripte in über 85 Sprachen sowie mit mehrsprachigen Datenflüssen verbessern. Nutzer können zudem per Stimme natürlich editieren, während Füllwörter wie „um“ und „uh“ herausgefiltert werden. Für Entwickler steht das Modell in einer öffentlichen Vorschau über die Gemini API zur Verfügung.

Mit Gemini 3.5 Transcribe erweitert Google sein Gemini-Audio-Portfolio um eine Transkriptionskomponente, die auf zwei Punkte gleichzeitig zielt: bessere Worterkennung über viele Sprachen hinweg und ein „natürlicheres“ Editing direkt im Textfluss. Während frühere Ansätze in der Praxis oft an zwei Grenzen stoßen – erstens an der korrekten Wiedergabe von Spezialbegriffen, zweitens an der Frage, ob Füllwörter wie „um“ oder „uh“ im Ergebnis verbleiben – nimmt die neue Version genau diese Schwachstellen in den Fokus. Google nennt „wortbezogene Fehlerquoten“ als Vergleichsgröße und positioniert das Modell als deutliche Weiterentwicklung gegenüber dem vorherigen Transkriptionsmodell namens Chirp 3.
Technisch beschreibt Google die Logik nicht im Detail, aber die Funktionalität lässt sich als Kombination aus Erkennungs- und Formatierungsphase verstehen: Das System soll beim Zuhören automatisch Fachjargon identifizieren, mehr als 85 Sprachen abdecken und Transkripte anschließend so ausgeben, dass sie nicht nur korrekt, sondern auch „lesbar“ sind. Besonders praxisnah wirkt der Ansatz, dass Nutzer die Transkription nicht erst mühsam manuell korrigieren müssen. Stattdessen können sie laut Google den Text „natürlich“ per Stimme editieren, während das Modell zugleich automatische Formatierungen vornimmt und Füllwörter entfernt. Das reduziert typische Bearbeitungsschleifen, in denen Menschen sonst erst Rohtranskripte durchsuchen und anschließend einzelne Textabschnitte nachträglich bereinigen.
Für professionelle Use Cases spielt zudem die Frage eine Rolle, wie gut ein Modell mit firmenspezifischen Begriffen und Schreibweisen umgehen kann. Gemini 3.5 Transcribe unterstützt hier ein benutzerdefiniertes Vokabular: Nutzer geben dem Modell also eigene Begriffe und Schreibvarianten vor, damit die KI die Transkription entsprechend anpasst und spezialisierte Jargons nicht später erneut „umformuliert“ oder korrigiert, obwohl die Schreibweise eigentlich bewusst so gewählt wurde. Damit adressiert Google nicht nur die Erkennungsqualität, sondern auch die Benutzerkontrolle über den Output. In Organisationen, die intern feste Terminologien verwenden – etwa in Produktdokumentationen, Rechts- oder Technikbereichen – kann ein solcher Mechanismus helfen, dass die KI-Ergebnisse schneller in Dokumente überführt werden können.
Auch die Struktur der Ausgabe soll stärker zu konkreten Arbeitsabläufen passen. Google nennt Wort-für-Wort-Timestamps sowie eine Sprecherzuordnung für bis zu drei Personen in vorab aufgezeichneten Audiodateien. Diese Kombination ist besonders relevant, sobald Transkriptionen nicht nur als „Notizersatz“ dienen, sondern als Grundlage für Protokolle, Schulungsmaterial oder nachgelagerte Analyseprozesse. Timestamps erleichtern das Auffinden von Passagen und Sprecherlabels machen es leichter, Gesprächsbeiträge thematisch zuzuordnen. Damit nähert sich das Feature dem an, was viele Teams aus professionellen Diktier- und Medien-Workflows kennen, nur eben eingebettet in die Gemini-Umgebung.
Zur Verfügbarkeit nennt Google eine gestaffelte Auslieferung: Gemini 3.5 Transcribe startet „heute“ in Englisch für alle macOS-Nutzer der Gemini-App. Auf Android soll die Funktion über das Rambler-Diktierfeature in ausgewählten Ländern und Sprachen nutzbar sein. Parallel dazu bietet Google Entwicklern eine öffentliche Vorschau über die Gemini API, erreichbar über AI Studio und Antigravity. Zusätzlich kündigt Google an, dass eine Unterstützung im Chrome-Umfeld „bald“ kommen soll. Diese Reihenfolge ist ein Hinweis darauf, wie Google neue KI-Funktionen typischerweise ausrollt: zuerst in klar begrenzten Umgebungen, dann über Browser- und API-Zugänge in breitere Produkt- und Entwicklerpfade.
Wichtig ist dabei auch der Timing-Kontext: In der Quelle wird betont, dass der Rollout von Gemini 3.5 Transcribe erfolgt, während die Freigabe von Gemini 3.5 Pro, die im Juni angekündigt worden sei, noch aussteht. Für Anwender heißt das vor allem: Wer auf neue Gemini-Audio-Fähigkeiten wartet, bekommt zunächst eine Transkriptionsfunktion, die den Alltag bei Meetings, Interviews oder Content-Workflows direkt beeinflusst. Für Unternehmen und KI-Teams bietet sich an, die öffentliche API-Vorschau frühzeitig zu testen – etwa um zu prüfen, wie das benutzerdefinierte Vokabular in eigenen Daten wirkt, wie stabil die Sprecherzuordnung im jeweiligen Audio-Setup ist und ob die automatische Entfernung von Füllwörtern zu den gewünschten Standards für interne Dokumente passt. Gerade im Zusammenspiel mit bestehenden Diktier- und Knowledge-Management-Prozessen kann das den Aufwand senken, bevor später möglicherweise größere Modell-Updates nachziehen.
Da Google außerdem explizit „Chirp 3“ als Referenz nennt, liegt der Vergleich nahe, dass es nicht nur um neue Sprachabdeckung geht, sondern um messbare Qualitätsverbesserungen. In der Praxis entscheidet aber oft die Kombination aus Erkennung, Editierbarkeit und Formatierung darüber, ob Transkription „out of the box“ funktioniert. Gemini 3.5 Transcribe versucht genau diese Lücke zu schließen, indem es sowohl die Textqualität (weniger wording errors) als auch die Bearbeitung (Editieren per Stimme, Entfernen von Füllwörtern) in den Mittelpunkt stellt. Für Teams, die heute noch zwischen mehreren Tools wechseln müssen, könnte das ein Schritt in Richtung weniger Pipeline-Aufwand sein – allerdings wird sich zeigen, wie gut die Funktionen in realen, teils verrauschten Audioquellen und in echten Fachdomänen harmonieren.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Gemini Audio: Transkription mit KI erkennt Fachjargon und entfernt Füllwörter" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Gemini Audio: Transkription mit KI erkennt Fachjargon und entfernt Füllwörter" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Gemini Audio: Transkription mit KI erkennt Fachjargon und entfernt Füllwörter« bei Google Deutschland suchen, bei Bing oder Google News!