BERLIN / LONDON (IT BOLTWISE) – Das Berliner Startup Deepslate hat laut den Angaben zur Seed-Runde rund 7,7 Millionen Euro eingesammelt. Im Mittelpunkt stehen eigene Speech-to-Speech-Modelle, die gesprochene Sprache direkt verarbeiten und wieder als Sprache ausgeben. Damit entfällt die klassische Kette aus Spracherkennung, Sprachmodell und Text-to-Speech. Geplant ist eine in Deutschland gehostete Alternative für europäische Unternehmen, die auf schnelle und natürlichere Gespräche zielen.

Deepslate bringt die Sprach-KI-Entwicklung in einen Bereich, der für viele Unternehmen bislang vor allem „Integrationsarbeit“ bedeutete: die Verbindung mehrerer Komponenten zu einer durchgängigen Voice-Pipeline. Das Berliner Startup setzt dafür auf eigene Speech-to-Speech-Modelle, bei denen die Eingabe als Sprache verarbeitet und als Sprache wieder ausgegeben wird. Damit verschwinden die üblichen Zwischenschritte, bei denen Spracherkennung (ASR), ein Sprachmodell (LLM) und Text-to-Speech (TTS) oft entkoppelt voneinander optimiert werden. Gerade in Gesprächen mit wechselnder Betonung, Tonfall und dialektnahen Formulierungen kann diese Entkopplung spürbar werden – nicht nur in der Qualität, sondern auch in der Latenz und damit im Gesprächsfluss.
Technisch bedeutet Speech-to-Speech vor allem: Das System arbeitet nicht zwangsläufig in „Text-Runden“, sondern kann Sprachmuster direkt modellieren. In der Praxis ist das relevant für Anwendungsfälle, in denen Nutzer nicht in Sätzen „hinschreiben“, sondern natürlich sprechen – mit Unterbrechungen, Rückfragen, Nachschieben von Details oder Sprechpausen. Die von Deepslate adressierte Idee ist dabei, dass ein durchgehendes Modell schneller reagieren kann, weil weniger Übersetzungs- und Formatwechsel zwischen Modulen nötig sind. Gleichzeitig verspricht das Konzept, dass Informationen wie Prosodie oder sprachliche Eigenheiten weniger „verloren“ gehen, als wenn ein Modell erst in Text übersetzt und danach wieder synthetisiert. Entscheidend für den Betrieb ist zudem, wie gut sich so ein Modell auf reale Geräuschsituationen und akustische Varianz anpassen lässt – und wie robust es im laufenden Betrieb mit unterschiedlichen Mikrofonen und Sprecherprofilen bleibt.
Die Finanzierungsseite untermauert den Anspruch, ein eigenes Produkt statt nur eine API-Schicht zu bauen. Laut den im Text genannten Angaben hat Deepslate eine Seed-Runde über 7,7 Millionen Euro abgeschlossen. Angeführt wird die Runde vom Münchener Technologie-Investor 42CAP. Zu den weiteren Beteiligten zählen Alstin Capital von Carsten Maschmeyer, Bestandsinvestor SIVentures sowie mehrere Business Angels. Für das Startup ist das mehr als frisches Kapital: Seed-Mittel werden typischerweise genutzt, um Trainingskapazitäten, Datenbeschaffung, Evaluations-Workflows und die frühe Produktisierung zu finanzieren. Gerade bei Speech-to-Speech hängt die Entwicklungsqualität stark an der Qualität und Abdeckung der Daten, weil kleine Verzerrungen in der Lautlichkeit oder in der Prosodie später direkt in der synthetisierten Ausgabe sichtbar werden.
Marktseitig adressiert Deepslate einen Bereich, in dem große Anbieter bislang über API-Ketten dominierten: Sprach-Modelle, die Text-Workflows anstoßen, und nachgelagerte Sprachsynthese. Der Text stellt zudem einen Vergleich zur Leistungsfähigkeit: Deepslate entwickelt laut „Artificial Analysis“ das weltweit schnellste KI-Sprachmodell seiner Art. Solche Aussagen sind in der Marktkommunikation zwar stets kontextabhängig (Benchmark-Setup, Modellgröße, gewünschte Metriken), für Entscheider sind sie aber vor allem als Signal wichtig, dass Performance nicht als Nebenziel behandelt wird. Wenn europäische Unternehmen nach Lösungen suchen, die sich mit geringerer Latenz in bestehende Prozesse integrieren lassen, wird Geschwindigkeit zu einem kaufentscheidenden Parameter – nicht nur die reine Sprachqualität. Interessant ist außerdem die Positionierung als in Deutschland gehostete Alternative, weil sie Unternehmen die Option geben kann, die technische Verarbeitung stärker innerhalb eigener Compliance- und Betriebsrahmen zu verorten.
Historisch betrachtet war die Voice-Entwicklung lange in klar getrennte Phasen aufgeteilt: erst Erkennung, dann Sprachverarbeitung, dann Ausgabe. Das reduziert Komplexität, führt aber auch zu Fehlerfortpflanzung: Ein missverstandenes Fragment in der Spracherkennung kann das nachgelagerte Sprachmodell in eine falsche Richtung schicken, und die TTS-Ausgabe kann prosodische Details nicht mehr zuverlässig „zurückholen“. Speech-to-Speech ist deshalb weniger ein „Neues Feature“ als ein Strukturwechsel: Es verlagert die Optimierung stärker in Richtung End-to-End-Verhalten. In der Praxis wird das jedoch nur dann zur Stärke, wenn das Modell im Alltag zuverlässig kalibriert ist, etwa bei unterschiedlichen Sprechgeschwindigkeiten oder bei dynamischen Dialogen mit Kurskorrekturen. Genau dort entscheidet sich, ob ein System im Demo-Video überzeugt oder in produktiven Calls stabil bleibt.
Für die Umsetzung in Unternehmen ist schließlich entscheidend, wie Deepslate das Modell in einen realen Betrieb übersetzt. Die technische Idee allein ersetzt kein Produkt: Es braucht definierte Schnittstellen, Monitoring für Antwortzeiten und Qualitätsmetriken sowie ein Vorgehen für kontinuierliches Verbessern. Wenn das Modell schneller und natürlicher reagieren soll, müssen auch Lastspitzen, gleichzeitige Sessions und mögliche Drift-Effekte adressiert werden. Gleichzeitig entsteht durch eine in Deutschland gehostete Lösung ein strategischer Vorteil für Teams, die nicht nur das Modell, sondern auch den Betrieb steuern möchten. Unterm Strich zeigt die Seed-Runde: In der Sprach-KI verschiebt sich der Wettbewerb zunehmend von reinen API-Workflows hin zu end-to-end-fähigen Systemen, bei denen Latenz, Prosodie und Robustheit im Gespräch als Gesamtleistung bewertet werden.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Deepslate sammelt 7,7 Millionen Euro für Sprach-KI „Speech-to-Speech“ aus Berlin" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Deepslate sammelt 7,7 Millionen Euro für Sprach-KI „Speech-to-Speech“ aus Berlin" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Deepslate sammelt 7,7 Millionen Euro für Sprach-KI „Speech-to-Speech“ aus Berlin« bei Google Deutschland suchen, bei Bing oder Google News!