SAN FRANCISCO / LONDON (IT BOLTWISE) – Der Audio-Startup Sonilo hat 11 Millionen US-Dollar eingesammelt, um sein multimodales Sound-World-Model zu skalieren. Die Technologie koppelt Video-Verständnis mit Audio-Generierung, sodass Musik und Soundeffekte zu Timing, Emotion und Bewegung auf dem Bildschirm passen. Neben der Creator-Variante arbeitet Sonilo an einem Lizenzgeschäft und an Tools, die Entwicklern und Produktionsstudios den Einsatz erleichtern. Zum Launch der Consumer-App peilt das Unternehmen das vierte Quartal an.

Sonilo bringt ein multimodales Audio‑Modell für Video: 11 Mio. US-$ in Serie A
Sonilo bringt ein multimodales Audio‑Modell für Video: 11 Mio. US-$ in Serie A (Foto: IT BOLTWISE)
🧠 KI & Robotik auf Google News abonnieren

Sonilo will die Lücke schließen, die beim heutigen KI-Video-Workflow häufig bleibt: Während viele Systeme bereits visuelle Szenen erzeugen oder bearbeiten, entsteht der Ton oft nachgelagert und manuell. Genau dort setzt das Startup aus San Francisco an. Mit der neuen Finanzierungsrunde in Höhe von 11 Millionen US-Dollar will Sonilo Rechenleistung einkaufen und seine Modelle so weiterentwickeln, dass aus Videoclips schneller eine passgenaue Mischung aus Musik und Soundeffekten wird. Die angestrebte Richtung ist dabei klar: KI-gestützte Vertonung nicht als generische Wiedergabe, sondern als zielgerichtete Audio-Erzeugung, die sich an dem orientiert, was im Bild tatsächlich passiert.

Technisch beschreibt Sonilo seine Kernkomponente als „Sound World Model“, ein multimodales System, das Video-Comprehension mit Audio-Generation und Timing zusammenführt. Im Unterschied zu Ansätzen, die Musik oder Effekte als voneinander getrennte Bausteine behandeln, soll Sonilo den Ablauf einer Szene inhaltlich erfassen: Bewegung im Bild, emotionale Verschiebungen und das Timing werden aus dem Material abgeleitet, und daraus entsteht eine Audioausgabe, die zur jeweiligen Bildsequenz gehört. Praktisch bedeutet das, dass Nutzer einen Clip hochladen, eine Textbeschreibung eingeben oder beides kombinieren können, um ein synchronisiertes Soundtrack-Ergebnis zu erhalten – mit dem Ziel, Audio direkt für die kommerzielle Nutzung einzusetzen.

Die Produktidee richtet sich damit nicht nur an einzelne Kreative, sondern auch an Teams, die in kurzen Formaten produzieren. Sonilo nennt als Zielgruppen Creator im Bereich Short-Form-Video und kurze Dramas, Entwicklerplattformen, die KI-Video-Tools zu Workflows zusammensetzen, sowie Enterprise-Produktionsgruppen. Zusätzlich bietet das Unternehmen AI-Dubbing mit Lip-Sync an. Für Short-Drama-Studios und Content-Teams wird das besonders dann relevant, wenn Lokalisierung in andere Sprachen stattfindet: Statt im Postprozess jede Szene manuell nachzuarbeiten, soll die Vertonung stärker am visuellen Eindruck ausgerichtet werden. Erste Distributionserweiterungen kommen dabei über frühe Partner, die als Aggregatoren bzw. in bestehenden Creator-Ökosystemen aktiv sind.

Dass Sonilo dabei früh auf ein Lizenzmodell setzt, ist aus Marktsicht ein entscheidender Baustein. Denn generative Audio-Technik trifft unmittelbar auf Rechtefragen: Wer darf welche Trainingsdaten nutzen, und wie werden Urheber und Rechteinhaber vergütet? Sonilo nennt hier einen frühen Lizenzpartner und stellt in Aussicht, dass die Modelle aus lizenziertem Material lernen. Laut Darstellung sollen dabei Lizenzgebühren sowie eine Beteiligung am Umsatz an Künstler und Rechteinhaber fließen. Parallel arbeitet das Unternehmen laut eigenen Angaben an Publishing- und Master-Recording-Vereinbarungen mit großen Rechteorganisationen; zeitlich peilt Sonilo die Schließung innerhalb weniger Wochen an. Für Unternehmen, die KI-gestützte Medienproduktion planen, wirkt diese Kombination aus Modell-Engineering und Rechtemodell wie der Versuch, Skalierung ohne späteren „Compliance-Schock“ zu ermöglichen.

Auch der personelle Hintergrund passt zur Technologieausrichtung: Sonilo wird von Mitgründern getragen, die zuvor in KI- und Musikbereichen eines großen Kurzvideo-Ökosystems gearbeitet haben. Der CEO Shawn Song leitete dort multimodale KI-Technologiearbeit und bringt zudem eine Ausbildung an der Carnegie Mellon University mit; sein CTO Alex Yin hat einen doktoralen Hintergrund in computerbasierter Musik. Für das Startup ist das insofern mehr als „Herkunft aus bekannten Teams“: Multimodale Systeme brauchen Erfahrung in Datenpipelines, Modelltraining und in der Feingranularität, die für Audio-Synchronität nötig ist. Ebenso wichtig ist die Rolle von Personen, die die Verbindung zwischen Produkt und Rechtemanagement aufbauen können – insbesondere, wenn Lizenzierung nicht als nachgelagerte Aufgabe, sondern als integraler Bestandteil der Plattform gedacht ist.

Mit dem Einsatz von Text- und Video-Eingaben versucht Sonilo, zwei Bedienformen zusammenzubringen, die im Kreativbereich unterschiedlich stark nachgefragt werden. Textbasierte Steuerung ist schnell und niedrigschwellig: Wer eine Stimmung oder einen gewünschten Effekt beschreibt, bekommt Audio ohne den Aufwand, zeitkritische Parameter selbst zu bestimmen. Video-gestützte Eingabe reduziert dagegen Interpretationsspielraum, weil das Modell stärker am tatsächlichen Geschehen auf dem Screen arbeitet. In Summe zielt das auf eine Nutzererfahrung, bei der Generierung und Timing nicht als separate Schritte wirken, sondern als ein zusammenhängender „Video-to-Audio“-Prozess. Die Consumer-App soll Sonilo zufolge im vierten Quartal erscheinen, wodurch die Technologie vom Prototyp- und Entwicklerumfeld stärker in die Hände einzelner Creator wandert.

Für den Markt ist die Finanzierungsrunde vor allem ein Signal dafür, dass „KI-native Video-Stacks“ zunehmend als End-to-End-Thema verstanden werden: Nicht nur Bildsynthese und Editing, sondern auch die Tonspur rückt näher an Echtzeit-Workflows. Wettbewerber entlang der Toolchain existieren zwar in verschiedenen Formen – von generativen Audio-Generatoren bis zu Video-Editing-Suites mit KI-Assistenten –, doch Sonilos Ansatz setzt explizit bei der multimodalen Kopplung an. Wenn das Unternehmen die Lizenzvereinbarungen wie geplant abschließen kann und die Modellqualität in produktiven Workflows stabil bleibt, entsteht ein Wettbewerbsvorteil, der weniger auf Magie im Prompting basiert, sondern auf reproduzierbarer Passgenauigkeit in der Szene. Für Studios und Plattformbetreiber heißt das: Die nächsten Monate dürften zeigen, wie gut sich solche „Sound-World“-Modelle in bestehende Produktions- und Lokalisierungsprozesse integrieren lassen – insbesondere dann, wenn Creator nicht nur schneller produzieren, sondern auch rechtssicher veröffentlichen wollen.


💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!


Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
152 Bewertungen
Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
  • ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
334 Bewertungen
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
  • IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
1.501 Bewertungen
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
  • 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
53 Bewertungen
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
  • 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
946 Bewertungen
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
  • V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.


Hat Ihnen der Artikel bzw. die News - Sonilo bringt ein multimodales Audio‑Modell für Video: 11 Mio. US-$ in Serie A - gefallen? Dann abonnieren Sie uns doch auf Insta: AI News, Tech Trends & Robotics - Instagram - Boltwise

Unseren KI-Morning-Newsletter «Der KI News Espresso» mit den besten KI-News des letzten Tages gratis per eMail - ohne Werbung: Hier kostenlos eintragen!





Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!
Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.









Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "Sonilo bringt ein multimodales Audio‑Modell für Video: 11 Mio. US-$ in Serie A".
Stichwörter AI Artificial Intelligence Audio Model Creator Dubbing Generative Audio KI Künstliche Intelligenz Lip-sync Lizenzen Lizenzgeschäft Multimodal San Francisco Sonilo Sound Effects Startup Video To Music
Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!
Kein nächster Artikel
Vorheriger Artikel

TV-Experiment zu Schlaflosigkeit: Warum schlechter Schlaf krank macht


Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Sonilo bringt ein multimodales Audio‑Modell für Video: 11 Mio. US-$ in Serie A" für unsere Leser?

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

  • Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)


  • Es werden alle Kommentare moderiert!

    Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

    Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

    Du willst nichts verpassen?

    Du möchtest über ähnliche News und Beiträge wie "Sonilo bringt ein multimodales Audio‑Modell für Video: 11 Mio. US-$ in Serie A" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
    Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Sonilo bringt ein multimodales Audio‑Modell für Video: 11 Mio. US-$ in Serie A« bei Google Deutschland suchen, bei Bing oder Google News!


    788 Leser gerade online auf IT BOLTWISE
    KI-Jobs