SAN FRANCISCO / LONDON (IT BOLTWISE) – Twelve Labs erhält 100 Millionen US-Dollar für KI-Modelle, die Video nicht nur verstehen, sondern auch gezielt durchsuchbar machen sollen. Das Startup nutzt eine mehrstufige Modell-Pipeline, um Ton, Sprache und Bewegung aus Rohmaterial in maschinenlesbare Daten zu überführen. Mit AWS und speziell auf Trainium ausgelegter Infrastruktur geht es zudem in Richtung Entwickler-Workloads und KI-„Videoagenten“, die Aufgaben auf Basis von Textbefehlen planen und ausführen.

Twelve Labs: 100 Millionen Dollar für KI, die Videoinhalte in Sekunden durchsuchbar macht
Twelve Labs: 100 Millionen Dollar für KI, die Videoinhalte in Sekunden durchsuchbar macht (Foto: IT BOLTWISE)
🧠 KI & Robotik auf Google News abonnieren

Twelve Labs treibt die Suche in Videobibliotheken in die nächste Phase: Das Startup aus San Francisco sichert sich laut Meldung eine Series-B-Finanzierungsrunde über 100 Millionen US-Dollar. Zu den Beteiligten zählen neben Amazon AWS-nahem Kapital auch NEA Management sowie Naver Ventures; außerdem kamen weitere Investoren wie Radical Ventures und Index Ventures hinzu. Für Unternehmen ist das besonders relevant, weil der Engpass bei Video häufig nicht die Speicherung, sondern die Auffindbarkeit ist: Dateien sind zu dicht und zu unstrukturiert, um sie wie Textsysteme über Metadaten, Tags oder Volltextsuche zu erschließen.

Im Kern verfolgt Twelve Labs einen multimodalen Ansatz. Während klassische Such- und Analysepipelines bei Video meist auf einzelne Ansätze setzen – etwa auf Stichproben von Frames oder auf Textausgaben wie Untertitel und Transkripte – will die neue Modellgeneration mehrere Signaltypen gemeinsam verarbeiten. Berichten zufolge lässt sich das mit einer Kaskade abbilden: Ein erstes Modell, Marengo 3.0, übersetzt rohes Videomaterial so, dass Maschinen über Sound, Sprache und Bewegung hinweg suchen können. Anschließend strukturiert Pegasus 1.5 diese Ausgaben in ein Format, das für KI-Tools oder Anwendungen direkt nutzbar wird, ähnlich wie Markup-Logik Dokumente browserfähig macht. Genau hier liegt der technische Hebel: Die Suche wird nicht „nur“ verbessert, sondern auf eine konsistente Datenbasis gestellt.

Dazu passt die Infrastrukturentscheidung, die mit AWS und Chips von NVIDIA-nahem Ökosystem verknüpft ist. Amazon AWS soll laut Bericht neue Trainium-basierte Workloads für die Hosting-Umgebung bereitstellen, und zwar über einen mehrjährigen Vertrag. Damit wird nicht nur Rechenkapazität beschafft, sondern auch ein Entwicklungs- und Deployment-Pfad für KI-Teams eröffnet, die ihre Modelle als Service in eine Produktionsumgebung bringen wollen. In der Praxis ist Trainium vor allem dann ein Asset, wenn Unternehmen große Inferenz- oder Traininglasten mit planbaren Kostenstrukturen abbilden müssen. Der Vergleich zu Cloud-„General-Purpose“-Compute liegt auf der Hand: Spezialisierte Beschleuniger können die Laufzeit und Energieeffizienz spürbar beeinflussen, sofern die Software-Stack-Anpassung gelingt.

Marktseitig ist das Timing bemerkenswert, weil Video seit Jahren zu den „letzten großen Dateninseln“ in Unternehmen zählt. Rund 90% der weltweiten Daten werden in der Meldung als Videodaten beschrieben – trotzdem bleiben viele Archive praktisch unbenutzbar, weil die semantische Struktur fehlt. Branchenkenner sehen zudem, dass große Sprachmodelle zwar beim Generieren von Antworten helfen, aber häufig bei der präzisen Verknüpfung mit visuellen Ereignissen ins Stolpern geraten, wenn sie nur über vereinzelte Frames oder extrahierte Texte trainiert bzw. Informiert werden. Der Ansatz von Twelve Labs adressiert genau diese Lücke, indem er „jede Sekunde“ adressierbar machen will. Wettbewerber arbeiten ebenfalls an Videoverständnis und Suche, etwa über Embeddings, Tracking oder multimodale Transformer-Ansätze; der Unterschied liegt typischerweise in der Zielrichtung: Suche und Nutzbarkeit im Produktionsalltag statt nur klassifikationsbasierter Analytik.

Ein weiterer Baustein sind Videoagenten, die im Idealfall nicht nur Ergebnisse liefern, sondern Aufgaben durchführen. Twelve Labs plant, Video über Textkommandos durchsuchen, erklären, planen und schließlich ausführen zu lassen. Das ist eine direkte Übersetzung dessen, was in vielen Unternehmen schon heute im Dokumentenmanagement oder in Ticket-Systemen funktioniert, aber dort bleibt Video oft auf manuelle Prozesse angewiesen. Als Beispiel nennt das Startup die Auffindbarkeit konkreter Szenen: etwa Filmsequenzen wie eine Taxiszene aus „On the Waterfront“ oder der „Hand of God“-Moment aus der WM 1986. Für Medienhäuser, Sportrechteinhaber und Werbeagenturen ist das mehr als Komfort: Wer Werbeclips, Sportmomente oder Videomaterial wiederverwendet, braucht schnelle, reproduzierbare Retrieval-Mechanismen, die nicht davon abhängen, dass Menschen die richtigen Ordner-Namen kennen.

Unternehmensseitig zeigt sich der Nutzen auch in der Zielkundschaft: Hollywood-Studios mit Millionen Stunden Archiv, Werbeunternehmen, Social-Media-Inhalte und Sport-Organisationen gehören Berichten zufolge zum Kundenkreis. Genannt werden unter anderem Toronto Raptors-Eigentümer Maple Leaf Sports & Entertainment, AMC Global Media und UNICEF. Aus Enterprise-Sicht ist dabei entscheidend, wie sich Qualität und Governance koppeln lassen. Video-Suche berührt schnell Themen wie Rechteverwaltung, Altersfreigaben, sensible Aufnahmen und Auditierbarkeit: Wenn KI aus Rohmaterial semantische Indikatoren ableitet, müssen Organisationen nachvollziehen können, welche Daten in welchen Pipelines landen. Ohne klare Datenschutz- und Sicherheitskonzepte entsteht nicht nur ein Compliance-Risiko, sondern auch ein Akzeptanzproblem bei Redaktionen und Legal-Abteilungen.

Historisch betrachtet ist der Weg nachvollziehbar: Erst als Rechenleistung und multimodales Training verfügbar wurden, ließen sich große Modelle so einsetzen, dass sie Bild- und Toninformationen nicht nur als Rohdaten betrachten, sondern als Bedeutungsträger. In der frühen Phase setzten viele Teams auf OCR, Untertitel, manuelle Annotationen oder reine Frame-Klassifikation. Das Problem dabei: Suchanfragen sind oft ereignis- oder kontextbasiert („Zeig mir die Szene, in der…“), während diese Ansätze eher objektorientiert oder textorientiert bleiben. Twelve Labs verschiebt die Arbeitsweise hin zu einer Pipeline, in der Video zuerst in maschinenlesbare, durchsuchbare Struktur übersetzt und erst danach an Agenten und Anwendungen übergeben wird. Dieser Paradigmenwechsel ist auch ein Vorteil im Wettbewerb mit „nur“ embedding-basierten Systemen: Eine strukturierte Zwischenrepräsentation kann die spätere Genauigkeit beim Retrieval und die Interpretierbarkeit verbessern.

Ausblickend wird spannend, ob Twelve Labs die versprochene „stack“-artige Verknüpfung der Modelle langfristig stabil betreiben kann. Wenn Pegasus 1.5 die Ausgaben in wiederverwendbare, KI-parsebare Daten gießt, hängt die Roadmap stark davon ab, wie robust das System gegenüber Schnittstellenänderungen, neuen Kodierungen und variierender Bildqualität bleibt. Zudem dürfte der Ausbau der Agenten-Fähigkeiten von Evaluationsmetriken abhängen: Wie gut werden „richtige“ Szenen gefunden, wie konsistent werden Erklärungen, und wie zuverlässig plant ein Agent eine Abfolge mehrerer Schritte? Für Entwickler entsteht daraus eine konkrete Chance: Wer Videoinhalte in produktiven Workflows auswertet, kann Retrieval künftig stärker in bestehende KI-Anwendungslandschaften integrieren. Die nächste Welle wird dabei weniger eine einzelne Modell-Headline sein als die Frage, wie sicher, auditierbar und kosteneffizient sich Video-Understanding als Dienstleistung skalieren lässt.


💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!


Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
152 Bewertungen
Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
  • ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
334 Bewertungen
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
  • IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
Eilik intelligenter Schreibtisch Roboter | für Kinder & Erwachsene, mit Emotionen Interaktionen und Animationen, Spielzeug Unterhaltung Begleiter Haustier Persönlicher Assistent, für mehr Spaß
1.501 Bewertungen
Eilik intelligenter Schreibtisch Roboter | für Kinder & Erwachsene, mit Emotionen Interaktionen und Animationen, Spielzeug Unterhaltung Begleiter Haustier Persönlicher Assistent, für mehr Spaß
  • NIEDLICHER BEGLEITER: Eilik ist der ideale Begleiter für Kinder und Erwachsene, die Haustiere, Spiele und intelligente Roboter lieben. Mit vielen Emotionen, Bewegungen und interaktiven Funktionen.
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
53 Bewertungen
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
  • 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
946 Bewertungen
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
  • V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.


Hat Ihnen der Artikel bzw. die News - Twelve Labs: 100 Millionen Dollar für KI, die Videoinhalte in Sekunden durchsuchbar macht - gefallen? Dann abonnieren Sie uns doch auf Insta: AI News, Tech Trends & Robotics - Instagram - Boltwise

Unseren KI-Morning-Newsletter «Der KI News Espresso» mit den besten KI-News des letzten Tages gratis per eMail - ohne Werbung: Hier kostenlos eintragen!





Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!
Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.









Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "Twelve Labs: 100 Millionen Dollar für KI, die Videoinhalte in Sekunden durchsuchbar macht".
Stichwörter Agenten AI Artificial Intelligence AWS Daten Enterprise Inferenz KI Künstliche Intelligenz Model Multimodal Nvidia Suche Trainium Twelve Labs Unterhaltung Video
Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!

Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Twelve Labs: 100 Millionen Dollar für KI, die Videoinhalte in Sekunden durchsuchbar macht" für unsere Leser?

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

  • Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)


  • Es werden alle Kommentare moderiert!

    Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

    Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

    Du willst nichts verpassen?

    Du möchtest über ähnliche News und Beiträge wie "Twelve Labs: 100 Millionen Dollar für KI, die Videoinhalte in Sekunden durchsuchbar macht" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
    Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Twelve Labs: 100 Millionen Dollar für KI, die Videoinhalte in Sekunden durchsuchbar macht« bei Google Deutschland suchen, bei Bing oder Google News!


    5.834 Leser gerade online auf IT BOLTWISE
    KI-Jobs