SAN FRANCISCO / LONDON (IT BOLTWISE) – Twelve Labs erhält 100 Millionen US-Dollar für KI-Modelle, die Video nicht nur verstehen, sondern auch gezielt durchsuchbar machen sollen. Das Startup nutzt eine mehrstufige Modell-Pipeline, um Ton, Sprache und Bewegung aus Rohmaterial in maschinenlesbare Daten zu überführen. Mit AWS und speziell auf Trainium ausgelegter Infrastruktur geht es zudem in Richtung Entwickler-Workloads und KI-„Videoagenten“, die Aufgaben auf Basis von Textbefehlen planen und ausführen.

Twelve Labs treibt die Suche in Videobibliotheken in die nächste Phase: Das Startup aus San Francisco sichert sich laut Meldung eine Series-B-Finanzierungsrunde über 100 Millionen US-Dollar. Zu den Beteiligten zählen neben Amazon AWS-nahem Kapital auch NEA Management sowie Naver Ventures; außerdem kamen weitere Investoren wie Radical Ventures und Index Ventures hinzu. Für Unternehmen ist das besonders relevant, weil der Engpass bei Video häufig nicht die Speicherung, sondern die Auffindbarkeit ist: Dateien sind zu dicht und zu unstrukturiert, um sie wie Textsysteme über Metadaten, Tags oder Volltextsuche zu erschließen.
Im Kern verfolgt Twelve Labs einen multimodalen Ansatz. Während klassische Such- und Analysepipelines bei Video meist auf einzelne Ansätze setzen – etwa auf Stichproben von Frames oder auf Textausgaben wie Untertitel und Transkripte – will die neue Modellgeneration mehrere Signaltypen gemeinsam verarbeiten. Berichten zufolge lässt sich das mit einer Kaskade abbilden: Ein erstes Modell, Marengo 3.0, übersetzt rohes Videomaterial so, dass Maschinen über Sound, Sprache und Bewegung hinweg suchen können. Anschließend strukturiert Pegasus 1.5 diese Ausgaben in ein Format, das für KI-Tools oder Anwendungen direkt nutzbar wird, ähnlich wie Markup-Logik Dokumente browserfähig macht. Genau hier liegt der technische Hebel: Die Suche wird nicht „nur“ verbessert, sondern auf eine konsistente Datenbasis gestellt.
Dazu passt die Infrastrukturentscheidung, die mit AWS und Chips von NVIDIA-nahem Ökosystem verknüpft ist. Amazon AWS soll laut Bericht neue Trainium-basierte Workloads für die Hosting-Umgebung bereitstellen, und zwar über einen mehrjährigen Vertrag. Damit wird nicht nur Rechenkapazität beschafft, sondern auch ein Entwicklungs- und Deployment-Pfad für KI-Teams eröffnet, die ihre Modelle als Service in eine Produktionsumgebung bringen wollen. In der Praxis ist Trainium vor allem dann ein Asset, wenn Unternehmen große Inferenz- oder Traininglasten mit planbaren Kostenstrukturen abbilden müssen. Der Vergleich zu Cloud-„General-Purpose“-Compute liegt auf der Hand: Spezialisierte Beschleuniger können die Laufzeit und Energieeffizienz spürbar beeinflussen, sofern die Software-Stack-Anpassung gelingt.
Marktseitig ist das Timing bemerkenswert, weil Video seit Jahren zu den „letzten großen Dateninseln“ in Unternehmen zählt. Rund 90% der weltweiten Daten werden in der Meldung als Videodaten beschrieben – trotzdem bleiben viele Archive praktisch unbenutzbar, weil die semantische Struktur fehlt. Branchenkenner sehen zudem, dass große Sprachmodelle zwar beim Generieren von Antworten helfen, aber häufig bei der präzisen Verknüpfung mit visuellen Ereignissen ins Stolpern geraten, wenn sie nur über vereinzelte Frames oder extrahierte Texte trainiert bzw. Informiert werden. Der Ansatz von Twelve Labs adressiert genau diese Lücke, indem er „jede Sekunde“ adressierbar machen will. Wettbewerber arbeiten ebenfalls an Videoverständnis und Suche, etwa über Embeddings, Tracking oder multimodale Transformer-Ansätze; der Unterschied liegt typischerweise in der Zielrichtung: Suche und Nutzbarkeit im Produktionsalltag statt nur klassifikationsbasierter Analytik.
Ein weiterer Baustein sind Videoagenten, die im Idealfall nicht nur Ergebnisse liefern, sondern Aufgaben durchführen. Twelve Labs plant, Video über Textkommandos durchsuchen, erklären, planen und schließlich ausführen zu lassen. Das ist eine direkte Übersetzung dessen, was in vielen Unternehmen schon heute im Dokumentenmanagement oder in Ticket-Systemen funktioniert, aber dort bleibt Video oft auf manuelle Prozesse angewiesen. Als Beispiel nennt das Startup die Auffindbarkeit konkreter Szenen: etwa Filmsequenzen wie eine Taxiszene aus „On the Waterfront“ oder der „Hand of God“-Moment aus der WM 1986. Für Medienhäuser, Sportrechteinhaber und Werbeagenturen ist das mehr als Komfort: Wer Werbeclips, Sportmomente oder Videomaterial wiederverwendet, braucht schnelle, reproduzierbare Retrieval-Mechanismen, die nicht davon abhängen, dass Menschen die richtigen Ordner-Namen kennen.
Unternehmensseitig zeigt sich der Nutzen auch in der Zielkundschaft: Hollywood-Studios mit Millionen Stunden Archiv, Werbeunternehmen, Social-Media-Inhalte und Sport-Organisationen gehören Berichten zufolge zum Kundenkreis. Genannt werden unter anderem Toronto Raptors-Eigentümer Maple Leaf Sports & Entertainment, AMC Global Media und UNICEF. Aus Enterprise-Sicht ist dabei entscheidend, wie sich Qualität und Governance koppeln lassen. Video-Suche berührt schnell Themen wie Rechteverwaltung, Altersfreigaben, sensible Aufnahmen und Auditierbarkeit: Wenn KI aus Rohmaterial semantische Indikatoren ableitet, müssen Organisationen nachvollziehen können, welche Daten in welchen Pipelines landen. Ohne klare Datenschutz- und Sicherheitskonzepte entsteht nicht nur ein Compliance-Risiko, sondern auch ein Akzeptanzproblem bei Redaktionen und Legal-Abteilungen.
Historisch betrachtet ist der Weg nachvollziehbar: Erst als Rechenleistung und multimodales Training verfügbar wurden, ließen sich große Modelle so einsetzen, dass sie Bild- und Toninformationen nicht nur als Rohdaten betrachten, sondern als Bedeutungsträger. In der frühen Phase setzten viele Teams auf OCR, Untertitel, manuelle Annotationen oder reine Frame-Klassifikation. Das Problem dabei: Suchanfragen sind oft ereignis- oder kontextbasiert („Zeig mir die Szene, in der…“), während diese Ansätze eher objektorientiert oder textorientiert bleiben. Twelve Labs verschiebt die Arbeitsweise hin zu einer Pipeline, in der Video zuerst in maschinenlesbare, durchsuchbare Struktur übersetzt und erst danach an Agenten und Anwendungen übergeben wird. Dieser Paradigmenwechsel ist auch ein Vorteil im Wettbewerb mit „nur“ embedding-basierten Systemen: Eine strukturierte Zwischenrepräsentation kann die spätere Genauigkeit beim Retrieval und die Interpretierbarkeit verbessern.
Ausblickend wird spannend, ob Twelve Labs die versprochene „stack“-artige Verknüpfung der Modelle langfristig stabil betreiben kann. Wenn Pegasus 1.5 die Ausgaben in wiederverwendbare, KI-parsebare Daten gießt, hängt die Roadmap stark davon ab, wie robust das System gegenüber Schnittstellenänderungen, neuen Kodierungen und variierender Bildqualität bleibt. Zudem dürfte der Ausbau der Agenten-Fähigkeiten von Evaluationsmetriken abhängen: Wie gut werden „richtige“ Szenen gefunden, wie konsistent werden Erklärungen, und wie zuverlässig plant ein Agent eine Abfolge mehrerer Schritte? Für Entwickler entsteht daraus eine konkrete Chance: Wer Videoinhalte in produktiven Workflows auswertet, kann Retrieval künftig stärker in bestehende KI-Anwendungslandschaften integrieren. Die nächste Welle wird dabei weniger eine einzelne Modell-Headline sein als die Frage, wie sicher, auditierbar und kosteneffizient sich Video-Understanding als Dienstleistung skalieren lässt.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- NIEDLICHER BEGLEITER: Eilik ist der ideale Begleiter für Kinder und Erwachsene, die Haustiere, Spiele und intelligente Roboter lieben. Mit vielen Emotionen, Bewegungen und interaktiven Funktionen.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Twelve Labs: 100 Millionen Dollar für KI, die Videoinhalte in Sekunden durchsuchbar macht" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Twelve Labs: 100 Millionen Dollar für KI, die Videoinhalte in Sekunden durchsuchbar macht" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Twelve Labs: 100 Millionen Dollar für KI, die Videoinhalte in Sekunden durchsuchbar macht« bei Google Deutschland suchen, bei Bing oder Google News!