LONDON / LONDON (IT BOLTWISE) – Der KI-Workload-Optimierer Callosum hat 100 Millionen US-Dollar eingesammelt und bringt mit „Tailored Inference“ eine neue Cloud-Software zur effizienten Ausführung von Inferenzaufgaben an den Start. Das System zerlegt mehrstufige Aufgaben in einzelne Module und routet jeden Schritt zum dafür passenden Modell. Zusätzlich plant es die Ausführung so, dass Modelle möglichst direkt auf den jeweiligen Chips laufen. Im Fokus stehen damit niedrigere Infrastrukturkosten und schnelleres Inferenz-Timing bei zugleich besserer Ausgabequalität.

Mit einer frischen Finanzierungsrunde von 100 Millionen US-Dollar verschiebt sich der Wettbewerb in der KI-Infrastruktur ein Stück weit weg von reiner Rechenleistung hin zur Frage, wie man Rechenlasten intelligent orchestriert. Callosum positioniert sich dabei als Startup für „AI workload optimization“ und nennt sein zentrales Produkt „Tailored Inference“. Die Idee ist nicht, dass ein einzelnes Modell immer die beste Wahl ist, sondern dass die Architektur eines typischen Inferenz-Pipelines häufig aus vielen Schritten besteht, die unterschiedlich stark von verschiedenen Modellklassen profitieren. Genau diesen Mix will das Unternehmen softwareseitig steuern, statt die Entwicklerteams auf statische Modellentscheidungen festzunageln.
Technisch setzt Tailored Inference auf eine Aufteilung des gesamten Inferenz-Workflows in standalone Software-Module, sogenannte „blocks“. Statt einen Prompt als Ganzes durch ein Modell zu schicken, werden die einzelnen Schritte, aus denen eine Aufgabe besteht, getrennt behandelt und dann jeweils an das Modell weitergereicht, das nach Callosums Beschreibung dafür am besten geeignet ist. Für einfache Teilaufgaben kommt demnach ein kostengünstigeres Setup zum Einsatz, während anspruchsvollere Arbeit an „frontier models“ wandert. Diese Aufteilung wirkt sich unmittelbar auf Latenz und Kosten aus, weil nicht jede Token-Generation oder jede reasoning-dichte Phase zwangsläufig die teuerste Modellinstanz ansteuern muss.
Besonders relevant für Betreiber ist dabei, dass Tailored Inference nicht nur über Modelle entscheidet, sondern auch über die passende Ausführungsumgebung. Nachdem das System festgelegt hat, welcher Teil der Inferenzaufgabe von welchem Modell übernommen wird, deployt es jeden Modellanteil auf den Chip, der laut Callosum die effizienteste Ausführung ermöglicht. Für die Praxis bedeutet das: Das Orchestrierungsproblem wird nicht allein im „Software-Mapping“ gelöst, sondern bis auf die Hardware-Instanz durchgezogen. Das kann in heterogenen Rechenzentren den Unterschied machen, ob ein Workflow „überall irgendwie“ läuft oder ob er gezielt dort betrieben wird, wo die Hardware- und Modellprofile wirklich zusammenpassen.
Als Zielbild nennt Callosum für bestimmte Inferenzaufgaben eine rund 3,7-fache schnellere Fertigstellung gegenüber einer im Text referenzierten Vergleichslinie („GPT-5.6 Luna“) und zudem eine bessere Ausgabequalität. Unabhängig davon, wie einzelne Benchmarks in der Realität im Detail ausfallen, ist die Richtung klar: Es geht um Effizienzgewinne durch Routing, bessere Auslastung und geringere Overhead-Kosten. Genau hier treffen sich zwei Entwicklungslinien der letzten Jahre. Einerseits sind Modelle immer größer und damit teurer in der Laufzeit geworden. Andererseits hat sich parallel die Erkenntnis durchgesetzt, dass Inferenz häufig nicht „ein Durchlauf“ ist, sondern ein Orchester aus Vorverarbeitung, Zwischenschritten und nachgelagerten Generationen.
Die Partnerschaften und Hardware-Anker zeigen, wie Callosum das Orchestrierungsprinzip konkret macht. Tailored Inference soll bei Launch Beschleuniger von mehr als einem halben Dutzend Anbietern unterstützen. In der aktuellen Meldung sticht die Integration mit Cerebras Systems heraus, deren Chipfamilie WSE in das System einfließen soll. Cerebras kündigt im Zuge der Runde zudem die neueste Stufe WSE-3 Turbo an: gleiche Kernanzahl wie der Vorgänger, aber mit höherer Taktfrequenz für die doppelte Performance; außerdem wurde das On-Chip-Netzwerk, das die Kerne verbindet, aktualisiert. Das wird ergänzt durch die Art, wie Cerebras die Beschleuniger in der Praxis bereitstellt: als „Wafer-Scale Backpack“ mit Liquid-Cooling, Power-Management und Hilfskomponenten, die wiederum das Rückgrat für das Rack-„CS-4“-Appliance-System bilden.
Auch die Feinabstimmung für bestimmte Phasen der Textgenerierung ist Teil des Konzepts. Der Prompt-Response-Prozess lässt sich in „prefill“ und „decode“ aufteilen; Cerebras ordnet seine Stärke besonders dem „decode“-Schritt zu und verweist darauf, dass der CS-4 zusammen mit prefill-optimierten Chips betrieben werden kann, etwa aus dem Umfeld von Advanced Micro Devices und Amazon Web Services. Callosum will in diesem Szenario Kunden-Workloads sowohl auf der Hardware dieser Anbieter als auch auf der Cerebras-Siliziumplattform ausführen können. Für Unternehmen ist das mehr als nur eine Kompatibilitätsliste: Es beschreibt einen Weg, Inferenz in mehreren Phasen auf die jeweils passendsten Beschleuniger zu verteilen, statt die gesamte Pipeline in einem einzigen Hardwaremodus laufen zu lassen. Daran lässt sich auch ablesen, warum der Schritt „Compute-Orchestrierung“ strategisch ist: Die Gesamtleistung entsteht aus dem Zusammenspiel, nicht aus einer einzigen Spitzenkomponente.
Aus Markt- und Produktperspektive ist die Finanzierung zudem ein Signal, dass sich der Fokus in Richtung spezialisierter Middleware verlagert. Der Claim „nicht nur wie viel compute verfügbar ist, sondern wie intelligent compute orchestriert wird“ ist im Umfeld großer Modellfamilien inzwischen fast zwangsläufig, weil reine Skalierung angesichts von Budgetdruck und Zielkonflikten (Kosten, Latenz, Qualitätsanforderungen) schwieriger wird. „The next-generation of AI will be defined by how intelligently compute is orchestrated, not simply how much compute is available, “ sagte Callosum-Mitgründer und CEO Danyal Akarca. Für Entscheider bedeutet das: Wenn Orchestrierungs-Schichten wirklich stabil funktionieren, können sie die Art verändern, wie Teams ihre Modell- und Hardware-Roadmaps planen – weniger nach dem „besten Modell“, mehr nach dem „besten Zusammenspiel“ aus Modellklassen, Phasenlogik und Ausführungszielen.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Callosum sammelt 100 Mio. US-Dollar: KI-Workloads werden effizienter gesteuert" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Callosum sammelt 100 Mio. US-Dollar: KI-Workloads werden effizienter gesteuert" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Callosum sammelt 100 Mio. US-Dollar: KI-Workloads werden effizienter gesteuert« bei Google Deutschland suchen, bei Bing oder Google News!