LONDON / LONDON (IT BOLTWISE) – Der KI-Workload-Optimierer Callosum hat 100 Millionen US-Dollar eingesammelt und bringt mit „Tailored Inference“ eine neue Cloud-Software zur effizienten Ausführung von Inferenzaufgaben an den Start. Das System zerlegt mehrstufige Aufgaben in einzelne Module und routet jeden Schritt zum dafür passenden Modell. Zusätzlich plant es die Ausführung so, dass Modelle möglichst direkt auf den jeweiligen Chips laufen. Im Fokus stehen damit niedrigere Infrastrukturkosten und schnelleres Inferenz-Timing bei zugleich besserer Ausgabequalität.

Callosum sammelt 100 Mio. US-Dollar: KI-Workloads werden effizienter gesteuert
Callosum sammelt 100 Mio. US-Dollar: KI-Workloads werden effizienter gesteuert (Foto: IT BOLTWISE)
🧠 KI & Robotik auf Google News abonnieren

Mit einer frischen Finanzierungsrunde von 100 Millionen US-Dollar verschiebt sich der Wettbewerb in der KI-Infrastruktur ein Stück weit weg von reiner Rechenleistung hin zur Frage, wie man Rechenlasten intelligent orchestriert. Callosum positioniert sich dabei als Startup für „AI workload optimization“ und nennt sein zentrales Produkt „Tailored Inference“. Die Idee ist nicht, dass ein einzelnes Modell immer die beste Wahl ist, sondern dass die Architektur eines typischen Inferenz-Pipelines häufig aus vielen Schritten besteht, die unterschiedlich stark von verschiedenen Modellklassen profitieren. Genau diesen Mix will das Unternehmen softwareseitig steuern, statt die Entwicklerteams auf statische Modellentscheidungen festzunageln.

Technisch setzt Tailored Inference auf eine Aufteilung des gesamten Inferenz-Workflows in standalone Software-Module, sogenannte „blocks“. Statt einen Prompt als Ganzes durch ein Modell zu schicken, werden die einzelnen Schritte, aus denen eine Aufgabe besteht, getrennt behandelt und dann jeweils an das Modell weitergereicht, das nach Callosums Beschreibung dafür am besten geeignet ist. Für einfache Teilaufgaben kommt demnach ein kostengünstigeres Setup zum Einsatz, während anspruchsvollere Arbeit an „frontier models“ wandert. Diese Aufteilung wirkt sich unmittelbar auf Latenz und Kosten aus, weil nicht jede Token-Generation oder jede reasoning-dichte Phase zwangsläufig die teuerste Modellinstanz ansteuern muss.

Besonders relevant für Betreiber ist dabei, dass Tailored Inference nicht nur über Modelle entscheidet, sondern auch über die passende Ausführungsumgebung. Nachdem das System festgelegt hat, welcher Teil der Inferenzaufgabe von welchem Modell übernommen wird, deployt es jeden Modellanteil auf den Chip, der laut Callosum die effizienteste Ausführung ermöglicht. Für die Praxis bedeutet das: Das Orchestrierungsproblem wird nicht allein im „Software-Mapping“ gelöst, sondern bis auf die Hardware-Instanz durchgezogen. Das kann in heterogenen Rechenzentren den Unterschied machen, ob ein Workflow „überall irgendwie“ läuft oder ob er gezielt dort betrieben wird, wo die Hardware- und Modellprofile wirklich zusammenpassen.

Als Zielbild nennt Callosum für bestimmte Inferenzaufgaben eine rund 3,7-fache schnellere Fertigstellung gegenüber einer im Text referenzierten Vergleichslinie („GPT-5.6 Luna“) und zudem eine bessere Ausgabequalität. Unabhängig davon, wie einzelne Benchmarks in der Realität im Detail ausfallen, ist die Richtung klar: Es geht um Effizienzgewinne durch Routing, bessere Auslastung und geringere Overhead-Kosten. Genau hier treffen sich zwei Entwicklungslinien der letzten Jahre. Einerseits sind Modelle immer größer und damit teurer in der Laufzeit geworden. Andererseits hat sich parallel die Erkenntnis durchgesetzt, dass Inferenz häufig nicht „ein Durchlauf“ ist, sondern ein Orchester aus Vorverarbeitung, Zwischenschritten und nachgelagerten Generationen.

Die Partnerschaften und Hardware-Anker zeigen, wie Callosum das Orchestrierungsprinzip konkret macht. Tailored Inference soll bei Launch Beschleuniger von mehr als einem halben Dutzend Anbietern unterstützen. In der aktuellen Meldung sticht die Integration mit Cerebras Systems heraus, deren Chipfamilie WSE in das System einfließen soll. Cerebras kündigt im Zuge der Runde zudem die neueste Stufe WSE-3 Turbo an: gleiche Kernanzahl wie der Vorgänger, aber mit höherer Taktfrequenz für die doppelte Performance; außerdem wurde das On-Chip-Netzwerk, das die Kerne verbindet, aktualisiert. Das wird ergänzt durch die Art, wie Cerebras die Beschleuniger in der Praxis bereitstellt: als „Wafer-Scale Backpack“ mit Liquid-Cooling, Power-Management und Hilfskomponenten, die wiederum das Rückgrat für das Rack-„CS-4“-Appliance-System bilden.

Auch die Feinabstimmung für bestimmte Phasen der Textgenerierung ist Teil des Konzepts. Der Prompt-Response-Prozess lässt sich in „prefill“ und „decode“ aufteilen; Cerebras ordnet seine Stärke besonders dem „decode“-Schritt zu und verweist darauf, dass der CS-4 zusammen mit prefill-optimierten Chips betrieben werden kann, etwa aus dem Umfeld von Advanced Micro Devices und Amazon Web Services. Callosum will in diesem Szenario Kunden-Workloads sowohl auf der Hardware dieser Anbieter als auch auf der Cerebras-Siliziumplattform ausführen können. Für Unternehmen ist das mehr als nur eine Kompatibilitätsliste: Es beschreibt einen Weg, Inferenz in mehreren Phasen auf die jeweils passendsten Beschleuniger zu verteilen, statt die gesamte Pipeline in einem einzigen Hardwaremodus laufen zu lassen. Daran lässt sich auch ablesen, warum der Schritt „Compute-Orchestrierung“ strategisch ist: Die Gesamtleistung entsteht aus dem Zusammenspiel, nicht aus einer einzigen Spitzenkomponente.

Aus Markt- und Produktperspektive ist die Finanzierung zudem ein Signal, dass sich der Fokus in Richtung spezialisierter Middleware verlagert. Der Claim „nicht nur wie viel compute verfügbar ist, sondern wie intelligent compute orchestriert wird“ ist im Umfeld großer Modellfamilien inzwischen fast zwangsläufig, weil reine Skalierung angesichts von Budgetdruck und Zielkonflikten (Kosten, Latenz, Qualitätsanforderungen) schwieriger wird. „The next-generation of AI will be defined by how intelligently compute is orchestrated, not simply how much compute is available, “ sagte Callosum-Mitgründer und CEO Danyal Akarca. Für Entscheider bedeutet das: Wenn Orchestrierungs-Schichten wirklich stabil funktionieren, können sie die Art verändern, wie Teams ihre Modell- und Hardware-Roadmaps planen – weniger nach dem „besten Modell“, mehr nach dem „besten Zusammenspiel“ aus Modellklassen, Phasenlogik und Ausführungszielen.


💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!


Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
152 Bewertungen
Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
  • ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
334 Bewertungen
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
  • IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
1.501 Bewertungen
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
  • 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
53 Bewertungen
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
  • 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
946 Bewertungen
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
  • V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.


Hat Ihnen der Artikel bzw. die News - Callosum sammelt 100 Mio. US-Dollar: KI-Workloads werden effizienter gesteuert - gefallen? Dann abonnieren Sie uns doch auf Insta: AI News, Tech Trends & Robotics - Instagram - Boltwise

Unseren KI-Morning-Newsletter «Der KI News Espresso» mit den besten KI-News des letzten Tages gratis per eMail - ohne Werbung: Hier kostenlos eintragen!





Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!
Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.









Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "Callosum sammelt 100 Mio. US-Dollar: KI-Workloads werden effizienter gesteuert".
Stichwörter AI Artificial Intelligence Atomico Chip Cloud Cs-4 Dcvc Hardware-beschleuniger Inferenz KI Künstliche Intelligenz Künstliche-intelligenz MLOps Modell-orchestrierung Routing Wafer-scale-backpack Workload-optimierung Wse-3-turbo
Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!

Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Callosum sammelt 100 Mio. US-Dollar: KI-Workloads werden effizienter gesteuert" für unsere Leser?

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

  • Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)


  • Es werden alle Kommentare moderiert!

    Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

    Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

    Du willst nichts verpassen?

    Du möchtest über ähnliche News und Beiträge wie "Callosum sammelt 100 Mio. US-Dollar: KI-Workloads werden effizienter gesteuert" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
    Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Callosum sammelt 100 Mio. US-Dollar: KI-Workloads werden effizienter gesteuert« bei Google Deutschland suchen, bei Bing oder Google News!


    895 Leser gerade online auf IT BOLTWISE
    KI-Jobs