LONDON (IT BOLTWISE) – Der französische KI-Startup Kog will die LLM-Inferenz deutlich beschleunigen, ohne auf neue Hardware setzen zu müssen. Das Unternehmen argumentiert, dass sich aus bereits vorhandenen Rechenzentrums-GPUs wesentlich mehr Leistung herausholen lässt. In einer frühen Vorschau zeigt Kog sehr schnelle Token-Generierung pro Anfrage und adressiert damit vor allem Workflows, die an Latenz und Kosten scheitern. Ziel sind zunächst größere Sprachmodelle, bevor das Team konkrete Kundentrajektionen und die nächste Finanzierungsrunde nachlegt.

Kog setzt bei LLM-Inferenz auf Software-Optimierung statt neue GPUs
Kog setzt bei LLM-Inferenz auf Software-Optimierung statt neue GPUs (Foto: IT BOLTWISE)
🧠 KI & Robotik auf Google News abonnieren

Die nächste Phase im Wettbewerb um KI-Inferenz spielt sich dort ab, wo Unternehmen die meiste Zeit und das meiste Geld investieren: in ihren bestehenden Rechenzentrums-Stacks. Während viele Anbieter neue Beschleuniger ankündigen, verfolgt der französische Startup Kog einen anderen Ansatz. Das Unternehmen will mit Software-Optimierungen den Durchsatz von Sprachmodellen auf konventionellen GPUs deutlich erhöhen, statt auf einen Hardware-Refresh zu warten. Der Kern der Aussage lautet: Extrem schnelle single-request decoding ist auch dann möglich, wenn Teams bereits heute GPUs wie AMDs MI300X oder NVIDIA-Karten wie H200 im Einsatz haben.

Technisch ist das vor allem deshalb relevant, weil Inferenz in der Praxis häufig weniger am Modelltraining als an der Betriebsrealität scheitert: Latenz, Kosten pro Anfrage und die Fähigkeit, mehrere Nutzer- oder Systemanfragen effizient zu bedienen. Kog verweist in seiner Vorschau auf eine Messgröße, die für produktive Anwendungen besonders zäh ist: In dem Demo-Kontext erreicht das System rund 3.000 Token pro Sekunde pro Anfrage. Wichtig ist dabei die Einordnung der Testbedingungen. Das Tempo wurde mit einem vergleichsweise kleinen Modell demonstriert, dem Laneformer 2B mit etwa 2 Milliarden Parametern, das später auch als Open-Source verfügbar gemacht wurde. Kog stellt jedoch die Behauptung in den Raum, dass die Methodik nicht an der Modellgröße hängen bleibt.

Damit rückt die Frage in den Mittelpunkt, die skeptische Stimmen oft stellen: Lässt sich Inferenz wirklich ohne dedizierte Inferenzchips beschleunigen, wenn die LLM-Größe steigt und die Speicher- sowie Bandbreite-Anforderungen wachsen? Kog-Geschäftsführer Gaël Delalleau adressiert genau diesen Punkt, indem er GPUs als nicht „ungeeignet“, sondern als missverstanden beschreibt. Seiner Lesart sind moderne GPUs eher darauf ausgelegt, und gerade die steigende Speicherbandbreite fordere dazu heraus, sie per Software gezielter zu nutzen. In der gleichen Argumentationslinie positioniert sich das Unternehmen als Software-getrieben: Es baut eine Inference-Engine mit dem Namen KIE (Kog Inference Engine), die die Ausführung so anpasst, dass der Durchsatz bei typischen Workloads besser wird als es die „Box-Spezifikationen“ erwarten lassen.

Der Marktrahmen dahinter ist aktuell deutlich enger gezogen als in der Trainingswelle. Kog sagt, es habe bereits zu Beginn 200 konkrete Business-Leads gesammelt. Das ist weniger ein Marketingindikator als ein Signal dafür, dass viele Teams die Inferenz-Geschwindigkeit als Flaschenhals betrachten und bereit sind, in Optimierungen zu investieren, die nicht zwingend eine neue GPU-Generation voraussetzen. Zugleich betont das Unternehmen ein weiteres Detail aus dem Nachfragebild: Viele potenzielle Kunden seien nicht darauf vorbereitet, kleine Modelle feinzujustieren. Stattdessen arbeitet Kog an einer Roadmap, die sich zunächst auf größere Modelle konzentriert. Für die Produkt-Planung heißt das auch: Das Team versucht, ein skalierbares Engineering-Programm zu schaffen, das mit der Nachfrage nach schnelleren Ergebnissen Schritt hält, ohne dass Anwender selbst umfangreiche Anpassungen vornehmen müssen.

Ein wichtiger Teil der Umsetzung ist die Frage, wie tief Kog in die Hardware eingreift. Delalleau beschreibt seinen Hintergrund als eine Mischung aus Physik und „Low-Level“-Arbeitsweise aus dem Bereich der offensiven Cybersicherheit, also dem Reverse-Engineering bis in Assembler- und Binär-Ebenen. Übertragen auf GPUs bedeutet das: Für jede neue GPU-Variante wolle man mehrere Wochen oder sogar Monate investieren, um Details gründlich zu untersuchen und GPU-Engineering-Forschung auf genau dieser Hardware durchzuführen. Mit einem Team von 11 Personen erklärt dieser Aufwand auch die Grenzen der Chip-Abdeckung „für die absehbare Zukunft“. Langfristig will Kog die Ergebnisse in agentenbasierte Pipelines überführen, mit denen sich mehr Chips und Modelle unterstützen lassen – wodurch der anfänglich manuelle Charakter reduziert werden soll.

Wettbewerb gibt es dabei ebenfalls. Aus Frankreich kommt etwa ZML, das laut Beschreibung eine hardware-agnostische Softwarestrategie verfolgt und dabei sogar den Weg abseits von NVIDIA-CUDA öffnen will, um schnelle Inferenz über unterschiedliche Chips hinweg zu ermöglichen. Kog ordnet sich in diesem Umfeld als näher an sehr forschungsnahen GPU-Benchmarks ein – Delalleaus Vergleich geht Richtung Hazy Research am Stanford-Umfeld. Entscheidend ist: Beide Ansätze setzen auf Software, unterscheiden sich aber vermutlich im Reifegrad und in der Breite der GPU-Unterstützung. Kog versucht, diese Lücke durch eine Kombination aus tiefem GPU-Know-how und späterer Skalierung über automatisierte Pipelines zu schließen.

Für die Anwendungsperspektive nennt Kog vor allem Use Cases, in denen „Wartezeiten“ spürbar Geld kosten oder Nutzerfriktion erzeugen. Hier liegt die Verbindung zu etablierten Industriemustern: Bei Claude-Nutzern ist aus der Praxis bekannt, dass schnellere Modi kostenpflichtig sind; Kog will genau diejenigen Teams abholen, die nicht länger Stunden auf Ergebnisse warten wollen. Auch Spiele- und App-Partner, die Inhalte aus Prompts generieren, gelten als Zielgruppe: Wenn die KIE-Engine schneller liefert, kann das im Betrieb mehr Iterationen pro Zeiteinheit ermöglichen – und damit direkt Umsatzpotenzial schaffen. Dass der Markt noch nicht vollständig gereift ist, erkennt Kog selbst an; erst die Umsetzung des ersten „major model“ mit einer Zielmarke von 10x Geschwindigkeit soll ab September als belastbare Grundlage dienen.

Für Investoren und als Strategiefrage ist die nächste Hürde damit klar: Kog muss zeigen, dass der Sprung von einem kleinen, gut steuerbaren Modell hin zu größeren LLMs in der Praxis genauso funktioniert. Das ist auch der Hebel für die Finanzierung der nächsten Stufe. Delalleau formuliert, man wolle nach Implementierung des ersten großen Modells und den ersten Nachweisen über tatsächliche Kundennutzung eine Series A anstoßen. Gleichzeitig wirken Förder- und Partnerschaftssignale als Rückenwind: Das Unternehmen wird durch Scaleway unterstützt und ist laut Darstellung in Programme des französischen Tech-Ökosystems eingebettet, darunter Bpifrance sowie ein Programm namens French Tech 2030. Wenn sich Kog daran hält, die „30x“ schneller versprochene Inferenz nicht nur als Demo-Zahl, sondern als wiederholbares Engineering-Ergebnis für mehrere GPU-Klassen auszurollen, könnte der Ansatz ein spürbarer Gegenentwurf zur sonst üblichen „Neue Hardware, neues Geld“-Logik in Rechenzentren werden.


💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!


Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
152 Bewertungen
Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
  • ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
334 Bewertungen
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
  • IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
1.501 Bewertungen
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
  • 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
53 Bewertungen
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
  • 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
946 Bewertungen
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
  • V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.


Hat Ihnen der Artikel bzw. die News - Kog setzt bei LLM-Inferenz auf Software-Optimierung statt neue GPUs - gefallen? Dann abonnieren Sie uns doch auf Insta: AI News, Tech Trends & Robotics - Instagram - Boltwise

Unseren KI-Morning-Newsletter «Der KI News Espresso» mit den besten KI-News des letzten Tages gratis per eMail - ohne Werbung: Hier kostenlos eintragen!





Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!
Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.









Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "Kog setzt bei LLM-Inferenz auf Software-Optimierung statt neue GPUs".
Stichwörter AI Artificial Intelligence Durchsatz GPU Inferenz KI Kubernetes Künstliche Intelligenz Latenz Llm MLOps Rechenzentrum Software-optimierung Token
Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!

Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Kog setzt bei LLM-Inferenz auf Software-Optimierung statt neue GPUs" für unsere Leser?

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

  • Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)


  • Es werden alle Kommentare moderiert!

    Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

    Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

    Du willst nichts verpassen?

    Du möchtest über ähnliche News und Beiträge wie "Kog setzt bei LLM-Inferenz auf Software-Optimierung statt neue GPUs" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
    Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Kog setzt bei LLM-Inferenz auf Software-Optimierung statt neue GPUs« bei Google Deutschland suchen, bei Bing oder Google News!


    915 Leser gerade online auf IT BOLTWISE
    KI-Jobs