TORONTO / LONDON (IT BOLTWISE) – AMD übernimmt den KI-Chip-Startup Taalas, um Inferenz in der Praxis spürbar zu beschleunigen. Kernidee: Modellgewichte werden per Ätzverfahren direkt in das Silizium eingebracht, statt sie klassisch über Speicher wie HBM bereitzustellen. Das Unternehmen hat dafür bereits einen ersten Testchip auf TSMCs 6-nm-Prozess vorgestellt und mit Llama 3.1 8B sehr hohe Token-Raten gemeldet. Damit verfolgt AMD einen Ansatz, der besonders bei agentischen Anwendungen auf schnelle, günstige Antworten abzielt.

AMD kauft Taalas: Modellgewichte direkt in Silizium für schnellere KI-Inferenz
AMD kauft Taalas: Modellgewichte direkt in Silizium für schnellere KI-Inferenz (Foto: IT BOLTWISE)
🧠 KI & Robotik auf Google News abonnieren

AMD setzt zur nächsten Attacke auf den KI-Hardware-Markt nicht nur auf neue Beschleuniger, sondern auf eine grundlegend andere Speichervorstellung. Der Konzern hat den KI-Chip-Startup Taalas übernommen, der seine Inferenz-Engines darauf ausrichtet, Modellgewichte fest in der Hardware zu verankern. Während klassische GPUs die Gewichte in einem Speicherbereich (typischerweise VRAM, bei KI oft ergänzt durch HBM) halten und dann während der Inferenz kontinuierlich darauf zugreifen, verschiebt Taalas den Schwerpunkt: Die Gewichte werden in die Chipstruktur hineingeätzt, sodass der Datenpfad bei der Ausführung deutlich weniger Latenz und weniger „Hin und Her“ zwischen Rechenwerk und Speicher benötigt.

Für AMD kommt die Entscheidung zur richtigen Zeit, weil sich der Wettbewerb um „premium“-Inferenz zunehmend als Kosten- und Latenzspiel entpuppt. In der Quelle wird die Einordnung explizit in den Kontext ähnlicher Industriemoves gestellt, etwa einer großen Lizenzvereinbarung eines anderen Player-Ökosystems, die ebenfalls auf schnellere und günstigere Inferenzservices für KI-Agenten zielt. Entscheidend ist dabei weniger ein einzelner Benchwert, sondern das Versprechen, Token-Generierung in Produktivsystemen zu beschleunigen, etwa für Code-Assistants oder agentische Workflows, bei denen sich lange Prompt-Phasen und viele Folge-Tokens zu echten Kostenblöcken addieren.

Technisch beschreibt Taalas seinen Ansatz als „modell-spezifischen integrierten Schaltkreis“ (MSIC). Anstatt die Gewichte über HBM oder ähnliche Speicher an eine standardisierte Rechenarchitektur zu liefern, werden sie direkt in das Silizium integriert. Die Chiplogik besteht laut vorliegender Beschreibung aus zwei Hauptregionen: einer Mask-ROM-Recall-Fabric, in der die Modellgewichte geätzt sind, und einer SRAM-Recall-Fabric, die unter anderem KV-Caches sowie Fine-Tuning-Adapter aufnimmt. Genau diese Aufteilung ist in der Praxis relevant, weil sie zeigt, wo die Technologie ihre Stärke hat: In der Inferenz dominiert oft der schnelle, wiederholte Zugriff auf festes Modellmaterial, während KV-Caches und Adapter zwar dynamisch sind, aber konzeptionell andere Zugriffsmuster besitzen.

Die Umsetzung ist zudem nicht rein theoretisch. Im Februar hatte Taalas einen ersten Testchip veröffentlicht, gefertigt auf TSMCs 6-nm-Prozess, den das Startup HC1 nannte. Als Benchmark wird genannt, dass der Chip für Metas Llama 3.1 8B eine Leistung von 16.960 Tokens pro Sekunde erreicht haben soll. Die Zahl steht in einer klaren Relation zu damals üblichen Referenzen: In der Quelle heißt es, das sei 48-mal schneller als NVIDIAs GPUs und 8,5-mal schneller als Cerebras-Accelerators gewesen. Dabei muss man den Kontext mitdenken: Llama 3.1 gilt in der Meldung als „bereits älter“ und war vor allem ein Konzeptnachweis, nicht das Zielprodukt für modernste Modelle.

Für die zweite Generation plant Taalas den Sprung auf HC2 mit einem Ziel von 20 Milliarden Parametern. Auf den ersten Blick klingt das nach „nur“ einer Größenordnung, doch die Architektur verteilt Gewichte dann auf mehrere Beschleuniger, ähnlich wie bei größeren Modellen mit Pipeline-Parallelismus in GPU-lastigen Setups. Wenn ein einzelner Chip 20 Milliarden Parameter trägt, würden laut Quelle 50 solcher Beschleuniger ausreichen, um ein Modell mit einer Billion Parametern zu bedienen. Für AMD passt daran vor allem das Rack-Design: Der Konzern verfügt über eine skalierbare Compute-Plattform im Rack-Format und eine Systemdesign-Organisation, die solche Cluster- und Interconnect-Layouts auslegen kann, ohne dass die Lösung am Ende an Integrationskosten scheitert.

Im Systembild deutet AMD in der Quelle auf eine disaggregierte Architektur hin: AMD soll seine Instinct-basierten Helios-Racks mit Taalas-basierten Chips kombinieren, sodass promptlastige Verarbeitung auf GPUs passiert, während die Token-Generierung auf die Taalas-Accelerators ausgelagert wird. Auch ein „Tick-Tock“-Cadence-Ansatz wird als Möglichkeit erwähnt: Kunden könnten zunächst Instinct nutzen, um Modelle zu validieren, und später dann auf Taalas wechseln. Aus Sicht der Produktstrategie ist das wichtig, weil es den Umstieg in der Praxis steuerbar macht und nicht als „Alles oder Nichts“-Big-Bang verkauft werden muss. Dazu ergänzt die Quelle eine Aussage des AMD-SVP für KI, Vamsi Boppana: AMD baue eine Full-Stack-KI-Plattform, die Kunden die Flexibilität gebe, die passenden Compute-Lösungen für unterschiedliche KI-Workloads einzusetzen.

Die Kehrseite ist allerdings ebenso klar beschrieben: Wenn die Chips im Rechenzentrum einmal eingesetzt sind, sind sie stark modellgebunden. Änderungen, die über kleine Anpassungen wie LoRA hinausgehen, erfordern laut Bericht eine Neuauflage des Chips („re-spin“) – teuer und zeitintensiv. Genau hier wird der Markt normalerweise zäh: Neue Modelle kommen mittlerweile schnell nach, nahezu monatlich. Die Quelle relativiert das Gegenargument jedoch technisch: Eine erneute Herstellung muss nicht bei „Null“ beginnen, sondern soll sich auf das Ändern von zwei Metall-Lagen reduzieren lassen. Für die typische Wertschöpfung heißt das, dass dieses Hardwareprinzip eher zu Modell-Developern, Infrastrukturprovidern und einer begrenzten Zahl spezialisierter Inferenzanbieter passt, die Modell-Pipelines ohnehin kontrollieren und längerfristig planen können.

Auch für die KI-Entwicklung selbst könnte sich der Effekt indirekt auszahlen. Die Quelle nennt Test-Time Scaling als Ansatz, bei dem ein Modell länger „denkt“, bevor es antwortet. Das kann Halluzinationen reduzieren, erkauft sich aber oft Token-Kosten und längere Wartezeiten. Wenn Taalas die Kosten pro Token und die Output-Geschwindigkeit – wie in der Meldung als Zielbild angedeutet – deutlich verbessert, könnten Teams eher dazu übergehen, zusätzliche Rechenzeit in der Inferenz zu erlauben. Wann der Deal wirtschaftlich greift, ist ebenfalls genannt: Das Closing soll laut Bericht, vorbehaltlich regulatorischer Freigaben, im vierten Quartal erfolgen.


💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!


Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
152 Bewertungen
Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
  • ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
334 Bewertungen
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
  • IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
1.501 Bewertungen
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
  • 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
53 Bewertungen
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
  • 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
946 Bewertungen
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
  • V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.


Hat Ihnen der Artikel bzw. die News - AMD kauft Taalas: Modellgewichte direkt in Silizium für schnellere KI-Inferenz - gefallen? Dann abonnieren Sie uns doch auf Insta: AI News, Tech Trends & Robotics - Instagram - Boltwise

Unseren KI-Morning-Newsletter «Der KI News Espresso» mit den besten KI-News des letzten Tages gratis per eMail - ohne Werbung: Hier kostenlos eintragen!





Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!
Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.









Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "AMD kauft Taalas: Modellgewichte direkt in Silizium für schnellere KI-Inferenz".
Stichwörter Agenter AI AMD Artificial Intelligence Chip Hardware Inferenz KI Künstliche Intelligenz Kv-cache Model-weights Nvidia Pipeline-parallelism Server-rack Silizium Taalas Token TSMC
Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!

Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "AMD kauft Taalas: Modellgewichte direkt in Silizium für schnellere KI-Inferenz" für unsere Leser?

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

  • Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)


  • Es werden alle Kommentare moderiert!

    Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

    Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

    Du willst nichts verpassen?

    Du möchtest über ähnliche News und Beiträge wie "AMD kauft Taalas: Modellgewichte direkt in Silizium für schnellere KI-Inferenz" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
    Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »AMD kauft Taalas: Modellgewichte direkt in Silizium für schnellere KI-Inferenz« bei Google Deutschland suchen, bei Bing oder Google News!


    888 Leser gerade online auf IT BOLTWISE
    KI-Jobs