TORONTO / LONDON (IT BOLTWISE) – AMD übernimmt den KI-Chip-Startup Taalas, um Inferenz in der Praxis spürbar zu beschleunigen. Kernidee: Modellgewichte werden per Ätzverfahren direkt in das Silizium eingebracht, statt sie klassisch über Speicher wie HBM bereitzustellen. Das Unternehmen hat dafür bereits einen ersten Testchip auf TSMCs 6-nm-Prozess vorgestellt und mit Llama 3.1 8B sehr hohe Token-Raten gemeldet. Damit verfolgt AMD einen Ansatz, der besonders bei agentischen Anwendungen auf schnelle, günstige Antworten abzielt.

AMD setzt zur nächsten Attacke auf den KI-Hardware-Markt nicht nur auf neue Beschleuniger, sondern auf eine grundlegend andere Speichervorstellung. Der Konzern hat den KI-Chip-Startup Taalas übernommen, der seine Inferenz-Engines darauf ausrichtet, Modellgewichte fest in der Hardware zu verankern. Während klassische GPUs die Gewichte in einem Speicherbereich (typischerweise VRAM, bei KI oft ergänzt durch HBM) halten und dann während der Inferenz kontinuierlich darauf zugreifen, verschiebt Taalas den Schwerpunkt: Die Gewichte werden in die Chipstruktur hineingeätzt, sodass der Datenpfad bei der Ausführung deutlich weniger Latenz und weniger „Hin und Her“ zwischen Rechenwerk und Speicher benötigt.
Für AMD kommt die Entscheidung zur richtigen Zeit, weil sich der Wettbewerb um „premium“-Inferenz zunehmend als Kosten- und Latenzspiel entpuppt. In der Quelle wird die Einordnung explizit in den Kontext ähnlicher Industriemoves gestellt, etwa einer großen Lizenzvereinbarung eines anderen Player-Ökosystems, die ebenfalls auf schnellere und günstigere Inferenzservices für KI-Agenten zielt. Entscheidend ist dabei weniger ein einzelner Benchwert, sondern das Versprechen, Token-Generierung in Produktivsystemen zu beschleunigen, etwa für Code-Assistants oder agentische Workflows, bei denen sich lange Prompt-Phasen und viele Folge-Tokens zu echten Kostenblöcken addieren.
Technisch beschreibt Taalas seinen Ansatz als „modell-spezifischen integrierten Schaltkreis“ (MSIC). Anstatt die Gewichte über HBM oder ähnliche Speicher an eine standardisierte Rechenarchitektur zu liefern, werden sie direkt in das Silizium integriert. Die Chiplogik besteht laut vorliegender Beschreibung aus zwei Hauptregionen: einer Mask-ROM-Recall-Fabric, in der die Modellgewichte geätzt sind, und einer SRAM-Recall-Fabric, die unter anderem KV-Caches sowie Fine-Tuning-Adapter aufnimmt. Genau diese Aufteilung ist in der Praxis relevant, weil sie zeigt, wo die Technologie ihre Stärke hat: In der Inferenz dominiert oft der schnelle, wiederholte Zugriff auf festes Modellmaterial, während KV-Caches und Adapter zwar dynamisch sind, aber konzeptionell andere Zugriffsmuster besitzen.
Die Umsetzung ist zudem nicht rein theoretisch. Im Februar hatte Taalas einen ersten Testchip veröffentlicht, gefertigt auf TSMCs 6-nm-Prozess, den das Startup HC1 nannte. Als Benchmark wird genannt, dass der Chip für Metas Llama 3.1 8B eine Leistung von 16.960 Tokens pro Sekunde erreicht haben soll. Die Zahl steht in einer klaren Relation zu damals üblichen Referenzen: In der Quelle heißt es, das sei 48-mal schneller als NVIDIAs GPUs und 8,5-mal schneller als Cerebras-Accelerators gewesen. Dabei muss man den Kontext mitdenken: Llama 3.1 gilt in der Meldung als „bereits älter“ und war vor allem ein Konzeptnachweis, nicht das Zielprodukt für modernste Modelle.
Für die zweite Generation plant Taalas den Sprung auf HC2 mit einem Ziel von 20 Milliarden Parametern. Auf den ersten Blick klingt das nach „nur“ einer Größenordnung, doch die Architektur verteilt Gewichte dann auf mehrere Beschleuniger, ähnlich wie bei größeren Modellen mit Pipeline-Parallelismus in GPU-lastigen Setups. Wenn ein einzelner Chip 20 Milliarden Parameter trägt, würden laut Quelle 50 solcher Beschleuniger ausreichen, um ein Modell mit einer Billion Parametern zu bedienen. Für AMD passt daran vor allem das Rack-Design: Der Konzern verfügt über eine skalierbare Compute-Plattform im Rack-Format und eine Systemdesign-Organisation, die solche Cluster- und Interconnect-Layouts auslegen kann, ohne dass die Lösung am Ende an Integrationskosten scheitert.
Im Systembild deutet AMD in der Quelle auf eine disaggregierte Architektur hin: AMD soll seine Instinct-basierten Helios-Racks mit Taalas-basierten Chips kombinieren, sodass promptlastige Verarbeitung auf GPUs passiert, während die Token-Generierung auf die Taalas-Accelerators ausgelagert wird. Auch ein „Tick-Tock“-Cadence-Ansatz wird als Möglichkeit erwähnt: Kunden könnten zunächst Instinct nutzen, um Modelle zu validieren, und später dann auf Taalas wechseln. Aus Sicht der Produktstrategie ist das wichtig, weil es den Umstieg in der Praxis steuerbar macht und nicht als „Alles oder Nichts“-Big-Bang verkauft werden muss. Dazu ergänzt die Quelle eine Aussage des AMD-SVP für KI, Vamsi Boppana: AMD baue eine Full-Stack-KI-Plattform, die Kunden die Flexibilität gebe, die passenden Compute-Lösungen für unterschiedliche KI-Workloads einzusetzen.
Die Kehrseite ist allerdings ebenso klar beschrieben: Wenn die Chips im Rechenzentrum einmal eingesetzt sind, sind sie stark modellgebunden. Änderungen, die über kleine Anpassungen wie LoRA hinausgehen, erfordern laut Bericht eine Neuauflage des Chips („re-spin“) – teuer und zeitintensiv. Genau hier wird der Markt normalerweise zäh: Neue Modelle kommen mittlerweile schnell nach, nahezu monatlich. Die Quelle relativiert das Gegenargument jedoch technisch: Eine erneute Herstellung muss nicht bei „Null“ beginnen, sondern soll sich auf das Ändern von zwei Metall-Lagen reduzieren lassen. Für die typische Wertschöpfung heißt das, dass dieses Hardwareprinzip eher zu Modell-Developern, Infrastrukturprovidern und einer begrenzten Zahl spezialisierter Inferenzanbieter passt, die Modell-Pipelines ohnehin kontrollieren und längerfristig planen können.
Auch für die KI-Entwicklung selbst könnte sich der Effekt indirekt auszahlen. Die Quelle nennt Test-Time Scaling als Ansatz, bei dem ein Modell länger „denkt“, bevor es antwortet. Das kann Halluzinationen reduzieren, erkauft sich aber oft Token-Kosten und längere Wartezeiten. Wenn Taalas die Kosten pro Token und die Output-Geschwindigkeit – wie in der Meldung als Zielbild angedeutet – deutlich verbessert, könnten Teams eher dazu übergehen, zusätzliche Rechenzeit in der Inferenz zu erlauben. Wann der Deal wirtschaftlich greift, ist ebenfalls genannt: Das Closing soll laut Bericht, vorbehaltlich regulatorischer Freigaben, im vierten Quartal erfolgen.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "AMD kauft Taalas: Modellgewichte direkt in Silizium für schnellere KI-Inferenz" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "AMD kauft Taalas: Modellgewichte direkt in Silizium für schnellere KI-Inferenz" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »AMD kauft Taalas: Modellgewichte direkt in Silizium für schnellere KI-Inferenz« bei Google Deutschland suchen, bei Bing oder Google News!