LONDON (IT BOLTWISE) – AMD zeigt mit Ryzen AI Halo, wie sich sehr große KI-Modelle lokal auf zwei PCs im Verbund ausführen lassen. In einem Test wurden Modelle wie „Quen 3.5“ mit 397 Milliarden Parametern sowie „GLM 4.7“ mit 358 Milliarden Parametern berechnet. Die geclusterten Systeme sollen dabei bis zu 18 Tokens pro Sekunde erreicht haben. Damit rückt die lokale Inferenz in Reichweite von professionellen Use Cases, die bisher oft auf die Cloud angewiesen waren.

Die entscheidende Verschiebung bei Ryzen AI Halo liegt weniger in einem einzelnen „Superchip“, sondern in der Art, wie Rechenleistung und Speicher zu einem Verbund zusammengeführt werden. AMD adressiert damit ein Problem, das viele Teams aus der Praxis kennen: Selbst wenn ein einzelnes System große KI-Modelle grundsätzlich laden kann, scheitert es häufig an der benötigten Speicheradressierung oder an der erreichbaren Laufzeit. Genau hier setzt das Clustering an, bei dem zwei miteinander vernetzte PCs gemeinsam ein Modell ausführen sollen – als Schritt in Richtung lokaler Inferenz, bei der Daten nicht erst über eine Cloud-Pipeline wandern.
Im dokumentierten Leistungstest vom 12. August 2026 wurde Ryzen AI Halo demnach so betrieben, dass zwei Geräte zusammengeschaltet werden. Ziel war die lokale Berechnung von KI-Modellen mit sehr hohen Parameterzahlen: „Quen 3.5“ mit 397 Milliarden Parametern wurde vollständig lokal ausgeführt, daneben auch „GLM 4.7“ mit 358 Milliarden Parametern. Für den operativen Blick ist zudem die gemeldete Geschwindigkeit relevant: Die geclusterten Systeme erreichten dem Bericht zufolge Spitzenwerte von bis zu 18 Tokens pro Sekunde. Das ist als Indikator zu verstehen, dass die Hardware-Effizienz bei großen Modellen zunehmend in Bereiche kommt, in denen anspruchsvolle generative KI-Anwendungen im produktiven Umfeld überhaupt erst sinnvoll planbar werden.
Damit diese Art von Lastverteilung funktioniert, braucht es eine passende Speicher- und Systemarchitektur. Laut den Angaben basiert die Rechenleistung auf dem integrierten Speicher der Ryzen AI Halo-Geräte, wobei jede Einheit über 128 GB Shared Memory (Unified Memory) verfügen soll. Während ein einzelnes Gerät Modelle bis zu 200 Milliarden Parametern unterstützen könnte, ermöglicht das Zusammenschalten zweier Systeme die Adressierung von Modellen in der 400B-Klasse. Technisch bedeutet das in der Praxis meist: Koordination zwischen den Rechnern, abgestimmtes Laden und eine effiziente Datenbewegung, damit GPU- oder Beschleuniger-Engpässe nicht allein über Speicherzugriffe „wegfressen“.
Auch die Infrastrukturdetails zeigen, wie nah AMD an einem realistisch aufsetzbaren Labor-Setup bleibt. Die Vernetzung erfolgte über einen 10-GB-Ethernet-Switch, als Betriebssysteme kamen Linux-Umgebungen zum Einsatz. Für die Koordination der Rechenlast wurden in dem Aufbau bekannte Frameworks wie Llama CPP oder RCCL (Rickle) genutzt. Gerade Linux-basierte Setups sind in Teams verbreitet, die Modell-Pipelines, Training- oder Inferenzjobs und systemnahe Performance-Tuning betreiben; sie bieten zudem die Grundlage, um Frameworks, Treiber-Stacks und Netzwerkparameter reproduzierbar zu testen. Gleichzeitig bleibt die Frage für den Produktivbetrieb: Welche Latenzen und welche Skalierungsgrenzen sich bei größeren Nutzerlasten oder längeren Kontextfenstern ergeben, ist in solchen Demonstrationen oft nur begrenzt sichtbar.
Der Launch-Kontext ordnet die Halo-Demonstration in AMDs KI-Strategie ein. Die Präsentation folgt auf die Veranstaltung „Advancing AI 2026“, bei der AMD am 11. August 2026 offizielle Informationen zur Ryzen AI Halo-Serie angekündigt haben soll. Parallel dazu wird eine erweiterte Zusammenarbeit mit Hugging Face genannt, inklusive eines kostenlosen Jahres PRO-Zugangs für Nutzer der neuen Hardware, um die Integration lokaler Modelle zu erleichtern. Ergänzend kündigte AMD zudem für den weiteren Verlauf des Jahres 2026 die Ryzen AI Max PRO 400-Serie an, die mit 192 GB Speicher ausgestattet sein soll und als Einzelsystem Modelle mit 300 Milliarden Parametern unterstützen könne. Für Unternehmen ist das besonders deshalb interessant, weil es die Hardware-Auswahl vereinfacht: Wer nicht sofort ein Zwei-PC-Cluster aufbauen will, kann zunächst mit einem Single-Node-Ansatz starten und später skalieren.
Aus Markt- und Architektur-Sicht zeigt das Setup, wie stark sich lokale KI-Inferenz gerade entwickelt: Nicht nur Modellqualität zählt, sondern auch Betriebsfähigkeit unter engen Ressourcen, etwa beim Speicherbudget und bei der Datenübertragung. Ein Cluster aus zwei PCs kann vor allem dort sinnvoll sein, wo Datenschutzanforderungen, Latenzgrenzen oder regulatorische Vorgaben die Cloud-Nutzung erschweren oder verteuern. Für Entwicklergruppen bedeutet das zudem mehr Spielraum, weil sie Workflows für Modellverwaltung, Optimierung und Deployment näher an die eigene Infrastruktur ziehen können. Entscheidend wird allerdings, ob die gemeldeten Werte wie „bis zu 18 Tokens pro Sekunde“ unter wiederholbaren Lastprofilen stabil bleiben und wie gut sich der Ansatz in vorhandene Toolchains integrieren lässt.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "AMD Ryzen AI Halo: 400B-Modelle lokal per PC-Clustering" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "AMD Ryzen AI Halo: 400B-Modelle lokal per PC-Clustering" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »AMD Ryzen AI Halo: 400B-Modelle lokal per PC-Clustering« bei Google Deutschland suchen, bei Bing oder Google News!