LONDON (IT BOLTWISE) – Das Mac Studio mit M5 Ultra zeigt, wie schnell lokal laufende KI-Agenten heute werden können. Im Test sinken Wartezeiten beim Prompt-Prefill deutlich, und beim Token-Output fühlt sich die Interaktion auch in langen, mehrstufigen Loops flüssiger an. Besonders die Kombination aus 256 GB Unified Memory, hoher Speicherbandbreite und der neuen MLX-basierten Ausführung macht Assistenten wie Open Minis und Hermes Agent alltagstauglich. Gleichzeitig bleibt NVIDIA mit einer RTX 5090 bei bestimmten Szenarien noch im Vorteil, vor allem durch Roh-Compute und Bandbreite der GPU.

Die zentrale Botschaft hinter dem M5 Ultra Mac Studio wirkt auf den ersten Blick wie ein Benchmarksatz, ist im Alltag aber eher eine Reaktionszeit-Geschichte: Wer KI-Agenten lokal nutzen will, scheitert nicht selten nicht am Modell selbst, sondern daran, dass sich Agent-Loops wie ein zäher Dialog anfühlen. Genau da setzt der Test an. In den letzten Tagen wurde das aktuelle Top-Modell mit 256 GB Unified Memory gegen ein M3 Ultra Mac Studio mit 512 GB sowie gegen einen Desktop mit einer RTX 5090 verglichen. Das Ergebnis ist weniger „überraschend schnell“ als vielmehr „schnell genug, um wirklich produktiv zu werden“ – vor allem, wenn Agenten nicht nur Antworten generieren, sondern Tools aufrufen, Subagenten koordinieren und dabei auf wachsende Kontexte zurückgreifen.
Technisch erklärt sich der Sprung vor allem durch zwei Zutaten: GPU-Performance und Speicherbandbreite. Laut der Beschreibung nutzt die neue Apple-Silizium-Generation eine UltraFusion-Verbindung, um zwei Dual-Die-Modelle zu einer Quad-Die-Architektur zu aggregieren. Für lokale KI-Workloads bleibt dennoch entscheidend, wie schnell ein Modell seinen Prompt „prefillt“ – also die komplette Eingabe in Rechenblöcke übersetzt – und wie stark die nächste Phase, das Token-by-Token-Generieren, durch Bandbreite limitiert wird. Beim M5 Ultra wird eine GPU mit 80 Kernen genannt; die integrierten Neural Accelerators sollen dabei bis zu 4,5× Peak-GPU-Compute für KI gegenüber dem M3 Ultra liefern. Zusätzlich steigt die Speicherbandbreite der Unified-Memory-Architektur von 819 GB/s auf 1,2 TB/s, also um rund 50 Prozent. Diese Kennzahlen sind keine reine Theorie: Im Test wird berichtet, dass Token-Generierung und vor allem Prompt-Verarbeitung deutlich schneller laufen, sodass Agenten weniger Zeit im Warten verbringen und längere Interaktionen ohne „Runterregeln“ durchhalten.
Damit wird aus „lokal ausprobieren“ eine konkrete Agenten-Nutzung. Der Tester setzt unter anderem auf Qwen3.8-Flash-Next als Modellbasis und nutzt sie so, dass lokale Assistenten über mehrere Runden hinweg zügig antworten. In der Praxis bedeutet das: Agenten starten schneller, bleiben in größeren Kontextfenstern performanter und können mehrstufige, multi-turn Abläufe verarbeiten, ohne dass die Bedienoberfläche gefühlt einfriert. Besonders relevant ist der Unterschied zwischen reiner Antwortzeit und Prompt-Prefill. Bei Agentic Assistants kommt der Modellkontext selten aus dem Nichts: Systemprompt, Nutzerpräferenzen, Sitzungs-Erinnerungen, Tool-/MCP-Definitionen und weitere Metadaten werden als Block übergeben. Der Test beschreibt, dass genau dieser Block den entscheidenden Engpass bildet, wenn lokale Modelle mit neueren Agent-Architekturen bislang immer noch „funktionierten, aber zu langsam wirkten“. In den Messungen soll die Prompt-Processing-Rate im Mittel um rund 150% gegenüber dem M3 Ultra steigen, was als etwa 2,5× Verbesserung eingeordnet wird.
Der konkrete Nutzen zeigt sich auch in einer Art Projekt-Workflow, der eher nach Recherche-Engine als nach „Chat mit dem Modell“ klingt. Im beschriebenen Setup wurde im Sommer ein internes App-ähnliches System namens „Desk“ genutzt, um hunderte Notizen, PDFs und geschnittene Webinhalte zu organisieren. Dort liefen über 99 Tage rund um die Uhr Agenten, die unter anderem Transkriptionen aus WWDC-Sessions aufbereiteten, Eigenschaften aus PDF- und Webquellen extrahierten, diese Merkmale zwischen Dokumenten gegeneinander abglichen und zudem über eine Notion-API mehrere Datenbanken konsistent hielten. Der entscheidende Punkt ist die Kosten-Logik: Das Setup soll auf lokale Ausführung umgestellt worden sein, nachdem „always-on“ Aufgaben über externe APIs als zu teuer erschienen. Das Resultat wird als lokal getriebene Recherche- und Verlinkungsarbeit dargestellt, die am Ende die veröffentlichte iOS/iPadOS-Review-Substanz mit vorbereitet – geschrieben wurde weiterhin durch die Person selbst, aber die Datenaufbereitung und Querverknüpfungen liefen automatisiert lokal. Für Unternehmen ist das weniger „für jedermann“ als Signal: Wenn Agenten dauerhaft im Hintergrund arbeiten, wird die Infrastrukturfrage schnell zu einer Produktivitätsfrage.
Wo die RTX 5090 weiterhin punktet, liegt dagegen in zwei physikalischen Eigenschaften. Erstens: Promptverarbeitung ist eine Rechenaufgabe, weil das Modell die komplette Eingabe in großen Matrixoperationen verarbeitet. Die Tensor-Cores der NVIDIA-GPU sind dafür stark ausgelegt, während die neuen Neural Accelerators zwar den Abstand verkleinern sollen, ihn aber nicht vollständig schließen. Im Test wird bei einem 6.000-Token-Prompt für die M5 Ultra ungefähr 1.700 tok/s genannt, während die RTX 5090 mit dem getesteten Qwen-Modell auf etwa 3.000 tok/s kam. Zweitens: Token-Generierung wird als Bandbreitenproblem beschrieben, weil das Modell für jedes neue Token wieder auf Modellgewichte und Aufmerksamkeitszustände zugreifen muss. Die RTX 5090 hat in dieser Darstellung mit 1,79 TB/s gegenüber 1,2 TB/s einen konstanten Vorteil, was in den Messergebnissen als grob ~25% Lead bei der Generierung durchscheint. Gleichzeitig kommt aber der Flaschenhals: Ohne ein einheitliches Memory-Pool-Design kann die RTX 5090 bei größeren Modellzuständen bei 32 GB VRAM nicht einfach „weiter“ skaliert werden, sondern muss bei Überschreitung Schichten über PCIe in System-RAM verschieben – ein Schritt, der in der Praxis die Geschwindigkeit stark senkt.
Unterm Strich verschiebt der Test die Prioritäten: Für Agenten ist nicht nur die maximale Geschwindigkeit pro Token entscheidend, sondern die spürbare Bedienqualität über viele Iterationen. Der Tester betont zudem Faktoren wie Lautstärke und thermisches Verhalten, die gerade bei langen Kontexten und wiederholten Tool Calls in einem echten Arbeitsalltag zählen. Das Mac Studio wird als deutlich leiser und kühler beschrieben, während der PC unter Last „warm“ und hörbar ist. Wer daraus eine Roadmap ableiten will, bekommt zwei Ansatzpunkte: In der MLX-Community wird es laut Beschreibung wahrscheinlich weitere Optimierungen bei Quantisierung geben, damit auch größere Modelle mit vertretbarem Speicherverbrauch lokal laufen. Und zweitens wird das Thema „Agentic Coding“ realistischer: Mit genügend Durchsatz soll es künftig eher möglich sein, lokale Modelle für Teilaufgaben übernehmen zu lassen und „frontier“ Modelle nur als Review-Schicht einzusetzen. Ob das in der Breite funktioniert, hängt am Ende weniger von Marketingzahlen ab als davon, wie gut Prefill, Bandbreite und Quantisierung zusammenspielen – und genau dort zeigt das M5 Ultra Mac Studio im Test messbar Wirkung.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Mac Studio mit M5 Ultra: Lokal laufende KI-Agenten werden deutlich schneller" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Mac Studio mit M5 Ultra: Lokal laufende KI-Agenten werden deutlich schneller" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Mac Studio mit M5 Ultra: Lokal laufende KI-Agenten werden deutlich schneller« bei Google Deutschland suchen, bei Bing oder Google News!