PrismML schrumpft ein 54-GB-Modell auf unter 4 GB – Apple prüft lokale KI
SAN FRANCISCO / LONDON (IT BOLTWISE) – PrismML behauptet, ein 54-GB-KI-Modell um 93% auf unter 4 GB verkleinert zu haben und damit auf dem iPhone 15 und neueren Geräten lokal laufen zu lassen. Das könnte Apples Zielbild verändern: KI nicht mehr primär aus der Cloud, sondern schneller und datensparender direkt auf dem Endgerät. Der Caltech-Spinout […]
Bonsai 27B: 93% kleinere KI-Modelle laufen per WebGPU im Browser
LONDON (IT BOLTWISE) – Eine neue KI-Komprimierung macht groĂźe Sprachmodelle erstmals fĂĽr schwächere Hardware praktisch nutzbar: Bonsai 27B schrumpft per 1-Bit-Quantisierung um 93% und läuft direkt im Browser ĂĽber WebGPU. Das öffnet neue Einsatzfelder fĂĽr Unternehmen, die lokale AusfĂĽhrung und Datenschutz stärker gewichten. Gleichzeitig rĂĽckt die Sicherheitsseite in den Fokus, weil Windows-Updates und PC-Manager-Schwachstellen manuelles […]
Bonsai 27B: 27-Milliarden-Parameter-KI komprimiert auf iPhone-Größe
SAN FRANCISCO / LONDON (IT BOLTWISE) – PrismML bringt mit Bonsai 27B ein 27-Milliarden-Parameter-Modell an den Rand der Smartphone-Speicherlimits. Entscheidend ist eine aggressive, durchgängige Kompression auf 1 bis knapp 2 Bit pro Gewicht, die Reasoning- und Agentenfähigkeiten trotz kleinerer Bauformen erhalten soll. Laut Whitepaper erreicht die kleinere Variante auf einem iPhone 17 Pro Max rund […]
Apple-Aktie unter Druck: Hedgeye sieht 23% Abwärtspotenzial und KI-Übernahmepläne
SAN FRANCISCO / LONDON (IT BOLTWISE) – Hedgeye stuft die Apple-Aktie als neue Shortidee ein und beziffert das Abwärtspotenzial mit 23 Prozent. Gleichzeitig verdichten sich Berichte, wonach Apple mit dem KI-Startup PrismML ĂĽber eine mögliche Ăśbernahme verhandelt. Im Zentrum steht offenbar eine Technik, um sehr groĂźe Sprachmodelle stark zu komprimieren und damit schneller sowie ressourcenschonender […]
KI-Wende: OpenAI, Apple und Samsung treiben lokale Agenten voran
LONDON (IT BOLTWISE) – OpenAI, Apple und Samsung verschieben den KI-Schwerpunkt weg von zentralen Servern hin zu lokalem Rechnen und agentenfähigen Workflows. Neue Agenten- und Desktop-Integrationen sollen Aufgaben ĂĽber Stunden planen und dabei Unternehmensdaten näher an den Nutzer bringen. Apple testet offenbar stark komprimierte Modelle fĂĽrs Smartphone, während Samsung zentrale Knotenpunkte in Faltgeräten und Sicherheitsfunktionen […]
PrismML: Apple sucht Partner zur KI-Kompression fĂĽr iPhones
BERLIN / LONDON (IT BOLTWISE) – Apple prĂĽft offenbar die Zusammenarbeit mit PrismML, um extrem groĂźe KI-Modelle fĂĽr iPhones deutlich kleiner zu machen. Im Kern geht es darum, Server-LLMs näher an die Geräte zu bringen, ohne die Leistung spĂĽrbar zu verlieren. PrismML kann den Qwen-3.6-Ansatz zufolge von 54 GB auf 4 GB komprimieren. Das wäre […]
KI-Agenten lokal: Unternehmen setzen auf Mac mini und On-Device-Kapazität
LONDON (IT BOLTWISE) – Unternehmen verschieben KI-Agenten zunehmend in isolierte On-Device-Setups statt in die Cloud. Das senkt laufende Kosten, reduziert Datenschutz- und Sicherheitsrisiken und macht Betriebszeiten planbarer. Im Mittelpunkt steht dabei besonders die Mac-Plattform von Apple: Mac mini und Mac Studio werden als Entwicklungs- und AusfĂĽhrungsbasis fĂĽr agentische KI immer relevanter. Zugleich wächst der Wettbewerbsdruck […]
Blackwell-Optimierungen senken KI-Token-Kosten um bis zu 80 Prozent
LONDON (IT BOLTWISE) – Nvidia treibt Blackwell-Optimierungen so stark voran, dass sich KI-Token-Kosten bei Inferenz laut Branchenberichten innerhalb kurzer Zeit um bis zu 80 Prozent senken lassen. Im gleichen Kontext rĂĽcken weitere Blackwell-spezifische Techniken wie NVFP4, Multi-Token-Vorhersage und disaggregiertes Serving in den Mittelpunkt. Parallel bringt Microsoft ĂĽber Azure-Compute Anthropic-Modelle auf ein Nvidia-Blackwell-System, während Open-Source-Frameworks wie […]
Mac Studio: DeepSeek-284B läuft lokal dank Apple-Speicher und MLX-Optimierungen
SAN FRANCISCO / LONDON (IT BOLTWISE) – Ein Forschungsteam hat ein 284-Milliarden-Parameter-Modell von DeepSeek lokal auf einem Mac Studio mit 256 GB RAM zum Laufen gebracht. Entscheidend sind dabei Apples Speicherarchitektur, aggressives Offloading auf die SSD und Fortschritte im MLX-Backend. Gleichzeitig zeigt die Entwicklung bei Tools wie Ollama und dem neuen DSpark, wie stark sich […]
OpenAI senkt ChatGPT-Kosten per Software-Optimierung um ĂĽber 50 Prozent
SAN FRANCISCO / LONDON (IT BOLTWISE) – OpenAI behauptet, die Betriebskosten fĂĽr ChatGPT-Workloads binnen kurzer Zeit um mehr als 50% gesenkt zu haben – rein ĂĽber Software-Optimierungen ohne neue Hardware. Im Zentrum steht dabei vor allem die effizientere Verarbeitung des Gastzugangs: mehr Nutzer pro vorhandener Recheneinheit. Die Folge ist wirtschaftlich brisant, weil OpenAI gleichzeitig hohe […]
RTX Spark und lokale KI-Agenten: NVIDIA bringt Windows-Workstations ohne Cloud-abhängigkeit
TAIPEI / LONDON (IT BOLTWISE) – NVIDIA und Microsoft positionieren mit „RTX Spark“ eine neue Windows-PC-Klasse fĂĽr lokale KI-Agenten. Die Plattform kombiniert Blackwell-GPUs mit Grace-CPUs und groĂźen Unified-Memory-Setups, sodass Modelle ohne Datenversand in die Cloud laufen können. FĂĽr Unternehmen rĂĽckt damit zugleich der EU AI Act in den Fokus: Wer Agents ausfĂĽhrt, muss Pflichten, Fristen […]
NVIDIA NVFP4 beschleunigt KI-Training auf Blackwell bis zu 1,73-mal
LONDON (IT BOLTWISE) – NVIDIA bringt mit NVFP4 eine 4-Bit-Quantisierungstechnologie auf Blackwell-Systeme, die KI-Training laut Hersteller bis zu 1,73-mal beschleunigt und dabei die Modellgenauigkeit erhalten soll. Parallel startet die Vera-Rubin-Plattform in die Serienproduktion und zielt auf „agentische“ KI-Workloads. Ergänzt wird das Paket durch neue Nemotron-Modelle, lokale DGX-Hardware fĂĽr Entwickler und groĂźformatige „AI Factory“-Projekte in Asien. […]
Gemma 4 12B: Googles Open-Source-KI fĂĽr lokale Troubleshooting-Hilfe und neue Gemini-Integrationen
SAN FRANCISCO / LONDON (IT BOLTWISE) – Google bringt mit Gemma 4 12B ein Open-Source-KI-Modell an die Entwicklerfront, das ohne Cloud-Umweg lokal auf Geräten laufen soll. Gleichzeitig taucht in Gemini ein Troubleshooting-Modus auf, der technische Probleme Schritt fĂĽr Schritt anleiten will. Im Ă–kosystem werden zudem Gmail-Dialoge in „Ask Gemini“ und eine vereinfachte Gemini Go-Variante fĂĽr […]
Gemma 4 QAT-Checkpoints: Quantization-Aware Training für lokale KI auf mobilen Geräten
LONDON (IT BOLTWISE) – Google bringt neue Gemma-4-Checkpoints, die mit Quantization-Aware Training die Modellkompression verbessern. Damit sollen sich die KI-Modelle deutlich effizienter lokal auf gängigen Edge-Geräten und Consumer-GPUs betreiben lassen, ohne die Qualität spĂĽrbar zu verlieren. Besonders hervorzuheben ist ein mobilspezialisierter Quantisierungs-Ansatz, der das Speichervolumen der Gemma-4-E2B-Variante auf etwa 1 GB reduziert. FĂĽr Entwickler bedeutet […]
Google veröffentlicht AI Edge Gallery für macOS: Gemini lokal ohne Cloud
SAN FRANCISCO / LONDON (IT BOLTWISE) – Google macht lokale KĂĽnstliche Intelligenz auf dem Mac deutlich einfacher: Mit der AI Edge Gallery fĂĽr macOS können Nutzer Gemini und Gemma ab dem 4. Juni 2026 direkt auf ihrer Hardware ausfĂĽhren. Damit entfällt fĂĽr viele Use-Cases das Senden von Daten in die Cloud. Parallel startet Google Tools […]
NVIDIA bringt GLM-5.1-NVFP4: 754B-Modell mit 4-Bit-Quantisierung und MoE
TAIPEH / BASEL / LONDON (IT BOLTWISE) – NVIDIA stellt mit GLM-5.1-NVFP4 ein extrem groĂźes, quantisiertes KI-Modell vor, das durch Vier-Bit-Formate und eine MoE-Strategie deutlich weniger Rechenaufwand benötigt. Das 754-Milliarden-Modell aktiviert pro Schritt nur einen Bruchteil seiner Parameter und zielt damit auf schnellere Inferenz und niedrigere Kosten. Gleichzeitig zeigen parallele Forschungsarbeiten zur Sparsity-Steuerung und NVFP4-ähnlichen […]
BitNet zeigt: Llama 2 läuft auf einem Pentium II mit 128 MB RAM
LONDON (IT BOLTWISE) – Ein Team von EXO Labs hat demonstriert, dass ein abgespecktes Llama-2-Modell auf einem Pentium-II-Rechner aus den 1990er-Jahren mit nur 128 MB RAM lauffähig ist. Entscheidend ist BitNet: Statt hochpräziser Gewichte nutzt das Verfahren ternäre Werte (-1, 0, 1), um Speicher- und Rechenaufwand drastisch zu senken. Die VorfĂĽhrung kommt genau zu einem […]
KI-Workstations: Apples M4 Max vs. AMD Ryzen AI Halo und der Sicherheits-Realitätscheck
TAIPEH / LONDON (IT BOLTWISE) – Während sich die KI-Workloads vom Server ins lokale Setup verlagern, liefern sich Apple und AMD ein Wettrennen um die schnellste „AI-first“-Hardware. Der SchlĂĽssel ist dabei weniger die reine Rechenleistung als die Speicherarchitektur, insbesondere Unified Memory und groĂźe, schnelle RAM-Budgets. Gleichzeitig rĂĽckt die Sicherheitsseite in den Fokus: Neue CPU-Angriffe, wieder […]
AMD macht FSR 4.1 zur Gratis-Option: KI-Upscaling kommt auf Radeon RX 7000 und RX 6000
BERLIN / LONDON (IT BOLTWISE) – AMD rollt sein KI-Upscaling FSR 4.1 kostenfrei per Treiber fĂĽr Radeon RX 7000 und RX 6000 aus. Damit erhalten Millionen Nutzerinnen und Nutzer nicht nur eine neue Version, sondern laut AMD einen spĂĽrbaren Sprung in der Rekonstruktion von Details. Besonders interessant ist das Zusammenspiel aus ML-basiertem Upsampling und der […]
Kritische Sicherheitslücke in Ollama ermöglicht Datenlecks
LONDON (IT BOLTWISE) – Eine schwerwiegende SicherheitslĂĽcke in der Open-Source-Plattform Ollama ermöglicht es Angreifern, sensible Daten von Servern zu extrahieren. Diese Schwachstelle, die noch nicht gepatcht wurde, betrifft die Upload-Schnittstelle fĂĽr Modelle und könnte zu erheblichen Sicherheitsrisiken fĂĽhren. Eine kritische SicherheitslĂĽcke in der weit verbreiteten Open-Source-Plattform Ollama wurde entdeckt, die es Angreifern ermöglicht, sensible Daten […]
Turboquant: Effiziente KI-Kompression ohne Speicherkrise
LONDON (IT BOLTWISE) – Googles neuer Kompressionsalgorithmus Turboquant verspricht eine drastische Reduzierung des Speicherbedarfs von KI-Modellen. Durch innovative Quantisierungstechniken können Unternehmen mehr Sitzungen bedienen und die Kontextlänge erhöhen, ohne LeistungseinbuĂźen zu erleiden. Doch die Frage bleibt, ob der höhere Rechenaufwand die Vorteile ĂĽberwiegt. In der Welt der KĂĽnstlichen Intelligenz sind Speicheranforderungen ein ständiges Thema. Während […]
Google optimiert KI-Modelle mit TurboQuant
LONDON (IT BOLTWISE) – Google hat mit TurboQuant einen neuen Algorithmus vorgestellt, der die Effizienz von KI-Modellen erheblich steigert. Diese Technologie reduziert den Speicherbedarf von groĂźen Sprachmodellen um das Sechsfache, ohne die Qualität der Ergebnisse zu beeinträchtigen. Google hat kĂĽrzlich TurboQuant vorgestellt, einen Algorithmus, der die Effizienz von KI-Modellen erheblich steigert. Diese neue Technologie zielt […]
TurboQuant: Effiziente KI durch extreme Kompression
LONDON (IT BOLTWISE) – TurboQuant, ein neuer Algorithmus zur Kompression von Vektoren, verspricht erhebliche Verbesserungen in der Effizienz von KI-Systemen. Durch die Reduzierung des Speicherbedarfs von hochdimensionalen Vektoren können Engpässe in der SchlĂĽssel-Wert-Speicherung vermieden werden, was zu schnelleren Suchvorgängen und geringeren Kosten fĂĽhrt. Die Bedeutung von Vektoren in der KĂĽnstlichen Intelligenz kann nicht hoch genug […]
KĂĽnstliche Intelligenz auf Mikrocontrollern: Revolution in der Edge-KI
GRAZ / LONDON (IT BOLTWISE) – Die jĂĽngsten Fortschritte in der KĂĽnstlichen Intelligenz ermöglichen es, selbst kleinste IoT-Geräte mit leistungsfähigen KI-Modellen auszustatten. Forscher aus Ă–sterreich und der Schweiz haben gezeigt, dass KI-Modelle auf Mikrocontrollern mit nur 4 Kilobyte Speicher effizient arbeiten können. Die Integration von KĂĽnstlicher Intelligenz in IoT-Geräte stellt eine bedeutende Herausforderung dar, insbesondere […]

























#Sophos