ai-prismml-ki-modell-komprimiert-apple-on-device

PrismML schrumpft ein 54-GB-Modell auf unter 4 GB – Apple prüft lokale KI

SAN FRANCISCO / LONDON (IT BOLTWISE) – PrismML behauptet, ein 54-GB-KI-Modell um 93% auf unter 4 GB verkleinert zu haben und damit auf dem iPhone 15 und neueren Geräten lokal laufen zu lassen. Das könnte Apples Zielbild verändern: KI nicht mehr primär aus der Cloud, sondern schneller und datensparender direkt auf dem Endgerät. Der Caltech-Spinout […]

ai-bonsai-27b-webgpu-browser

Bonsai 27B: 93% kleinere KI-Modelle laufen per WebGPU im Browser

LONDON (IT BOLTWISE) – Eine neue KI-Komprimierung macht groĂźe Sprachmodelle erstmals fĂĽr schwächere Hardware praktisch nutzbar: Bonsai 27B schrumpft per 1-Bit-Quantisierung um 93% und läuft direkt im Browser ĂĽber WebGPU. Das öffnet neue Einsatzfelder fĂĽr Unternehmen, die lokale AusfĂĽhrung und Datenschutz stärker gewichten. Gleichzeitig rĂĽckt die Sicherheitsseite in den Fokus, weil Windows-Updates und PC-Manager-Schwachstellen manuelles […]

ai-bonsai-27b-ondevice-quantization

Bonsai 27B: 27-Milliarden-Parameter-KI komprimiert auf iPhone-Größe

SAN FRANCISCO / LONDON (IT BOLTWISE) – PrismML bringt mit Bonsai 27B ein 27-Milliarden-Parameter-Modell an den Rand der Smartphone-Speicherlimits. Entscheidend ist eine aggressive, durchgängige Kompression auf 1 bis knapp 2 Bit pro Gewicht, die Reasoning- und Agentenfähigkeiten trotz kleinerer Bauformen erhalten soll. Laut Whitepaper erreicht die kleinere Variante auf einem iPhone 17 Pro Max rund […]

ai-apple-hedgeye-prismml-on-device-ki

Apple-Aktie unter Druck: Hedgeye sieht 23% Abwärtspotenzial und KI-Übernahmepläne

SAN FRANCISCO / LONDON (IT BOLTWISE) – Hedgeye stuft die Apple-Aktie als neue Shortidee ein und beziffert das Abwärtspotenzial mit 23 Prozent. Gleichzeitig verdichten sich Berichte, wonach Apple mit dem KI-Startup PrismML ĂĽber eine mögliche Ăśbernahme verhandelt. Im Zentrum steht offenbar eine Technik, um sehr groĂźe Sprachmodelle stark zu komprimieren und damit schneller sowie ressourcenschonender […]

ai-local-processing-smartphone-agent

KI-Wende: OpenAI, Apple und Samsung treiben lokale Agenten voran

LONDON (IT BOLTWISE) – OpenAI, Apple und Samsung verschieben den KI-Schwerpunkt weg von zentralen Servern hin zu lokalem Rechnen und agentenfähigen Workflows. Neue Agenten- und Desktop-Integrationen sollen Aufgaben ĂĽber Stunden planen und dabei Unternehmensdaten näher an den Nutzer bringen. Apple testet offenbar stark komprimierte Modelle fĂĽrs Smartphone, während Samsung zentrale Knotenpunkte in Faltgeräten und Sicherheitsfunktionen […]

ai-prismml-apple-llm-kompression-iphone

PrismML: Apple sucht Partner zur KI-Kompression fĂĽr iPhones

BERLIN / LONDON (IT BOLTWISE) – Apple prĂĽft offenbar die Zusammenarbeit mit PrismML, um extrem groĂźe KI-Modelle fĂĽr iPhones deutlich kleiner zu machen. Im Kern geht es darum, Server-LLMs näher an die Geräte zu bringen, ohne die Leistung spĂĽrbar zu verlieren. PrismML kann den Qwen-3.6-Ansatz zufolge von 54 GB auf 4 GB komprimieren. Das wäre […]

ai-local-ki-agenten-mac-mini

KI-Agenten lokal: Unternehmen setzen auf Mac mini und On-Device-Kapazität

LONDON (IT BOLTWISE) – Unternehmen verschieben KI-Agenten zunehmend in isolierte On-Device-Setups statt in die Cloud. Das senkt laufende Kosten, reduziert Datenschutz- und Sicherheitsrisiken und macht Betriebszeiten planbarer. Im Mittelpunkt steht dabei besonders die Mac-Plattform von Apple: Mac mini und Mac Studio werden als Entwicklungs- und AusfĂĽhrungsbasis fĂĽr agentische KI immer relevanter. Zugleich wächst der Wettbewerbsdruck […]

ai-blackwell-token-kosten-80-prozent

Blackwell-Optimierungen senken KI-Token-Kosten um bis zu 80 Prozent

LONDON (IT BOLTWISE) – Nvidia treibt Blackwell-Optimierungen so stark voran, dass sich KI-Token-Kosten bei Inferenz laut Branchenberichten innerhalb kurzer Zeit um bis zu 80 Prozent senken lassen. Im gleichen Kontext rĂĽcken weitere Blackwell-spezifische Techniken wie NVFP4, Multi-Token-Vorhersage und disaggregiertes Serving in den Mittelpunkt. Parallel bringt Microsoft ĂĽber Azure-Compute Anthropic-Modelle auf ein Nvidia-Blackwell-System, während Open-Source-Frameworks wie […]

ai-macstudio-deepseek-284b-mlx-local-inference

Mac Studio: DeepSeek-284B läuft lokal dank Apple-Speicher und MLX-Optimierungen

SAN FRANCISCO / LONDON (IT BOLTWISE) – Ein Forschungsteam hat ein 284-Milliarden-Parameter-Modell von DeepSeek lokal auf einem Mac Studio mit 256 GB RAM zum Laufen gebracht. Entscheidend sind dabei Apples Speicherarchitektur, aggressives Offloading auf die SSD und Fortschritte im MLX-Backend. Gleichzeitig zeigt die Entwicklung bei Tools wie Ollama und dem neuen DSpark, wie stark sich […]

ai-openai-cost-reduction-chatgpt

OpenAI senkt ChatGPT-Kosten per Software-Optimierung um ĂĽber 50 Prozent

SAN FRANCISCO / LONDON (IT BOLTWISE) – OpenAI behauptet, die Betriebskosten fĂĽr ChatGPT-Workloads binnen kurzer Zeit um mehr als 50% gesenkt zu haben – rein ĂĽber Software-Optimierungen ohne neue Hardware. Im Zentrum steht dabei vor allem die effizientere Verarbeitung des Gastzugangs: mehr Nutzer pro vorhandener Recheneinheit. Die Folge ist wirtschaftlich brisant, weil OpenAI gleichzeitig hohe […]

ai-rtx-spark-lokale-ki-windows

RTX Spark und lokale KI-Agenten: NVIDIA bringt Windows-Workstations ohne Cloud-abhängigkeit

TAIPEI / LONDON (IT BOLTWISE) – NVIDIA und Microsoft positionieren mit „RTX Spark“ eine neue Windows-PC-Klasse fĂĽr lokale KI-Agenten. Die Plattform kombiniert Blackwell-GPUs mit Grace-CPUs und groĂźen Unified-Memory-Setups, sodass Modelle ohne Datenversand in die Cloud laufen können. FĂĽr Unternehmen rĂĽckt damit zugleich der EU AI Act in den Fokus: Wer Agents ausfĂĽhrt, muss Pflichten, Fristen […]

ai-nvfp4-blackwell-quantization-training

NVIDIA NVFP4 beschleunigt KI-Training auf Blackwell bis zu 1,73-mal

LONDON (IT BOLTWISE) – NVIDIA bringt mit NVFP4 eine 4-Bit-Quantisierungstechnologie auf Blackwell-Systeme, die KI-Training laut Hersteller bis zu 1,73-mal beschleunigt und dabei die Modellgenauigkeit erhalten soll. Parallel startet die Vera-Rubin-Plattform in die Serienproduktion und zielt auf „agentische“ KI-Workloads. Ergänzt wird das Paket durch neue Nemotron-Modelle, lokale DGX-Hardware fĂĽr Entwickler und groĂźformatige „AI Factory“-Projekte in Asien. […]

ai-gemma4-troubleshooting-gemini-local

Gemma 4 12B: Googles Open-Source-KI fĂĽr lokale Troubleshooting-Hilfe und neue Gemini-Integrationen

SAN FRANCISCO / LONDON (IT BOLTWISE) – Google bringt mit Gemma 4 12B ein Open-Source-KI-Modell an die Entwicklerfront, das ohne Cloud-Umweg lokal auf Geräten laufen soll. Gleichzeitig taucht in Gemini ein Troubleshooting-Modus auf, der technische Probleme Schritt fĂĽr Schritt anleiten will. Im Ă–kosystem werden zudem Gmail-Dialoge in „Ask Gemini“ und eine vereinfachte Gemini Go-Variante fĂĽr […]

ai-gemma4-qat-mobile-quantization

Gemma 4 QAT-Checkpoints: Quantization-Aware Training für lokale KI auf mobilen Geräten

LONDON (IT BOLTWISE) – Google bringt neue Gemma-4-Checkpoints, die mit Quantization-Aware Training die Modellkompression verbessern. Damit sollen sich die KI-Modelle deutlich effizienter lokal auf gängigen Edge-Geräten und Consumer-GPUs betreiben lassen, ohne die Qualität spĂĽrbar zu verlieren. Besonders hervorzuheben ist ein mobilspezialisierter Quantisierungs-Ansatz, der das Speichervolumen der Gemma-4-E2B-Variante auf etwa 1 GB reduziert. FĂĽr Entwickler bedeutet […]

ai-edge-macos-gemini-local

Google veröffentlicht AI Edge Gallery für macOS: Gemini lokal ohne Cloud

SAN FRANCISCO / LONDON (IT BOLTWISE) – Google macht lokale KĂĽnstliche Intelligenz auf dem Mac deutlich einfacher: Mit der AI Edge Gallery fĂĽr macOS können Nutzer Gemini und Gemma ab dem 4. Juni 2026 direkt auf ihrer Hardware ausfĂĽhren. Damit entfällt fĂĽr viele Use-Cases das Senden von Daten in die Cloud. Parallel startet Google Tools […]

ai-glm-5-1-nvfp4-moe-quantization

NVIDIA bringt GLM-5.1-NVFP4: 754B-Modell mit 4-Bit-Quantisierung und MoE

TAIPEH / BASEL / LONDON (IT BOLTWISE) – NVIDIA stellt mit GLM-5.1-NVFP4 ein extrem groĂźes, quantisiertes KI-Modell vor, das durch Vier-Bit-Formate und eine MoE-Strategie deutlich weniger Rechenaufwand benötigt. Das 754-Milliarden-Modell aktiviert pro Schritt nur einen Bruchteil seiner Parameter und zielt damit auf schnellere Inferenz und niedrigere Kosten. Gleichzeitig zeigen parallele Forschungsarbeiten zur Sparsity-Steuerung und NVFP4-ähnlichen […]

ai-bitnet-llama-pentium-128mb

BitNet zeigt: Llama 2 läuft auf einem Pentium II mit 128 MB RAM

LONDON (IT BOLTWISE) – Ein Team von EXO Labs hat demonstriert, dass ein abgespecktes Llama-2-Modell auf einem Pentium-II-Rechner aus den 1990er-Jahren mit nur 128 MB RAM lauffähig ist. Entscheidend ist BitNet: Statt hochpräziser Gewichte nutzt das Verfahren ternäre Werte (-1, 0, 1), um Speicher- und Rechenaufwand drastisch zu senken. Die VorfĂĽhrung kommt genau zu einem […]

ai-apple-amd-local-ki-workstation-duel

KI-Workstations: Apples M4 Max vs. AMD Ryzen AI Halo und der Sicherheits-Realitätscheck

TAIPEH / LONDON (IT BOLTWISE) – Während sich die KI-Workloads vom Server ins lokale Setup verlagern, liefern sich Apple und AMD ein Wettrennen um die schnellste „AI-first“-Hardware. Der SchlĂĽssel ist dabei weniger die reine Rechenleistung als die Speicherarchitektur, insbesondere Unified Memory und groĂźe, schnelle RAM-Budgets. Gleichzeitig rĂĽckt die Sicherheitsseite in den Fokus: Neue CPU-Angriffe, wieder […]

amd-fsr-4-1-kostenlos-radeon-rx-7000-rx-6000

AMD macht FSR 4.1 zur Gratis-Option: KI-Upscaling kommt auf Radeon RX 7000 und RX 6000

BERLIN / LONDON (IT BOLTWISE) – AMD rollt sein KI-Upscaling FSR 4.1 kostenfrei per Treiber fĂĽr Radeon RX 7000 und RX 6000 aus. Damit erhalten Millionen Nutzerinnen und Nutzer nicht nur eine neue Version, sondern laut AMD einen spĂĽrbaren Sprung in der Rekonstruktion von Details. Besonders interessant ist das Zusammenspiel aus ML-basiertem Upsampling und der […]

ai-ollama-security-breach

Kritische Sicherheitslücke in Ollama ermöglicht Datenlecks

LONDON (IT BOLTWISE) – Eine schwerwiegende SicherheitslĂĽcke in der Open-Source-Plattform Ollama ermöglicht es Angreifern, sensible Daten von Servern zu extrahieren. Diese Schwachstelle, die noch nicht gepatcht wurde, betrifft die Upload-Schnittstelle fĂĽr Modelle und könnte zu erheblichen Sicherheitsrisiken fĂĽhren. Eine kritische SicherheitslĂĽcke in der weit verbreiteten Open-Source-Plattform Ollama wurde entdeckt, die es Angreifern ermöglicht, sensible Daten […]

ai-turboquant-compression

Turboquant: Effiziente KI-Kompression ohne Speicherkrise

LONDON (IT BOLTWISE) – Googles neuer Kompressionsalgorithmus Turboquant verspricht eine drastische Reduzierung des Speicherbedarfs von KI-Modellen. Durch innovative Quantisierungstechniken können Unternehmen mehr Sitzungen bedienen und die Kontextlänge erhöhen, ohne LeistungseinbuĂźen zu erleiden. Doch die Frage bleibt, ob der höhere Rechenaufwand die Vorteile ĂĽberwiegt. In der Welt der KĂĽnstlichen Intelligenz sind Speicheranforderungen ein ständiges Thema. Während […]

ai-turboquant-compression

Google optimiert KI-Modelle mit TurboQuant

LONDON (IT BOLTWISE) – Google hat mit TurboQuant einen neuen Algorithmus vorgestellt, der die Effizienz von KI-Modellen erheblich steigert. Diese Technologie reduziert den Speicherbedarf von groĂźen Sprachmodellen um das Sechsfache, ohne die Qualität der Ergebnisse zu beeinträchtigen. Google hat kĂĽrzlich TurboQuant vorgestellt, einen Algorithmus, der die Effizienz von KI-Modellen erheblich steigert. Diese neue Technologie zielt […]

turboquant-ki-effizienz-kompression

TurboQuant: Effiziente KI durch extreme Kompression

LONDON (IT BOLTWISE) – TurboQuant, ein neuer Algorithmus zur Kompression von Vektoren, verspricht erhebliche Verbesserungen in der Effizienz von KI-Systemen. Durch die Reduzierung des Speicherbedarfs von hochdimensionalen Vektoren können Engpässe in der SchlĂĽssel-Wert-Speicherung vermieden werden, was zu schnelleren Suchvorgängen und geringeren Kosten fĂĽhrt. Die Bedeutung von Vektoren in der KĂĽnstlichen Intelligenz kann nicht hoch genug […]

ai-microcontroller-edge-computing

KĂĽnstliche Intelligenz auf Mikrocontrollern: Revolution in der Edge-KI

GRAZ / LONDON (IT BOLTWISE) – Die jĂĽngsten Fortschritte in der KĂĽnstlichen Intelligenz ermöglichen es, selbst kleinste IoT-Geräte mit leistungsfähigen KI-Modellen auszustatten. Forscher aus Ă–sterreich und der Schweiz haben gezeigt, dass KI-Modelle auf Mikrocontrollern mit nur 4 Kilobyte Speicher effizient arbeiten können. Die Integration von KĂĽnstlicher Intelligenz in IoT-Geräte stellt eine bedeutende Herausforderung dar, insbesondere […]

5.469 Leser gerade online auf IT BOLTWISE


KI-Jobs