LONDON (IT BOLTWISE) – NVIDIA setzt mit Nemotron 3.5 Lightning auf deutlich schnellere, hochskalierbare KI für lang laufende agentische Workloads. Ergänzend liefert NeMo Switchyard eine quelloffene Routing-Bibliothek, die Anfragen automatisch an das jeweils passende Modell weiterleitet. Unternehmen bekommen damit mehr Kontrolle, wo KI ausgeführt wird und wie effizient sie arbeitet, ohne ihre Anwendungen neu bauen zu müssen. Für Entwickler bedeutet das vor allem weniger Integrationsaufwand bei gleichzeitiger Optimierung von Kosten, Latenz und Qualität.

Agentische KI verschiebt sich aktuell von der reinen Chat-Oberfläche hin zu Systemen, die Aufgaben über längere Zeit selbstständig koordinieren. Genau dafür beschreibt NVIDIA seine „Nemotron“-Modellfamilie als Bausteine für Ensembles: Ein Modell plant den Ablauf, Spezialmodelle übernehmen Teilaufgaben wie Tool-Nutzung, Code-Checks oder die Überwachung von Sicherheitsalarmen. Der neue Schwerpunkt liegt dabei nicht nur auf Modellleistung, sondern auch auf der Frage, wie gut sich diese Bausteine in laufende Produktivumgebungen integrieren lassen.
Im Zentrum steht Nemotron 3.5 Lightning, ein 30-Milliarden-Parameter-Modell mit Mixture-of-Experts-Ansatz (MoE), das NVIDIA als besonders effiziente Variante für „high-volume“ und „always-on“ Agenten positioniert. Laut Hersteller gehört es damit zur Spitze der Effizienz in der jeweiligen Modellklasse für lang laufende Workloads. Für den operativen Betrieb nennt NVIDIA Kennzahlen: Bis zu 4x schnellere Output-Generierung sowie rund 30% schnellere Abschlusszeiten agentischer Aufgaben gegenüber anderen Modellen in dieser Klasse. Entscheidend ist außerdem die Anpassbarkeit: Weil das Modell als Open-Variante ausgelegt ist, kann es mit NeMo post-trainiert werden – konkret mit organisationsspezifischen Domänendaten, Tools und Workflows, um die Genauigkeit für spezialisierte Aufgaben zu erhöhen.
Nicht zuletzt erweitert NVIDIA damit auch den „Deployment“-Spielraum. Nemotron 3.5 Lightning lässt sich lokal ausführen – etwa auf NVIDIA RTX-PCs, NVIDIA DGX Spark, NVIDIA DGX Station und NVIDIA Jetson – und soll so bestehende Infrastruktur nutzen helfen. Für Skalierung und Datenschutzanforderungen wird zudem ein Betrieb vor Ort („on premises“) und über Edge- und Enterprise-Umgebungen hinweg adressiert: von RTX PRO Workstations über Rechenzentren bis in Cloud-Setups. Damit rückt ein praktisches Muster in den Vordergrund, das bei agentischer KI häufig unterschätzt wird: Der Unterschied zwischen einem funktionierenden Prototyp und einem stabilen System liegt oft darin, wie gut sich Latenz, Kosten und Ressourcenverbrauch im jeweiligen Zielsystem optimieren lassen.
Im Ökosystem spielt dabei auch die Community-Beteiligung eine Rolle. NVIDIA verweist auf Beiträge aus der Nemotron Coalition, deren Mitglieder laut Beschreibung Evaluationsmethoden, Inferenz-Software und Datasets bereitstellten, um die Entwicklung zu unterstützen. Parallel dazu veröffentlicht NVIDIA „so viel“ Trainingsdaten und -techniken wie die Lizenzierung erlaubt, um Traceability und Auditing zu ermöglichen; ergänzt wird das Ganze durch einen agentic Reinforcement-Learning-Ansatz, den NVIDIA als Nemotron-RL-Agentic-Terminal-Pivot für das Post-Training nennt. Für Unternehmen ist das vor allem dann relevant, wenn sie nachweisen müssen, wie ein Modell für bestimmte Kodierungs- oder Agentenfähigkeiten weiterentwickelt wurde – ohne dass sich die Teams komplett an neue Toolchains binden.
Während Lightning die Effizienz einzelner Spezialbausteine adressiert, zielt NeMo Switchyard auf das Problem der Modellauswahl im laufenden Agentenprozess. In vielen Workflows sind nicht alle Schritte gleich: Manche Aufgaben profitieren von einem stärkerem Reasoning-Modell, andere laufen besser mit leichteren, schnelleren Modellen oder benötigen lokale Ausführung. Wenn Kunden heute auf ein „Default-Modell“ setzen, drohen Überkosten oder Qualitätsverluste. Verlegen sie das Routing dagegen manuell in die Applikation, wird Integration selbst zur Projektaufgabe. NeMo Switchyard löst das als quelloffene Routing-Bibliothek: Sie leitet Prompts automatisiert an das jeweils passende Modell weiter, basierend auf den Anforderungen pro Schritt. Entwickler können den Router zudem über Routing-Algorithmen anpassen, etwa für Prioritäten wie Qualität, Latenz oder Kosten.
Für die Wirtschaftlichkeit nennt NVIDIA interne Benchmarks, darunter eine Aussage zur Kostenreduktion: NeMo Switchyard soll die Task-Completion-Kosten auf „nahezu ein Drittel“ im Vergleich zu Opus 4.8 senken, bei gleichzeitigem Anspruch auf frontier-nahen Accuracy-Level. Konkrete Partnerberichte untermauern die Bandbreite möglicher Optimierungen: Ein Evaluationslauf bei Boomi habe 100% Domain-Routing-Accuracy erreicht, zugleich sollen 59% der Requests an ein 5x schnelleres, fein abgestimmtes Modell gegangen sein und die Latenz späterer Turns um 21% gefallen sein. Cadence nennt für einen formalen Verifikations-Use-Case eine Effizienzverbesserung um 9,9%, während Classmethod mit internen Opencode- und Fireworks-Workloads eine Kostenreduktion von 27% bei erhaltener Qualität beschreibt. Daneben werden weitere Integrationen erwähnt, etwa über Kong AI Gateway, Plug-ins in Proxy-Layer-Ansätze wie bei LiteLLM oder eine Einbettung in agentische Umgebungen wie Devin Desktop (intern), Hermes und Hermes-ähnliche Systeme; bei LangChain wird zudem ein Ansatz hervorgehoben, bei dem nur ein kleiner Anteil der Calls an ein Frontier-Modell geht, was die Kosten um 74% senken soll, allerdings mit einem kleineren Genauigkeits-Tausch.
Für die Umsetzung in der Praxis ist zudem die Frage entscheidend, woher Unternehmen die Bausteine beziehen und wie schnell sie sie in bestehende Stacks bekommen. Nemotron 3.5 Lightning ist laut NVIDIA auf Plattformen wie Hugging Face, ModelScope und OpenRouter verfügbar sowie als NVIDIA NIM microservice über build.nvidia.com. NeMo Switchyard wiederum wird auf GitHub bereitgestellt und soll laut Plan über Partnerplattformen zeitnah breiter integriert werden. Für IT-Entscheider ergibt sich daraus ein klarer Ansatz: Statt „Alles aus einem Modell“ zu erwarten, können Teams agentische Systeme als Zusammenspiel spezialisierter Modelle realisieren und gleichzeitig das Routing so gestalten, dass Kosten, Latenz und Datenschutzziele im Betrieb zusammenpassen.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "NVIDIA bringt Nemotron 3.5 Lightning und NeMo Switchyard für agentische KI" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "NVIDIA bringt Nemotron 3.5 Lightning und NeMo Switchyard für agentische KI" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »NVIDIA bringt Nemotron 3.5 Lightning und NeMo Switchyard für agentische KI« bei Google Deutschland suchen, bei Bing oder Google News!