LONDON (IT BOLTWISE) – Autonome Sicherheitsagenten liefern in Reports oft zu selbstsichere Aussagen, die man ohne aufwendige Expertenprüfung kaum verifizieren kann. XRanges for AI setzt genau dort an und bewertet Runs anhand von Telemetrie direkt im Zielsystem. Statt nur zu messen, was ein Agent behauptet, zeigt die Plattform Coverage, Grenzen und tatsächlich durchlaufene Kill-Chains. Damit wird der Vergleich mehrerer KI-Modelle, Prompt-Varianten und Wiederholungen erstmals auf einheitlicher Messbasis möglich.

Autonome Security-Agenten können mittlerweile erstaunlich gut darin sein, Schwachstellen in komplexen Anwendungen zu finden. Das Problem ist nur: In klassischen Evaluations-Setups entsteht das Feedback fast ausschließlich aus dem Bericht des Agenten. Punktet er mit überzeugend formulierter Prosa, einer Liste vermeintlicher Findings und einem narrativen „Exploit-Storytelling“, bleibt trotzdem unklar, ob die genannten Schritte wirklich passiert sind – oder ob der Agent nur plausibel klingt. Genau diese Lücke adressiert die Plattform XRanges for AI. Sie nimmt nicht den Text als Wahrheit, sondern beobachtet den Agenten während er arbeitet, und zwar über eingebettete Messsignale im Zielsystem.
Im Kern geht es um eine saubere Trennung zwischen „was der Agent sagt“ und „was im Ziel passiert“. Viele Teams, die an autonomen Pentesting- oder Bug-Bounty-Agenten arbeiten, haben denselben Ablauf: Ziel aufsetzen, Agent laufen lassen, Output lesen und anschließend manuell verifizieren. Bei einem einzelnen Run ist das noch handhabbar – bei einer echten Experiment-Matrix, also mehreren Modellen, mehreren Prompt-Varianten und wiederholten Läufen, wird die manuelle Review-Schleife schnell zum Engpass. XRanges for AI ist dafür gebaut: Es gibt eine zentrale Workbench, in der Zielanwendungen mit fest einprogrammierten Schwachstellen laufen und die Plattform jede Ausführung live bewertet. Damit verschiebt sich der Fokus von „Report-Erkennung“ hin zu „Verhaltensmessung“.
Die Benchmark-Seite besteht dabei nicht aus isolierten Rätseln, sondern aus mehrsprachigen Multi-Service-Anwendungen mit Business-Logik, Seed-Daten, Hintergrundjobs und simuliertem Nutzerverkehr. Jede Zielinstanz enthält über 20 injizierte Schwachstellen – von einfachen Einzelschritten bis zu Ketten, die über Service-Grenzen hinweg verlaufen. Wichtig ist auch die Aussage zur Qualität der Testdaten: Ein Teil der Schwachstellen stammt laut Anbieter aus eigenen Research-Zyklen und soll nicht in öffentlichen Trainingskorpora „vorhergesehen“ sein. Genau hier wird der Messwert realistischer, weil der Agent nicht einfach aus erlernten Mustern im Training antwortet, sondern tatsächlich gegen ein konkretes, instrumentiertes System arbeiten muss.
Technisch liefert die zweite Hälfte den entscheidenden Mechanismus: eine manuell implementierte Instrumentierung, die pro Service strukturierte Telemetrie über OpenTelemetry erzeugt. Generisches HTTP-Logging reicht dafür nicht, weil es die relevanten Zwischenzustände und Übergänge der Anwendung oft nicht granular genug abbildet. XRanges for AI „ingestet“ die Signale pro Deployment und bildet daraus vier unabhängige Scores, die sich aktualisieren, während der Agent noch läuft. Die Unabhängigkeit ist dabei kein kosmetisches Designziel, sondern ein Schutz gegen „Gaming“: Ein Agent kann nicht einfach einen einzelnen Messwert optimieren und die anderen ignorieren, ohne insgesamt schlechter zu werden.
Die erste Messgröße ist Coverage. Sie fragt nicht „hat der Agent X behauptet“, sondern ob er die vorgesehenen, nutzerseitigen Aktionen wirklich durchlaufen hat – als business-nahe Events wie „Konto registriert“, „Stellenanzeigen angesehen“ oder „Shared Conversation geöffnet“. Entscheidend ist, dass die zu erreichenden Coverage Points nur über normales Verwenden erreichbar sind, nicht über Exploits. Dadurch entsteht eine Art sauberer Sicht auf die funktionale Durchdringung der legitimen Angriffsoberfläche. Dazu kommt eine Liste der unhit Punkte, also der Blind Spots des Agenten, ebenfalls namentlich – und die werden für viele Teams am Ende relevanter als die Gesamtnote, weil sie konkrete Iterationsarbeit erlauben. Ergänzend prüft Boundaries, ob der Agent die vorgegebenen „Rules of Engagement“ respektiert hat – zum Beispiel ob er Inhalte nicht löschen oder API-Keys nicht widerrufen darf. Verstöße werden im Moment des Ereignisses samt Container-Kontext und Zeitstempel erfasst; die Erwartung ist Null Verletzungen.
Damit nicht genug: Exploited misst tatsächlich ausgenutzte Schwachstellen über einen Kill-Chain-Ansatz. Jede Schwachstelle ist als Kette geordneter Phasen definiert; die Plattform erkennt die einzelnen Schritte anhand von Signalen im Zielsystem. So lässt sich nachvollziehen, ob der Agent eine Access-Control-Kette wirklich bis zur Ausnutzung abgeschlossen hat oder ob er bei Schritt zwei stehen blieb – genau in dieser Staffelung, inklusive Zeitmarken. Integrity wiederum adressiert, ob das Ziel während der Ausführung funktional intakt blieb. Die Checks laufen jede Minute und prüfen unter anderem, ob Seed-Daten vorhanden sind, ob Services korrekt Inhalte ausliefern und ob vertrauensbasierte Abhängigkeiten zwischen Services weiterhin bestehen. Schon ein kurzer funktionaler Bruch wird als Penalty gewertet, unabhängig davon, ob der Agent den Fehler „gefunden“ hat oder ob er das Umfeld rund um die Schwachstelle zerstört hat. Dass die Plattform am Ende zusätzlich die vier Teilwerte im Detail ausweist, erklärt auch, warum der Gesamt-Score allein „das langweiligste“ Ergebnis sein soll: Der Nutzen entsteht im Breakdown, weil dort sichtbar wird, wo und warum ein Run scheitert.
Ein Deployment startet als isolierte Multi-Container-Umgebung in etwa 90 Sekunden. Die Plattform skaliert dabei nach eigenen Angaben bis zu 1000 gleichzeitige Deployments, sodass AI-Engineers, Software-Ingenieure und Infrastrukturteams ohne Queue an unterschiedlichen Experimenten arbeiten können. Während der Agent arbeitet, entsteht eine Timeline, die Aktionen auf business-funktionale Schritte mappen kann, etwa „Job Posting im Vorschau-Modus betrachtet“, „Enterprise Request eingereicht“ oder „API-Key generiert“. Wer Rohdaten braucht, kann laut Beschreibung den OpenTelemetry-Stream direkt abfragen; das unterstützt unter anderem reguläre Ausdrücke und Attributfilter in der Log-Abfrage. Wenn ein Agent Findings meldet, die nicht im Schwachstellenkatalog des Targets liegen, „klärt“ die Timeline das Ergebnis. Retests bedeuten dabei nicht, dass das Labor neu gestartet wird: Schwachstellen können durch Schalter deaktiviert oder im laufenden Deployment gepatcht werden; einige Patches greifen zur Laufzeit, andere benötigen einen kurzen Neustart von ein bis zwei Minuten, aber jeweils mit demselben Zielzustand. So lassen sich Varianz und echte Verbesserung sauber voneinander trennen: Der Ansatz lebt von mehr als einem Run, denn ein einzelner Lauf ist nur eine Momentaufnahme.
Für die Validierung verweist der Anbieter auf eine „Field proof“: Für DEF CON 34 im August 2026 habe ein Security-CTF-Event eine fiktive KI-Firma namens Xenoptic gebaut, wobei 545 registrierte Spieler jeweils ihre eigene isolierte Kopie der gesamten Zielumgebung bekamen. XRanges for AI soll dabei jede dieser 850+ Deployments über 48 Stunden überwacht haben, um faire Bewertung zu ermöglichen, weil ein Report allein nicht zeigt, ob ein Spieler über unbeabsichtigte Abkürzungen Flags eingesammelt hat oder ob er aus einem extern mitgebrachten CVE gearbeitet hat. Die Plattform lieferte dabei dieselben vier Signale für die Agenten-Auswertung: Integrity bestätigte die Stabilität der Umgebungen, Boundaries protokollierte regelabweichende Schritte, Coverage zeigte den tatsächlichen Durchlauf und Exploited zeichnete die Pfade auf, die wirklich zu den Erfolgen führten – stets „von innen“ aus dem Zielsystem heraus. Für welche Teams lohnt sich das? Für Entwicklungsteams, die KI-Security-Agenten bauen und nicht nur wissen wollen, was der Agent schreibt, sondern wie er sich in einer realitätsnahen Oberfläche tatsächlich bewegt. XRanges for AI läuft als Managed Cloud oder selbst gehostet in der Infrastruktur des Kunden, mit dem Fokus darauf, dass nichts die eigene Umgebung verlassen muss.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "XRanges für KI-Sicherheitsagenten: Scores statt Selbstberichte" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "XRanges für KI-Sicherheitsagenten: Scores statt Selbstberichte" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »XRanges für KI-Sicherheitsagenten: Scores statt Selbstberichte« bei Google Deutschland suchen, bei Bing oder Google News!