LONDON (IT BOLTWISE) – Eine neue Proof-of-Concept-Studie zeigt, dass KI-Code-Agenten bei automatischen Freigaben nicht nur Schwachstellen finden, sondern auch selbst zum Ausführungsweg für Schadcode werden können. Der Angriff „Friendly Fire“ arbeitet gezielt gegen Claude Code und Codex, wenn sie in Autonomie-Modi laufen, die Kommandos nach Risiko-Scoring erlauben. Besonders brisant: Die Autoren verstecken den Payload in einem README.md und umgehen damit typische Vertrauensabfragen. Für Teams, die Agenten zur Prüfung von Drittcode einsetzen, wird damit klar: „Security Testing“ bleibt allein durch Automatisierung riskant, wenn untrusted Text ausführbare Schritte auslöst.

KI-gestützte Code-Agenten sollen eigentlich helfen, Sicherheitsprobleme in fremdem Quelltext früh zu erkennen. Genau dort setzt aber eine Proof-of-Concept-Analyse an, die den Angriffsfall „Friendly Fire“ beschreibt: Ein Agent, der in einem autonomen Modus selbständig Befehle ausführen darf, kann dazu gebracht werden, den vom Angreifer eingebetteten Schadcode auf dem eigenen Host laufen zu lassen. Die Autoren demonstrieren das mit Open-Source-Testprojekten und zeigen, dass der klassische Zweck solcher Tools – nämlich das Prüfen untrusted Codes – beim falschen Workflow zur Eintrittskarte wird. Entscheidend ist dabei weniger ein einzelner Befehl als die Art, wie der Agent Vertrauen ableitet, sobald Kommandos „genug sicher“ wirken.
Technisch basiert der Angriff auf einer schmalen Stelle zwischen zwei Betriebsarten: völlig freiem Command-Execution-Access und strikt schrittweise Bestätigung. Sowohl bei Anthropics Claude Code als auch bei OpenAIs Codex existieren Modi, die vorgeben, erst dann „durchzulassen“, wenn ein interner Klassifikator das jeweilige Kommando als risikoarm einstuft. In dieser Zwischenzone hält der Agent kurz inne bei als gefährlich markierten Schritten, führt aber freigegebene Aktionen ohne erneute Freigabedialoge aus. Die Studie testet konkrete Setups, etwa Claude Code im Auto-Modus (mit mehreren CLI-Versionen) und Codex im auto-review Modus, und zeigt: Ist die Automatisierung aktiv, reicht ein Trigger, um genau den Prüf-Schritt zu kapern.
Der Kernmechanismus wirkt zunächst banal, ist aber deshalb so gefährlich: Die Autoren platzieren den Payload nicht in einer Konfigurationsdatei, die oft misstrauisch betrachtet wird, sondern in ganz normalem README.md-Text. Agenten lesen README-Dateien typischerweise, um Projektziele zu verstehen und passende „routine checks“ oder Testskripte zu starten. Im Demo-Beispiel nutzen die Forschenden geopy, eine verbreitete Python-Bibliothek für Kartenkoordinaten. Der eigentliche Trick besteht darin, dass das README den Eindruck erweckt, es sei eine harmlose Routine wie „security.sh“ auszuführen, während das Skript im Hintergrund einen versteckten Binärpayload startet. Um die Erkennung durch Code- oder Disassembly-Checks zu erschweren, tarnen die Autoren den Binärinhalt als kompiliertes Artefakt eines harmlosen Go-Files direkt im selben Verzeichnis und spiegeln sogar Zeichenfolgen aus diesem Quellmaterial wider.
Damit wird „Friendly Fire“ besonders relevant für Sicherheits- und Plattformteams, die Agenten zur Supply-Chain-Absicherung einsetzen. Historisch ist das Muster nicht neu: Bereits frühere Agentenangriffe zeigten, dass untrusted Text zuverlässig zu Ausführungspfaden werden kann. „TrustFall“ etwa machte 2024 eine booby-trapped Repository-Logik zur One-Click-Ausführung über mehrere Agentenkanäle; „Agentjacking“ konnte mit manipulierten Bug-Reports im Sentry-Ökosystem ähnliche Effekte erzielen und erreichte dort hohe Erfolgsquoten. Der neue Punkt ist die Breite des Eintrittswegs: README.md wird in der Praxis selten so behandelt wie hochsensitive Provider-Konfigs. Zusätzlich berichtet die Studie, dass Anthropic in den letzten Monaten mehrere Patches gegen Config-File-Injection geliefert hat, während dieser Ansatz genau diese Klasse umgeht – ein Hinweis darauf, dass reine Fixes auf Dateiebene nicht ausreichen, wenn der Workflow weiterhin ausführbare Kommandos aus untrusted Text ableitet.
Im Markt zeigt sich der Konflikt unmittelbar: Anbieter pushen KI-Agenten in Richtung „Security by Automation“, und Politik wie Regulierung versuchen, die Systeme schneller in defensive Prozesse zu integrieren. In den USA etwa steht ein Executive-Order-Umfeld, das die Beschleunigung solcher Fähigkeiten fordert, während der beschriebene Gap zwischen „Text verstehen“ und „Text als Ausführungsinstruktion behandeln“ in der Praxis offenbar noch offen ist. Branchenanalysten leiten daraus vor allem einen Governance-Schluss ab: Wenn Agenten echte Host- oder Key-Zugriffe haben, müssen Sicherheitskontrollen vor dem Agenten greifen, nicht nur in dessen Modellverhalten. Entscheidend ist also die Kette aus Berechtigungen, nicht die Frage, ob ein bestimmtes Modell „klüger“ wird.
Für die Zukunft zeichnen sich zwei Konsequenzen ab. Erstens: Eine reine Modellaktualisierung reicht laut Studie wahrscheinlich nicht, weil die Systeme die semantische Herkunft von Code bzw. Anweisungen nicht zuverlässig genug trennen können. Die Autoren deuten an, dass der gleiche Payload ohne Änderungen über mehrere Claude- und Codex-Varianten hinweg funktioniert, und sogar Fälle auftauchten, in denen neuere Modelle Diskrepanzen nicht zuverlässig genug als Grund für das Stoppen interpretierten. Zweitens: Selbst wenn Teams strengere Betriebsmodi aktivieren, die vor jedem Schritt nachfragen, verschiebt sich das Problem nur – aus „keine Freigabe“ wird „manuelle Freigabe“, aber bei hoher Geschwindigkeit werden Risiken trotzdem übersehen. Datenschutz- und Compliance-seitig verschärft das die Lage: Sobald ein Agent auf Secrets, Zugangsdaten oder produktive Umgebungen zugreift, verwandelt sich ein Security-Check in eine potenzielle Datenabfluss- oder Missbrauchsstrecke.
Was konkret zu tun bleibt, ist deshalb weniger eine Optimierung am Prompt als eine Änderung der Pipeline. Die Studie empfiehlt, untrusted Code nicht an einen Agent zu geben, der Kommandos ausführen darf und gleichzeitig auf Schlüssel, Secrets oder den Host zugreifen kann. Wenn das nicht praktikabel ist, sollte mindestens die Ausführung konsequent in einem isolierten Sandbox-Workflow erfolgen; dennoch betonen die Autoren, dass Isolation nicht „unendlich“ sicher ist, weil Sandboxen entkommen können und eigene Escape-Bugs existierten, darunter auch in einem Zusammenhang mit einem Symlink-Thema (CVE-2026-39861). Für Entwicklerteams heißt das: Agenten können nützlich bleiben, aber nur, wenn die Umgebung ihre Aktionen technisch so begrenzt, dass ein README-basierter Trigger keinen direkten Weg zu echten Systemressourcen eröffnet.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- NIEDLICHER BEGLEITER: Eilik ist der ideale Begleiter für Kinder und Erwachsene, die Haustiere, Spiele und intelligente Roboter lieben. Mit vielen Emotionen, Bewegungen und interaktiven Funktionen.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Friendly Fire: KI-Code-Agenten lassen sich durch README-Skripte austricksen" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Friendly Fire: KI-Code-Agenten lassen sich durch README-Skripte austricksen" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Friendly Fire: KI-Code-Agenten lassen sich durch README-Skripte austricksen« bei Google Deutschland suchen, bei Bing oder Google News!