LONDON (IT BOLTWISE) – SIFT (Recursive Self-Improvement via Fast Tree Search) reduziert die Kosten beim Testen von Coding-Agent-Patches, indem ein zusätzliches Sprachmodell Kandidaten paarweise vergleicht. Dadurch müssen teure Benchmark-Läufe nicht auf jede Änderung warten. In Tests auf dem Polyglot Coding Benchmark erreichte SIFT 35,1% Genauigkeit in unter fünf Stunden und brauchte dafür 42 CPU-Stunden sowie rund 150 US-Dollar in API-Credits. Das Konzept zielt besonders auf Teams, die ihre Agenten-Harnesse für klar definierte Aufgaben optimieren, ohne jedes Kandidaten-Update vollständig zu validieren.

Coding Agents werden nicht nur dadurch besser, dass Entwickler ihnen neue Modelle oder Prompts geben. Der eigentliche Engpass liegt oft in der Evaluation: Für jede potenzielle Änderung an Prompt, Tools oder Fehlerbehandlungslogik braucht das System Tests, und die Suche über viele Kandidaten kann schnell in Tausende CPU-Stunden und in spürbare API-Kosten kippen. Genau hier setzt SIFT an: Recursive Self-Improvement via Fast Tree Search kombiniert Self-Improvement-Schritte mit einem günstigeren Bewertungsweg, der teure Benchmark-Runs nur noch für die aussichtsreichsten Versionen auslöst.
Im Kern baut SIFT auf einem Agent-Harness auf, das Kandidatenversionen generiert, aus einer Archivstruktur heraus erneut bewertet und schrittweise weiterentwickelt. Während frühere Ansätze Kandidaten häufig über größere Task-Sets prüfen, schiebt SIFT den Kostenfokus bewusst nach vorn: Eine separate Sprachmodell-Komponente fungiert als LLM-as-a-judge und vergleicht Kandidaten paarweise, bevor das System eine umfassende Benchmark-Prüfung durchführt. Zusätzlich läuft SIFT in einem asynchronen Suchmodus: Patch-Erzeugung, Urteilsschritte und spätere, zeitintensive Evaluationsläufe können parallel laufen, statt auf das Ende der letzten großen Messung zu warten.
Technisch funktioniert das als eine Art „Ranking statt absoluter Score“: Der Judge betrachtet die Implementierung der Agenten, also den Code bzw. die konkreten Änderungen am Harness, nicht aber direkt die Ergebniswerte der Benchmark-Aufgaben. Für jeden neuen Kandidaten holt SIFT bis zu 10 bereits „hochgerankte“ Agenten aus dem Archiv, lässt den Judge Paarvergleiche treffen und kombiniert diese Aussagen über ein Bradley–Terry-Modell zu einer relativen Rangordnung. Wichtig ist: Das ersetzt das Testen nicht. Stattdessen lenkt das Ranking die Priorisierung für die nächste, teure Evaluationsstufe – ähnlich wie ein CI-System, das vor längeren Integrationstests erst eine schnelle Plausibilitätsprüfung durchführt.
Dass dieses Vorgehen mehr als nur ein „Abkürzungs-Trick“ ist, zeigen die Ergebnisse auf mehreren Coding-Benchmarks. Auf dem Polyglot Coding Benchmark erreichte SIFT mit dem geschlossenen Modell o3-mini 35,1% Genauigkeit in weniger als fünf Stunden Wall-Clock-Time. Dafür wurden 42 CPU-Stunden und etwa 150 US-Dollar in API-Credits genannt. In Vergleichen schnitt SIFT zudem besser ab als ein DGM-ähnlicher Baseline-Ansatz: o3-mini kam auf 35,1% gegenüber 30,7% bei DGM; ein Lauf ohne den LLM-judge fiel dagegen auf 29,8% zurück. Damit wirkt der Judge nicht nur wie ein Nebeneffekt, sondern als Treiber für bessere Patch-Auswahl.
Der zentrale Denkfehler, den SIFT adressiert, ist die schlechte Signal-zu-Kosten-Bilanz klassischer Evaluationen: Testet man Änderungen nur auf wenigen Aufgaben, kann der Score stark schwanken, weil die Stichprobe zufällig besonders leicht oder besonders schwer war. SIFT versucht diese Verzerrung zu umgehen, indem die Auswahl des nächsten Kandidaten über Code-basierte Paarvergleiche vorgefiltert wird. Besonders anschaulich wird das auf TerminalBench: Der Judge-Beitrag erkennt offenbar Qualitätsprobleme, obwohl der „Top“-Kandidat innerhalb des Suchfensters nur knapp vorn lag. Der Beitrag der Code-Perspektive zeigt sich dort auch in konkreten Fehlerbildern: Ein neu eingefügter Verifier war laut Beschreibung standardmäßig deaktiviert, und ein umgebautes Shell-Tool barg Laufzeitrisiken – Aspekte, die sich aus dem Code ableiten lassen, ohne auf die vollständige Benchmark-Auswertung zu warten.
Für Unternehmen und Teams, die Coding-Agenten in produktionsnahen Workflows betreiben, liegt der praktische Nutzen vor allem in der Architektur der Self-Improvement-Schleife. Der Paper-Ansatz ist zwar auf Coding Agents getestet, aber die Bausteine sind übertragbar: Erstens braucht man eine kleine, günstige Evaluationsstufe, die offensichtlich kaputte Modifikationen früh stoppt (Regressionen, kaputte Tools, Verletzung grundlegender Anforderungen). Zweitens braucht man einen LLM-judge, der nicht zwangsläufig eine exakte Zielpunktzahl vorhersagt, sondern eine sinnvolle relative Ordnung liefert. Drittens muss die Pipeline asynchron sein, damit Kandidaten parallel expandieren können – so wächst der Suchbaum weiter, während Langläufer-Evaluationsjobs im Hintergrund laufen. Genau hier entsteht die messbare Beschleunigung, weil Fortschritt im Suchraum nicht an den Abschluss teurer Tests gekoppelt bleibt.
Das Konzept macht dabei eine wichtige Qualitätsaussage: Selbst wenn der Judge Kandidaten gut priorisiert, bleibt die finale Validierung über nachgelagerte Benchmark-Läufe notwendig. In den Experimenten wird zwar auch gezeigt, dass günstigere Judge-Setups einen Großteil des globalen Signals behalten können, aber die Zuverlässigkeit unter den „besten“ Kandidaten steigt mit stärkerer Modellwahl. Für die Umsetzung heißt das: Ein tiered judge-Design kann Kosten sparen, während man die Spitzenplätze dort mit der robusteren Bewertungsinstanz abdeckt. Damit zeigt SIFT weniger eine „neue Generation von Coding-Agenten“, sondern vor allem einen effizienteren Weg, wie Agenten ihre eigenen Verbesserungen iterativ finden, ohne die Evaluation linear mit der Anzahl der getesteten Patches hochzuschrauben.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "SIFT für Coding-Agents: KI vergleicht Patches, spart Tausende CPU-Stunden" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "SIFT für Coding-Agents: KI vergleicht Patches, spart Tausende CPU-Stunden" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »SIFT für Coding-Agents: KI vergleicht Patches, spart Tausende CPU-Stunden« bei Google Deutschland suchen, bei Bing oder Google News!