LONDON (IT BOLTWISE) – SIFT (Recursive Self-Improvement via Fast Tree Search) reduziert die Kosten beim Testen von Coding-Agent-Patches, indem ein zusätzliches Sprachmodell Kandidaten paarweise vergleicht. Dadurch müssen teure Benchmark-Läufe nicht auf jede Änderung warten. In Tests auf dem Polyglot Coding Benchmark erreichte SIFT 35,1% Genauigkeit in unter fünf Stunden und brauchte dafür 42 CPU-Stunden sowie rund 150 US-Dollar in API-Credits. Das Konzept zielt besonders auf Teams, die ihre Agenten-Harnesse für klar definierte Aufgaben optimieren, ohne jedes Kandidaten-Update vollständig zu validieren.

SIFT für Coding-Agents: KI vergleicht Patches, spart Tausende CPU-Stunden
SIFT für Coding-Agents: KI vergleicht Patches, spart Tausende CPU-Stunden (Foto: IT BOLTWISE)
🧠 KI & Robotik auf Google News abonnieren

Coding Agents werden nicht nur dadurch besser, dass Entwickler ihnen neue Modelle oder Prompts geben. Der eigentliche Engpass liegt oft in der Evaluation: Für jede potenzielle Änderung an Prompt, Tools oder Fehlerbehandlungslogik braucht das System Tests, und die Suche über viele Kandidaten kann schnell in Tausende CPU-Stunden und in spürbare API-Kosten kippen. Genau hier setzt SIFT an: Recursive Self-Improvement via Fast Tree Search kombiniert Self-Improvement-Schritte mit einem günstigeren Bewertungsweg, der teure Benchmark-Runs nur noch für die aussichtsreichsten Versionen auslöst.

Im Kern baut SIFT auf einem Agent-Harness auf, das Kandidatenversionen generiert, aus einer Archivstruktur heraus erneut bewertet und schrittweise weiterentwickelt. Während frühere Ansätze Kandidaten häufig über größere Task-Sets prüfen, schiebt SIFT den Kostenfokus bewusst nach vorn: Eine separate Sprachmodell-Komponente fungiert als LLM-as-a-judge und vergleicht Kandidaten paarweise, bevor das System eine umfassende Benchmark-Prüfung durchführt. Zusätzlich läuft SIFT in einem asynchronen Suchmodus: Patch-Erzeugung, Urteilsschritte und spätere, zeitintensive Evaluationsläufe können parallel laufen, statt auf das Ende der letzten großen Messung zu warten.

Technisch funktioniert das als eine Art „Ranking statt absoluter Score“: Der Judge betrachtet die Implementierung der Agenten, also den Code bzw. die konkreten Änderungen am Harness, nicht aber direkt die Ergebniswerte der Benchmark-Aufgaben. Für jeden neuen Kandidaten holt SIFT bis zu 10 bereits „hochgerankte“ Agenten aus dem Archiv, lässt den Judge Paarvergleiche treffen und kombiniert diese Aussagen über ein Bradley–Terry-Modell zu einer relativen Rangordnung. Wichtig ist: Das ersetzt das Testen nicht. Stattdessen lenkt das Ranking die Priorisierung für die nächste, teure Evaluationsstufe – ähnlich wie ein CI-System, das vor längeren Integrationstests erst eine schnelle Plausibilitätsprüfung durchführt.

Dass dieses Vorgehen mehr als nur ein „Abkürzungs-Trick“ ist, zeigen die Ergebnisse auf mehreren Coding-Benchmarks. Auf dem Polyglot Coding Benchmark erreichte SIFT mit dem geschlossenen Modell o3-mini 35,1% Genauigkeit in weniger als fünf Stunden Wall-Clock-Time. Dafür wurden 42 CPU-Stunden und etwa 150 US-Dollar in API-Credits genannt. In Vergleichen schnitt SIFT zudem besser ab als ein DGM-ähnlicher Baseline-Ansatz: o3-mini kam auf 35,1% gegenüber 30,7% bei DGM; ein Lauf ohne den LLM-judge fiel dagegen auf 29,8% zurück. Damit wirkt der Judge nicht nur wie ein Nebeneffekt, sondern als Treiber für bessere Patch-Auswahl.

Der zentrale Denkfehler, den SIFT adressiert, ist die schlechte Signal-zu-Kosten-Bilanz klassischer Evaluationen: Testet man Änderungen nur auf wenigen Aufgaben, kann der Score stark schwanken, weil die Stichprobe zufällig besonders leicht oder besonders schwer war. SIFT versucht diese Verzerrung zu umgehen, indem die Auswahl des nächsten Kandidaten über Code-basierte Paarvergleiche vorgefiltert wird. Besonders anschaulich wird das auf TerminalBench: Der Judge-Beitrag erkennt offenbar Qualitätsprobleme, obwohl der „Top“-Kandidat innerhalb des Suchfensters nur knapp vorn lag. Der Beitrag der Code-Perspektive zeigt sich dort auch in konkreten Fehlerbildern: Ein neu eingefügter Verifier war laut Beschreibung standardmäßig deaktiviert, und ein umgebautes Shell-Tool barg Laufzeitrisiken – Aspekte, die sich aus dem Code ableiten lassen, ohne auf die vollständige Benchmark-Auswertung zu warten.

Für Unternehmen und Teams, die Coding-Agenten in produktionsnahen Workflows betreiben, liegt der praktische Nutzen vor allem in der Architektur der Self-Improvement-Schleife. Der Paper-Ansatz ist zwar auf Coding Agents getestet, aber die Bausteine sind übertragbar: Erstens braucht man eine kleine, günstige Evaluationsstufe, die offensichtlich kaputte Modifikationen früh stoppt (Regressionen, kaputte Tools, Verletzung grundlegender Anforderungen). Zweitens braucht man einen LLM-judge, der nicht zwangsläufig eine exakte Zielpunktzahl vorhersagt, sondern eine sinnvolle relative Ordnung liefert. Drittens muss die Pipeline asynchron sein, damit Kandidaten parallel expandieren können – so wächst der Suchbaum weiter, während Langläufer-Evaluationsjobs im Hintergrund laufen. Genau hier entsteht die messbare Beschleunigung, weil Fortschritt im Suchraum nicht an den Abschluss teurer Tests gekoppelt bleibt.

Das Konzept macht dabei eine wichtige Qualitätsaussage: Selbst wenn der Judge Kandidaten gut priorisiert, bleibt die finale Validierung über nachgelagerte Benchmark-Läufe notwendig. In den Experimenten wird zwar auch gezeigt, dass günstigere Judge-Setups einen Großteil des globalen Signals behalten können, aber die Zuverlässigkeit unter den „besten“ Kandidaten steigt mit stärkerer Modellwahl. Für die Umsetzung heißt das: Ein tiered judge-Design kann Kosten sparen, während man die Spitzenplätze dort mit der robusteren Bewertungsinstanz abdeckt. Damit zeigt SIFT weniger eine „neue Generation von Coding-Agenten“, sondern vor allem einen effizienteren Weg, wie Agenten ihre eigenen Verbesserungen iterativ finden, ohne die Evaluation linear mit der Anzahl der getesteten Patches hochzuschrauben.


💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!


Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
152 Bewertungen
Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
  • ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
334 Bewertungen
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
  • IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
1.501 Bewertungen
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
  • 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
53 Bewertungen
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
  • 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
946 Bewertungen
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
  • V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.


Hat Ihnen der Artikel bzw. die News - SIFT für Coding-Agents: KI vergleicht Patches, spart Tausende CPU-Stunden - gefallen? Dann abonnieren Sie uns doch auf Insta: AI News, Tech Trends & Robotics - Instagram - Boltwise

Unseren KI-Morning-Newsletter «Der KI News Espresso» mit den besten KI-News des letzten Tages gratis per eMail - ohne Werbung: Hier kostenlos eintragen!





Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!
Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.









Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "SIFT für Coding-Agents: KI vergleicht Patches, spart Tausende CPU-Stunden".
Stichwörter Agenten-entwicklung AI Api-credits Artificial Intelligence Asynchrone-ausfuehrung Benchmark Bradley-terry Coding-agent Cpu-stunden Evaluation KI Künstliche Intelligenz Llm-judge Self-improvement
Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!
Kein nächster Artikel
Vorheriger Artikel

Supabase bekommt 150 Millionen US-Dollar und kauft Turso für mehr KI-Agents


Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "SIFT für Coding-Agents: KI vergleicht Patches, spart Tausende CPU-Stunden" für unsere Leser?

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

  • Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)


  • Es werden alle Kommentare moderiert!

    Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

    Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

    Du willst nichts verpassen?

    Du möchtest über ähnliche News und Beiträge wie "SIFT für Coding-Agents: KI vergleicht Patches, spart Tausende CPU-Stunden" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
    Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »SIFT für Coding-Agents: KI vergleicht Patches, spart Tausende CPU-Stunden« bei Google Deutschland suchen, bei Bing oder Google News!


    662 Leser gerade online auf IT BOLTWISE
    KI-Jobs