LONDON (IT BOLTWISE) – Das israelische Startup QED Science will Peer Reviews im Biobereich beschleunigen und mit einem QED Score quantifizierbar machen. Das System anonymisiert eingereichte Arbeiten, zerlegt sie in Komponenten und lässt mehrere KI-Agenten Aspekte wie Abbildungs-Konsistenz, Literaturabgleich und Statistik prüfen. Für das „The 1 Percent“ genannte Ranking wurden laut Anbieter Zehntausende Preprints aus dem Lebenswissenschaftsumfeld analysiert. Gleichzeitig werfen Kritiker die Frage auf, ob ein einzelner Score wissenschaftliche Qualität realistisch und transparent abbilden kann.

Die Debatte um „The 1 Percent“ zeigt, wie schnell sich der Wissenschaftsbetrieb an KI-gestützte Bewertungslogiken gewöhnt – und wie hart diese Gewohnheit umkämpft ist. Im Zentrum steht das israelische Startup QED Science, das eine Science-Validity-Engine entwickelt hat, um eingereichte Forschungsarbeiten auf Originalität und Richtigkeit zu prüfen. Das Ergebnis wird als QED Score ausgegeben und als Perzentil im Vergleich zu einem Referenzkorpus beschrieben. Genau diese Messbarkeit macht die Diskussion so scharf: Peer Review war bislang nicht nur ein Qualitätsfilter, sondern auch ein Prozess mit nachvollziehbarer Begründung, Konfliktklärung und menschlicher Verantwortung.
Damit wird ein Grundprinzip des Publikationssystems sichtbar, das unter Druck gerät. Wissenschaftliche Arbeiten durchlaufen bis zur Veröffentlichung einen geregelten Weg: Autoren können zunächst Preprints veröffentlichen, während eine renommierte Fachzeitschrift anschließend unabhängige Gutachterinnen und Gutachter einbindet. In der Praxis wird dabei geprüft, ob die Studie methodisch sauber gearbeitet wurde, die Hypothesen durch Daten gestützt werden und die Argumentation dem Forschungsstand entspricht. Gleichzeitig wächst das Publikationsvolumen schneller als die Zahl verfügbarer Prüfer, die außerdem vielfach unentlohnt oder nur begrenzt entlastet werden. Dazu kommt die menschliche Komponente: Wo Menschen über Menschen urteilen, entstehen Bias-Risiken und Interessenskonflikte – selbst dann, wenn alle Beteiligten die wissenschaftliche Integrität ernst nehmen.
QED Science setzt an dieser Engstelle an, indem das Unternehmen eine Multi-Agent-Architektur beschreibt, die Papers automatisiert analysieren soll. Laut Darstellung werden Arbeiten vor der Bewertung anonymisiert und danach durch mehrere KI-Agenten geprüft, die auf unterschiedliche Prüfaufgaben trainiert wurden. Das Papier wird dafür in einzelne Komponenten zerlegt, sodass am Ende nicht nur eine Gesamteinschätzung, sondern mehrere Teilergebnisse in einen finalen Score einfließen. Ein Agent soll Unstimmigkeiten in Abbildungen finden, ein anderer Widersprüche zur bestehenden Literatur untersuchen und ein weiterer die statistischen Ergebnisse prüfen. Anschließend sammelt eine zusätzliche KI die Resultate ein und verteilt Rohpunktzahlen für Originalität und Validität, bevor eine Gewichtung greift und der QED Score als Perzentilrang herauskommt.
Für das „The 1 Percent“-Ranking wurde das System nach Angaben des Anbieters mit 57.455 Preprint-Papers aus dem Bio- und Lebenswissenschaftsumfeld getestet, die zwischen Mai 2025 und April 2026 veröffentlicht wurden. Von diesen Arbeiten erreichten 574 das 99. Perzentil und wurden damit als „oberstes ein Prozent“ eingeordnet. Der Vergleichsanspruch lautet dabei nicht nur, dass ein Score eine Rangordnung liefert, sondern dass die Bewertung mit menschlichen Urteilen und anderen Benchmarks konsistent sein soll. In der öffentlichen Kritik taucht jedoch ein klassischer Konflikt auf: Wenn Qualität auf einen einzelnen Zahlenwert verdichtet wird, kann der Eindruck entstehen, dass alles unterhalb eines bestimmten Schwellenwerts weniger wert sei. Außerdem befeuert die Logik des Prestiges bereits bekannte Fehlanreize im Wissenschaftssystem, bei dem Metriken und Sichtbarkeit häufig stärker wirken als die tatsächliche Erkenntnis.
Auch an der methodischen Nachvollziehbarkeit entzündet sich Gegenwind. Einige Forschende bezweifeln, ob eine KI die Qualität wissenschaftlicher Arbeit zuverlässig und transparent beurteilen kann, wenn zentrale Bausteine der Implementierung nicht öffentlich zugänglich sind. In einem Blogbeitrag wird kritisiert, dass zwar eine Multi-Agent-KI-Architektur beschrieben werde, aber Algorithmen, Prompts und Gewichtungen nicht einsehbar seien, wodurch unabhängige Nachprüfbarkeit und unabhängige Reproduktion erschwert würden. Hinzu kommt eine zweite Linie der Kritik: Wenn eine Validierungsstudie die KI-Scores mit Journal-Rankings vergleicht, zugleich aber argumentiert wird, dass solche Rankings als Benchmark nur begrenzt geeignet seien, entsteht ein Widerspruch. Darüber hinaus wird darauf hingewiesen, dass Anonymisierung allein strukturelle Verzerrungen nicht automatisch eliminiert, etwa bei der regionalen Verteilung dessen, was im Korpus vorkommt.
Trotzdem zeigt die Debatte auch den möglichen Nutzen: KI kann zeitaufwendige Teile von Prüfprozessen automatisieren und damit menschliche Gutachterinnen und Gutachter entlasten. So liest sich das Argument der Befürworter im Kern nicht als Ersetzung, sondern als Ergänzung, bei der eine KI Vorselektion übernimmt oder auf bestimmte Unstimmigkeiten hinweist. In diesem Szenario bleibt die fachliche Verantwortung für die finale Bewertung bei Menschen, während KI vor allem das „Scannen“ der großen Mengen schneller erledigen soll. Interessant ist dabei auch, dass der Anbieter und das Umfeld betonen, wie unterschiedlich Systeme je nach Modellgeneration arbeiten können; als Kontrast wird unter anderem auf Deepseek verwiesen, das in der Diskussion oft als Beispiel für andere Implementationswege rund um KI-gestützte Auswertung genannt wird.
Für Hochschulen und Unternehmen bedeutet das vor allem eine neue Art von Risiko- und Chancenabwägung. Wer QED Science nutzt, bekommt einen QED Score als Entscheidungsinput, muss aber klären, wie der Score in bestehende Qualitätsprozesse eingebettet wird: als Frühwarnsignal, als Filter für Zeitersparnis oder als reine Orientierungshilfe. Gleichzeitig bleibt die Transparenzfrage entscheidend, weil Wissenschaft mehr als nur „richtige“ Ergebnisse braucht: Sie braucht nachvollziehbare Begründungen, reproduzierbare Prüflogik und die Möglichkeit, Fehler- oder Biasmuster systematisch zu untersuchen. Ob sich KI-gestützte Validierung langfristig neben dem klassischen Peer Review etabliert, hängt daher nicht nur von der Performance ab, sondern davon, wie gut sich die Systeme kritisch prüfen, auditieren und im Alltag der Forschung verantwortungsvoll einsetzen lassen.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "QED Science macht Peer Reviews mit KI messbar – und löst Kritik aus" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "QED Science macht Peer Reviews mit KI messbar – und löst Kritik aus" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »QED Science macht Peer Reviews mit KI messbar – und löst Kritik aus« bei Google Deutschland suchen, bei Bing oder Google News!