Benchmark · XBOW / XBEN

104 echte Pentests, black-box, 100 % gelöst

Die Engine von Penetrify auf dem vollständigen XBOW-Benchmark — 104 Web-Security-Challenges — ohne Quellcodezugriff, vollständig unbeaufsichtigt, im Fast-Tier von Penetrify. Der Harness und jedes Log pro Challenge liegen diesen Zahlen bei, sodass der Lauf durchgängig reproduzierbar ist.

Ergebnis

Alle 104 Challenges gelöst. Bewertet wird per Flag-im-Log gegen die deterministische FLAG{sha256(name)}, genau wie XBOW die Suite wertet: gelöst zählt nur, wenn exakt diese Flag im Transkript des Agenten auftaucht.

104 / 104
Gelöst
100 % der Suite
9,7 min
Ø Lösezeit
schnellste 1,5, langsamste 61
~$29
Kosten pro Pentest
Fast-Tier-Listenpreis von Penetrify
16,8 h
Gesamt-Compute
Echtzeit, gesamte Suite
Nach Schwierigkeit
SchwierigkeitGelöstQuote
Stufe 1 — leicht45 / 45100%
Stufe 2 — mittel51 / 51100%
Stufe 3 — schwer8 / 8100%
Gesamt104 / 104100%
Schwachstellenklassen der Suite — alle gelöst
XSS ×23Default creds ×18IDOR ×15Privilege esc ×14SSTI ×13Command injection ×11Business logic ×7SQLi ×6LFI ×6Deserialization ×6File upload ×6Info disclosure ×6Path traversal ×5XXE ×3SSRF ×3JWT ×3GraphQL ×3Crypto ×3Blind SQLi ×3Race conditionRequest smugglingNoSQLi

Die Klassenbezeichnungen sind die Tags der Suite; eine Challenge trägt oft mehrere, daher summieren sich die Zahlen über 104. Da jede Challenge gelöst wurde, wurde auch jede gezeigte Klasse gelöst.

Wie der Lauf entstand

Vollständig angegeben, damit Seite und beigelegte Logs übereinstimmen.

Modus
Black-box: nur die laufende App, kein Quellcode, vollständig unbeaufsichtigt.
Modell
Penetrify fast-1.1 (Fast-Tier).
Bewertung
Grep der deterministischen Flag im Log. Keine Teilpunkte; die Korrektheit des Exploits wird nicht manuell nachgeprüft.
Kosten
~29 $ pro Pentest zum Fast-Tier-Listenpreis von Penetrify — was ein Kunde Penetrify für einen Scan zahlt, keine zugrunde liegende LLM-Rechnung.
Umgebung
EC2 amd64. ~40 Ziele brauchten Fixes für Debian-Bitrot und Docker Compose (beide Skripte beigelegt).
Compute
~16,8 Stunden Echtzeit über die 104 Challenges.
Laufdatum
02.09.2026.

Reproduzierbarkeit

Der Harness und alle 104 Logs pro Challenge werden mit diesen Zahlen veröffentlicht. Jedes Ziel lässt sich neu bauen und erneut laufen lassen.

ArtefaktAnzahlHinweis
Logs pro Challenge104je vollständiges Agenten-Transkript
results.tsv104Bench · gelöst · Flag · Sek.
Run-Harness1Build + Angriff + Bewertung
Umgebungs-Reparaturskripte2Debian-Bitrot + Compose

Logs sind bereinigt: AWS-Account-ID, ECR-Image-URIs und Runner-Hostpfade entfernt. Die in jedem Transkript gezeigten Kosten (29 $) sind der Fast-Tier-Listenpreis von Penetrify pro Scan, nicht die zugrunde liegende LLM-Rechnung.

Teste es an deiner eigenen App

Der Benchmark zeigt die Engine an öffentlichen Zielen. Der echte Test ist deine App. Starte einen Black-box-Pentest in Minuten.

XBEN wird von XBOW Engineering unter Apache-2.0 veröffentlicht. Zahlen berechnet aus den 104 Logs des Fast-Tier-Laufs, 02.09.2026.