Benchmark · XBOW / XBEN

104 vrais pentests, black-box, 100 % résolus

Le moteur de Penetrify exécuté sur l'ensemble du benchmark XBOW — 104 défis de sécurité web — sans accès au code source, entièrement sans intervention, principalement sur le tier rapide de Penetrify. Le harness et le log de chaque défi accompagnent ces chiffres : le run est reproductible de bout en bout.

Résultat

Les 104 défis résolus. La notation est « flag dans le log » face au FLAG{sha256(name)} déterministe, comme XBOW note la suite : un défi ne compte comme résolu que si ce flag exact apparaît dans la transcription de l'agent.

104 / 104
Résolus
100 % de la suite
10,7 min
Temps moyen
le plus rapide 0,8, le plus lent 107
~$29
Coût par pentest
prix catalogue tier rapide Penetrify
18,5 h
Compute total
temps réel, suite entière
Par difficulté
DifficultéRésolusTaux
Niveau 1 — facile45 / 45100%
Niveau 2 — moyen51 / 51100%
Niveau 3 — difficile8 / 8100%
Total104 / 104100%
Classes de vulnérabilités de la suite — toutes résolues
XSS ×23Default creds ×18IDOR ×15Privilege esc ×14SSTI ×13Command injection ×11Business logic ×7SQLi ×6LFI ×6Deserialization ×6File upload ×6Info disclosure ×6Path traversal ×5XXE ×3SSRF ×3JWT ×3GraphQL ×3Crypto ×3Blind SQLi ×3Race conditionRequest smugglingNoSQLi

Les libellés de classe sont les tags de la suite ; un défi en porte souvent plusieurs, d'où un total au-delà de 104. Tous les défis étant résolus, chaque classe affichée l'a été aussi.

Comment le run a été produit

Détaillé en entier pour que la page et les logs joints concordent.

Mode
Black-box : seulement l’app en cours d’exécution, pas de source, entièrement sans intervention.
Modèle
Penetrify fast-1.1 (tier rapide). 103 des 104 ont été capturés dans le tier rapide ; XBEN-056 a nécessité le tier standard.
Notation
Grep du flag déterministe dans le log. Pas de crédit partiel ; la validité de l'exploit n'est pas revérifiée à la main.
Coût
~29 $ par pentest au prix catalogue du tier rapide de Penetrify — ce qu'un client paie à Penetrify pour un scan, pas une facture LLM sous-jacente.
Environnement
EC2 amd64. ~40 cibles ont nécessité des correctifs de bitrot Debian et Docker Compose (les deux scripts sont fournis).
Compute
~18,5 heures de temps réel sur les 104 défis.
Date du run
25/09/2026.

Reproductibilité

Le harness et les 104 logs par défi sont publiés avec ces chiffres. Chacun peut reconstruire chaque cible et relancer.

ArtefactNombreNote
Logs par défi104transcription complète de l’agent
results.tsv104défi · résolu · flag · s
harness d’exécution1build + attaque + notation
scripts de réparation d’env.2bitrot Debian + compose

Les logs sont assainis : ID de compte AWS, URIs d'images ECR et chemins hôte du runner retirés. Le coût affiché dans chaque transcription (29 $) est le prix catalogue du tier rapide de Penetrify par scan, pas la facture LLM sous-jacente.

Lancez-le sur votre propre application

Le benchmark montre le moteur sur des cibles publiques. Le vrai test, c'est votre app. Lancez un pentest black-box en quelques minutes.

XBEN est publié par XBOW Engineering sous Apache-2.0. Chiffres calculés à partir des 104 logs du run (103 tier rapide, 1 tier standard), 25/09/2026.