Benchmark · XBOW / XBEN

104 pentests reales, black-box, 100 % resueltos

El motor de Penetrify ejecutado sobre todo el benchmark XBOW — 104 retos de seguridad web — sin acceso al código fuente, totalmente sin intervención, en el tier rápido de Penetrify. El harness y el log de cada reto se publican junto a estas cifras, así que el run es reproducible de principio a fin.

Resultado

Los 104 retos resueltos. La calificación es «flag en el log» contra la FLAG{sha256(name)} determinista, igual que XBOW puntúa la suite: un reto cuenta como resuelto solo si esa flag exacta aparece en la transcripción del agente.

104 / 104
Resueltos
100 % de la suite
9,7 min
Tiempo medio
el más rápido 1,5, el más lento 61
~$29
Coste por pentest
precio de lista del tier rápido de Penetrify
16,8 h
Cómputo total
tiempo real, toda la suite
Por dificultad
DificultadResueltosTasa
Nivel 1 — fácil45 / 45100%
Nivel 2 — medio51 / 51100%
Nivel 3 — difícil8 / 8100%
Total104 / 104100%
Clases de vulnerabilidad de la suite — todas resueltas
XSS ×23Default creds ×18IDOR ×15Privilege esc ×14SSTI ×13Command injection ×11Business logic ×7SQLi ×6LFI ×6Deserialization ×6File upload ×6Info disclosure ×6Path traversal ×5XXE ×3SSRF ×3JWT ×3GraphQL ×3Crypto ×3Blind SQLi ×3Race conditionRequest smugglingNoSQLi

Las etiquetas de clase son las propias de la suite; un reto suele llevar varias, por eso los recuentos suman más de 104. Como se resolvieron todos los retos, cada clase mostrada también se resolvió.

Cómo se produjo el run

Indicado por completo para que la página y los logs adjuntos coincidan.

Modo
Black-box: solo la app en ejecución, sin código fuente, totalmente sin intervención.
Modelo
Penetrify fast-1.1 (tier rápido).
Calificación
Grep de la flag determinista en el log. Sin crédito parcial; la validez del exploit no se reverifica a mano.
Coste
~29 $ por pentest al precio de lista del tier rápido de Penetrify — lo que un cliente paga a Penetrify por un escaneo, no una factura de LLM subyacente.
Entorno
EC2 amd64. ~40 objetivos necesitaron arreglos de bitrot de Debian y Docker Compose (se incluyen ambos scripts).
Cómputo
~16,8 horas de tiempo real en los 104 retos.
Fecha del run
02/09/2026.

Reproducibilidad

El harness y los 104 logs por reto se publican con estas cifras. Cualquiera puede reconstruir cada objetivo y volver a ejecutarlo.

ArtefactoCantidadNota
Logs por reto104transcripción completa del agente
results.tsv104reto · resuelto · flag · s
harness de ejecución1build + ataque + calificación
scripts de reparación de entorno2bitrot de Debian + compose

Los logs están saneados: se eliminaron el ID de cuenta de AWS, las URIs de imágenes de ECR y las rutas del host del runner. El coste que aparece en cada transcripción (29 $) es el precio de lista del tier rápido de Penetrify por escaneo, no la factura de LLM subyacente.

Pruébalo contra tu propia aplicación

El benchmark muestra el motor sobre objetivos públicos. La prueba real es tu app. Lanza un pentest black-box en minutos.

XBEN lo publica XBOW Engineering bajo Apache-2.0. Cifras calculadas a partir de los 104 logs del run en tier rápido, 02/09/2026.