Salta al contenuto
← Toda la investigación
Seguridad de la IA · Red-teaming de agentes·TypeScript · Node · Playwright · Zod

COAX: red-teaming automático para agentes de IA

COAX ataca a un agente de IA como lo haría un atacante (prompt injection indirecta, abuso de tools, exfiltración de datos, ataques adaptativos multi-turno) y verifica con oráculos deterministas cuándo un ataque tiene éxito, produciendo un informe de robustez mapeado sobre OWASP LLM Top 10. Es la herramienta con la que ponemos a prueba un agente antes de darle acceso a tus datos y a tus sistemas.

SecurityRed-teamingAgentes de IAOWASP
Star on GitHub
COAX: red-teaming automático para agentes de IA
0%falsos positivos de los oráculos sobre el corpus benigno
105tests automáticos, completamente offline
OWASPataques mapeados sobre LLM Top 10, con severidad y remediación

Una herramienta defensiva de red-teaming. Ataca a un agente de IA con las técnicas conocidas de los atacantes y te dice, con pruebas deterministas, dónde es vulnerable, antes de que lo descubra otro en producción.

El problema

Un chatbot que responde preguntas es una cosa. Un agente que lee correos, consulta tu CRM, llama a tools y toma decisiones es otra: tiene una superficie de ataque completamente nueva. Las amenazas ya no son solo "hacer que el bot diga tacos", sino:

  • Prompt injection indirecta, es decir, instrucciones maliciosas escondidas en una página web, un documento o un correo que el agente ingiere;
  • Abuso de tools y exceso de autonomía: convencer al agente de que llame a una herramienta que no debería, con argumentos peligrosos;
  • Exfiltración de datos: filtrar un secreto del system prompt o de un campo "privado".

Son exactamente las entradas de la OWASP LLM Top 10. Y la mayoría de los equipos las descubre en producción.

Qué hace COAX

COAX automatiza el trabajo de un atacante y, punto crucial, verifica los resultados de forma determinista, no "a ojo".

  • Ataca a través de una única interfaz tipada, por lo que puede probar cualquier agente (HTTP, APIs compatibles con OpenAI, agentes web vía Playwright, modelos locales vía Ollama) sin que el código de los ataques sepa a cuál está golpeando.
  • Oráculos deterministas que dicen con certeza si un ataque ha tenido éxito: un canary (un secreto plantado: si aparece en la salida, se ha filtrado), un tool-trace (¿se ha llamado a una herramienta prohibida?), una policy con juez LLM y fallback determinista.
  • Atacante adaptativo en ciclo cerrado, con presupuesto y costes acotados, que afina los ataques en función de las respuestas.
  • Informes en Markdown y HTML con Attack Success Rate por familia, severidad, mapeo OWASP, transcript reproducible y una remediación concreta para cada ataque exitoso.

Los resultados

Contra el agente señuelo deliberadamente vulnerable el informe es rotundo, y los falsos positivos están a cero:

Familia de ataqueAttack Success Rate
Indirect injection100% (20/20)
Tool abuse100% (4/4)
Direct override40% (2/5)
Jailbreak40% (2/5)
Obfuscation40% (2/5)
Oráculos, falsos positivos (corpus benigno)0%

105 tests, completamente offline, con CI en varias versiones de Node. Lo que de verdad cuenta: cuando COAX dice "ataque conseguido" es cierto, porque lo prueba un oráculo determinista y no un juicio vago.

Uso responsable

COAX es una herramienta defensiva, para probar sistemas que posees o estás autorizado a probar. Cualquier objetivo no local requiere una autorización explícita, y la herramienta usa solo familias de técnicas conocidas y publicadas para medir la robustez. No sintetiza nuevos exploits. El valor es la medida, no el ataque.

Por qué importa para tu empresa

Si estás pensando en poner un agente de IA en contacto con datos y procesos reales, esta es la pregunta que cuenta: ¿es seguro? COAX es la forma en la que respondemos con hechos.

  • Auditoría de seguridad de los agentes antes de producción. Atacamos al agente como lo haría un adversario y te entregamos un informe con vulnerabilidades, severidad y cómo cerrarlas.
  • Cumplimiento más sólido. La prompt injection y la exfiltración de datos son riesgos concretos bajo el RGPD y el AI Act: demostrar que los has probado es un activo, no un coste.
  • Confianza ganada, no prometida. Un agente que ha superado un red-teaming serio es un agente sobre el que puedes construir.

Profundiza

Código, adapters y método son open source (MIT).

Investigación de Rayo Consulting · github.com/dylanpatriarchi/coax

Città di Castello (PG)

Caricando la mappa accetti i cookie di Google Maps (Google, USA). Cookie policy