Tencent AI-Infra-Guard: red teaming de agentes IA

En pocas palabras: Tencent liberó AI-Infra-Guard como open source el 30 de junio de 2026: un framework de su Zhuque Lab para hacer red teaming a agentes de IA en cuatro capas (infraestructura, protocolo MCP, comportamiento y modelo), con más de 1.400 reglas de vulnerabilidad.

Tencent liberó AI-Infra-Guard el 30 de junio de 2026, un framework open source de su Zhuque Lab para hacer red teaming a agentes de IA por capas. Escanea infraestructura, protocolo MCP, comportamiento del agente y modelo con más de 1.400 reglas de vulnerabilidad, y es el primero en auditar la cadena de suministro de agentes.

La seguridad de agentes con Tencent AI-Infra-Guard arranca de una idea concreta: la superficie de ataque de un agente moderno no es plana. AI-Infra-Guard es un framework open source de Tencent Zhuque Lab que audita agentes de IA en cuatro capas (infraestructura, protocolo/herramienta, comportamiento del agente y modelo LLM), aplicando un método de testeo distinto a cada una. Se publicó el 30 de junio de 2026 y apareció en HuggingFace Daily Papers el 6 de julio.

En 30 segundos

  • Qué es: framework open source de Tencent Zhuque Lab para red teaming de agentes de IA, lanzado el 30 de junio de 2026.
  • La idea clave: la superficie de ataque está estratificada en 4 capas (infra, protocolo/MCP, agente, modelo) y cada una necesita su propio paradigma de testeo.
  • Números: 75+ componentes de IA cubiertos, 1.400+ reglas de vulnerabilidad, 26+ operadores de jailbreak sobre 16 datasets.
  • Lo inédito: según el paper, es el único open source que audita la cadena de suministro de agent skills además del modelo.
  • Contexto: una advisory de la NSA de mayo de 2026 documentó CVE-2025-49596, un RCE en el toolchain de MCP-Inspector.

¿Por qué Tencent liberó AI-Infra-Guard justo ahora?

Porque la infraestructura de IA abierta creció más rápido que las herramientas para defenderla. Esa es la tesis explícita del reporte técnico de AI-Infra-Guard: motores de serving, plataformas de agentes, el ecosistema del Model Context Protocol y los propios modelos se multiplicaron, y el tooling de seguridad quedó atrás.

Ponele que armás un agente que conecta un LLM con tu base de datos, tu CRM y tres herramientas externas vía MCP. Lo probás en local, anda bárbaro, lo mandás a producción y recién ahí descubrís que una de esas herramientas puede inyectar instrucciones en el contexto del modelo. El agujero no estaba en el modelo ni en tu código: estaba en el pegamento. Ya lo cubrimos antes en al evaluar tu infraestructura.

El equipo de Zhuque Lab (Yong Yang, Xing Zheng y otros, según el paper) partió de ahí. Un escáner tradicional mira una capa. Un agente vive en cuatro.

¿Cómo divide AI-Infra-Guard la superficie de ataque en capas?

AI-Infra-Guard asigna un paradigma de detección distinto a cada capa del agente, porque ningún método único sirve para todas. Esto es lo que lo diferencia de correr un solo scanner genérico y rezar.

  • Infraestructura: reglas determinísticas sobre 75+ componentes de IA y 1.400+ reglas de vulnerabilidad. Acá se busca la config mal puesta, la versión con CVE, el puerto abierto.
  • Protocolo y herramientas (MCP): auditoría agéntica con LLM sobre servidores MCP y paquetes de agent skills. La máquina razona sobre qué puede hacer una herramienta, no solo si matchea una firma.
  • Comportamiento del agente: red teaming black-box multi-turno. Se ataca al agente en conversación, como lo haría un adversario real.
  • Modelo LLM: un harness de jailbreak con 26+ operadores de ataque sobre 16 datasets.

La lógica es que un bug de infra, más una vuln en MCP, más una debilidad de prompt se pueden encadenar. Cada pieza suelta parece inofensiva. Juntas, no. Cubrimos ese tema en detalle en tus pipelines de integración continua.

¿Qué vulnerabilidades del MCP detecta?

Las que ya se están viendo en producción: inyección de prompts, envenenamiento de herramientas (tool poisoning) y ejecución remota de código en el toolchain que rodea a MCP. El Model Context Protocol es el estándar abierto que Anthropic presentó en 2024 y que después adoptaron OpenAI, Google DeepMind y decenas de proveedores de tooling. Hoy es el tejido conectivo de casi cualquier despliegue agéntico serio, y ahí está el problema.

Investigadores de seguridad confirmaron en abril de 2025 que MCP arrastra varias vulnerabilidades abiertas, entre ellas inyección de prompts y ataques de tool-poisoning que dejan que contenido malicioso secuestre el comportamiento del agente a través de interacciones de herramienta normales. No hace falta romper nada raro: alcanza con que una herramienta “de confianza” devuelva algo que no debería.

El caso más duro documentado hasta ahora: según la advisory de la NSA publicada en mayo de 2026, el CVE-2025-49596 es una falla de ejecución remota de código en el toolchain de MCP-Inspector. La misma advisory describe el semantic tool-poisoning como sistémico y no aislado. ¿Alguien lo habría cazado con un scan de una sola capa? No: vivía en el borde entre herramienta y agente.

AI-Infra-Guard vs otras herramientas de red teaming

La diferencia grande es de alcance. La mayoría de los frameworks open source de red teaming se enfocan en el modelo (jailbreaks, prompts adversariales) y no tocan ni la infra ni el protocolo. AI-Infra-Guard cubre las cuatro capas y, según su paper, es el único que además audita la cadena de suministro de agent skills. Más contexto en entre las soluciones de CI/CD.

AspectoAI-Infra-GuardHerramientas centradas en el modelo
Capas cubiertas4 (infra, MCP, agente, modelo)1 (modelo)
MétodoReglas + auditoría LLM + black-boxPrompts adversariales / jailbreak
Reglas de vuln1.400+ sobre 75+ componentesFoco en el LLM
Operadores de jailbreak26+ sobre 16 datasetsVariable
Audita cadena de suministro (skills/MCP)Por lo general no
LicenciaOpen sourceDepende del proyecto
tencent ai-infra-guard diagrama explicativo

Tomá la tabla con pinzas en una cosa: los números duros son los de AI-Infra-Guard, publicados por Tencent. La columna de la derecha es una generalización de categoría, no una medición cabeza a cabeza. Si vas a elegir herramienta, probá las dos contra tu stack real.

¿Cómo instalar y correr AI-Infra-Guard en Docker?

El proyecto vive en GitHub bajo la organización Tencent, y el flujo típico es clonar el repo y levantar el escáner sobre tu agente. El detalle exacto de comandos y flags conviene sacarlo del README oficial, que es la fuente que se mantiene actualizada (y no algo que convenga que yo te tipee de memoria y salga mal).

Un par de cosas prácticas antes de arrancar:

  • Aislá el target: corré el escaneo contra un agente en un entorno de staging, no directo contra producción la primera vez.
  • Contenedores: si vas a testear infra dockerizada, revisá primero la config de tus contenedores. Un agente que corre con más privilegios de los que necesita es media vulnerabilidad ya servida.
  • Dónde lo alojás: si necesitás un VPS o cloud para levantar el entorno de pruebas sin exponer tu red interna, tenés opciones locales como donweb.com para armar el sandbox.

Qué está confirmado y qué no

Confirmado (por el paper y la cobertura): fecha de lanzamiento 30 de junio de 2026, autoría de Tencent Zhuque Lab, arquitectura de 4 capas, los números de 1.400+ reglas, 75+ componentes, 26+ operadores y 16 datasets, y la existencia del CVE-2025-49596 en la advisory de la NSA de mayo de 2026.

Pendiente de verificación independiente: qué tan buena es la detección real fuera de los benchmarks del propio fabricante. Los números salen de Tencent. Todavía no hay, que se sepa, una evaluación de terceros que ponga tasas de falsos positivos y falsos negativos sobre la mesa. Habría que ver. Sobre eso hablamos en ejecutar agentes sin API externa.

Errores comunes al asegurar agentes de IA

  • Testear solo el modelo: mucha gente corre jailbreaks contra el LLM y se queda tranquila. El agujero suele estar en MCP o en la infra, no en el prompt. Auditá las cuatro capas.
  • Confiar en las herramientas MCP por defecto: asumir que un servidor MCP externo es benigno es el camino directo al tool poisoning. Tratá cada herramienta como código no confiable.
  • Ignorar la cadena de suministro de skills: las agent skills que extienden tu agente son código de terceros. Si no las auditás, estás importando la seguridad de otro sin leer la letra chica.
  • Dejar el red teaming para el final: probar recién antes de salir a producción es cuando ya no queda tiempo de arreglar nada. Metelo en el pipeline temprano.

Preguntas Frecuentes

¿Qué es AI-Infra-Guard y para qué sirve?

AI-Infra-Guard es un framework open source de Tencent Zhuque Lab para hacer red teaming a agentes de IA. Sirve para detectar vulnerabilidades en cuatro capas (infraestructura, protocolo MCP, comportamiento del agente y modelo LLM) antes de que el agente llegue a producción. Se lanzó el 30 de junio de 2026.

¿Cómo detecta vulnerabilidades en agentes de IA?

Usa un paradigma distinto por capa. En infraestructura aplica reglas determinísticas (1.400+ reglas sobre 75+ componentes); en MCP hace auditoría agéntica con LLM; en el agente corre red teaming black-box multi-turno; y en el modelo aplica un harness de jailbreak con 26+ operadores sobre 16 datasets.

¿Cuál es la vulnerabilidad más grave del MCP hasta ahora?

El CVE-2025-49596, una falla de ejecución remota de código en el toolchain de MCP-Inspector, documentada por una advisory de la NSA en mayo de 2026. Junto a ella, el semantic tool-poisoning aparece descrito como sistémico y no aislado, que deja que herramientas maliciosas manipulen el comportamiento del agente.

¿AI-Infra-Guard es gratis?

Sí, es open source y está publicado en GitHub bajo la organización Tencent. Podés clonarlo y usarlo sin costo de licencia. El gasto real está en el entorno donde lo corras y en las APIs de LLM que uses para la auditoría agéntica.

¿En qué se diferencia de otros frameworks de red teaming?

La mayoría cubre solo el modelo. AI-Infra-Guard cubre las cuatro capas del agente y, según su paper técnico, es el único open source que además audita la cadena de suministro de agent skills y servidores MCP. Esa cobertura de cadena completa es su diferencial.

Conclusión

Lo que cambió con AI-Infra-Guard es el enfoque: dejar de tratar al agente como una caja y empezar a auditarlo por capas. Si estás poniendo agentes en producción con MCP de por medio, hoy tenés un framework gratis que mira donde los scanners de siempre no miran, que es el borde entre herramienta y modelo.

El consejo práctico es simple. Bajá el repo, corré un escaneo contra tu agente en staging y prestá atención a la capa de protocolo, que es donde vive el CVE-2025-49596. Y no te cases con los números del fabricante: medí en tu propio stack. La foto oficial es buena, pero la verificación independiente todavía está pendiente.

Fuentes

Te puede interesar...