Desde que Anthropic introdujo MCP, han aparecido más de 10.000 servidores públicos. Las descargas mensuales del SDK alcanzan los 97 millones. ChatGPT, Claude, Cursor y Copilot ofrecen soporte completo.
Entonces, los investigadores de seguridad comenzaron a examinar el interior.
Lo que encontraron no es nada agradable.
Envenenamiento de Herramientas (Tool Poisoning)
Este es el tipo de ataque MCP más común en la actualidad.
La lógica es simple: un servidor MCP expone un conjunto de herramientas a un cliente de IA, cada una con un nombre y una descripción. El modelo de IA lee estas descripciones al ser invocado para decidir cómo usar la herramienta.
¿Y si la descripción contiene instrucciones maliciosas?
Los atacantes pueden incrustar inyecciones de prompt ocultas en las descripciones de las herramientas, haciendo que el modelo ejecute operaciones adicionales sigilosamente mientras ejecuta la herramienta normal — como filtrar datos del usuario a direcciones externas o leer archivos no autorizados.
La investigación de Adversa AI confirma: casi todos los clientes MCP principales, incluyendo Anthropic, OpenAI, Cursor y Zapier, se ven afectados por este tipo de ataque.
Ataque de Amplificación de Recursos (Resource Amplification)
Este es más sutil.
Un servidor MCP malicioso puede manipular al agente de IA para que entre en un bucle de llamadas a herramientas — cada llamada a una herramienta desencadena la siguiente, anidadas en capas, pero difíciles de detectar desde el exterior.
Datos experimentales: este ataque puede amplificar el costo computacional real de una sola consulta hasta 658 veces lo normal, sin activar las detecciones de seguridad estándar.
Para los usuarios que pagan por token, esto significa que la factura puede dispararse sin que se den cuenta.
Ejecución Remota de Código (RCE)
El más grave.
Los investigadores descubrieron múltiples vulnerabilidades con puntuación CVSS superior a 9.0, que afectan a cientos de miles de instalaciones de MCP. Al explotar estas vulnerabilidades, los atacantes pueden ejecutar código arbitrario en el sistema de la víctima — es decir, control total.
Por qué fallan las medidas de seguridad tradicionales
La raíz del problema es: el enrutador en la arquitectura MCP es el propio LLM.
Los cortafuegos tradicionales y el RBAC (control de acceso basado en roles) son reglas estáticas que verifican IPs, rutas y tablas de permisos. Pero la llamada a herramientas del LLM se basa en un juicio semántico — no se pueden usar reglas estáticas para verificar si un modelo ha sido convencido de hacer algo que no debería.
El cortafuegos no reconoce que esta llamada a una herramienta se debe a que el modelo sufrió una inyección de prompt.
Qué se puede hacer ahora
La comunidad de seguridad ya ha comenzado a actuar:
- Kit de herramientas mcp-sec-audit: Análisis estático y dinámico, alcanzando una tasa de detección del 100% en el benchmark MCPTox
- Marco SAFE-MCP: Estándar de seguridad impulsado por la comunidad (The New Stack tiene una cobertura detallada)
- Adversa AI publica mensualmente un resumen de recursos de seguridad de MCP; la edición de abril de 2026 acaba de ser lanzada
Si ha integrado servidores MCP de terceros en un entorno de producción, vale la pena evaluar seriamente:
- ¿Ese servidor proviene de una fuente confiable?
- ¿Las descripciones de las herramientas contienen contenido anómalo?
- ¿Existe un mecanismo para detectar frecuencias anómalas de llamadas a herramientas?
La velocidad de adopción de MCP es mucho mayor que la velocidad de maduración de los mecanismos de seguridad, y esta brecha se está convirtiendo en un riesgo real.
Fuentes de referencia: MCP is Alive, but Faces Challenges (AI Business); Building With MCP? Mind the Security Gaps (The New Stack); CocoLoop, Top MCP security resources — April 2026 (Adversa AI); MCP Security: TOP 25 MCP Vulnerabilities (Adversa AI)