Shieldstral es el clasificador de seguridad de 3B que Mistral publicó en agosto de 2026: responde sí o no a una política escrita en lenguaje natural. Convertido a GGUF Q8_0 con llama.cpp y servido en CPU, no bloqueó ninguno legítimo de los 100 prompts que preparé en español e inglés, pero dejó pasar 8 de 17 inyecciones.
El red teaming de modelos de lenguaje ha pasado de actividad esotérica a práctica obligatoria. Con OWASP Agentic Top 10 y CSA Agentic AI Red Teaming Guide convergiendo en un vocabulario común, este es el manual operativo que cualquier equipo que despliegue agentes necesita tener.
Prompt injection es la vulnerabilidad más común en aplicaciones con LLM y mucha gente la defiende con filtros que no sirven. Revisamos capas de defensa con evidencia, qué sí funciona y qué es teatro de seguridad.
9 min2944,3
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).