AI Shield
Toolkit de seguridad LLM, inyección directa e indirecta, memory canary, circuit breakers
v0.2 incorpora escaneo de inyección indirecta para RAG, descripciones de tools MCP, memoria almacenada y contenido web scrapeado; streams de contexto por trust-tier con fences de procedencia; memory canaries SHA-256 con detección cross-tenant; circuit breakers en runtime con tope de blast-radius y human-in-the-loop. Cero dependencias en el core, clasificador ONNX opcional como paquete hermano. 567 tests, tres rondas de code review por agentes, MIT.
Qué problema resuelve
Un asistente no puede distinguir de forma fiable una instrucción de un dato. Eso no es un fallo de un producto concreto, es una propiedad de cómo estos modelos leen su contexto, y significa que el texto que llega de una página raspada, un PDF, el resultado de una herramienta u otro agente puede convertirse en silencio en una orden. AI Shield es la capa determinista que va delante: revisa lo que entra, enmascara datos personales, mira lo que sale y hace cumplir qué herramientas pueden llamarse siquiera.
Cómo funciona
Tres capas de detección, y solo la primera es obligatoria. La cadena heurística son más de cuarenta patrones con acumulación de puntuación, rápida y determinista, y primero pliega las evasiones habituales: etiquetas unicode, leetspeak, tipoglucemia, separación de letras y paráfrasis en otro idioma. Encima puedes montar de forma opcional un clasificador ONNX y un juez asíncrono basado en modelo de lenguaje para la cobertura semántica. Alrededor de la detección están las piezas que no dependen de ningún modelo: una política de herramientas que simplemente rechaza una llamada denegada, fijación de manifiesto que nota cuando un servidor gana o pierde herramientas, un contador externo de coste, tokens canario que delatan un ataque logrado, y un registro de auditoría.
Cuándo usarlo
Úsalo como primer filtro barato delante de cualquier cosa que lea texto de fuera de tu propio sistema, y usa las partes deterministas como frontera de verdad. La política de herramientas en concreto es lo más parecido aquí a un límite de capacidades: el modelo no puede llamar a una herramienta denegada, diga lo que diga su razonamiento.
Cuándo no usarlo
Nunca como única línea. Lo dice el propio README, y merece repetirse: un filtro de patrones que vive dentro del mismo sistema de razonamiento que el ataque comparte con él la misma superficie de atención. Se le escapará una ofuscación nueva, una formulación polimórfica o una instrucción enterrada en un documento largo. La inyección indirecta por canales de aspecto fiable es el riesgo mayor, y esto revisa la entrada del usuario, no inspecciona a fondo cada documento que el agente ingiere después. Tampoco impone fronteras de confianza entre agentes que colaboran, y el análisis de salida cubre inyección y fuga, pero no toxicidad, alucinación ni sesgo. Trátalo como un filtro de spam, no como un cortafuegos.
Stars
★ 3
Forks
⑂ 3
installs
↓ 1,499
Clones (14d)
⊟ 83
Lenguaje
TypeScript
Actualizado
2026-08-21
Instalación
npx -y ai-shield-core