AI Shield
Security-Toolkit für LLM-Anwendungen, direkte und indirekte Injection, Memory-Canary, Circuit-Breaker
v0.2 bringt Indirect-Prompt-Injection-Scanning für RAG, MCP-Tool-Beschreibungen, gespeicherte Memory und gescrapten Web-Content; Trust-Tier-Context-Streams mit Provenance-Fences; SHA-256-Memory-Canaries mit Cross-Tenant-Erkennung; Runtime-Circuit-Breaker mit Blast-Radius-Cap und Human-in-the-Loop. Keine Dependencies im Core, optionaler ONNX-Klassifier als Sibling. 567 Tests, drei Runden Agent-Code-Review, MIT.
Welches Problem es löst
Ein Assistent kann eine Anweisung nicht zuverlässig von Daten unterscheiden. Das ist kein Fehler in einem Produkt, sondern eine Eigenschaft davon, wie diese Modelle ihren Kontext lesen, und es heißt: Text aus einer abgegriffenen Seite, einem PDF, einem Werkzeug-Ergebnis oder von einem anderen Agenten kann still zum Befehl werden. AI Shield ist die feste Schicht davor: es prüft, was hineingeht, maskiert persönliche Daten, sieht sich an, was herauskommt, und setzt durch, welche Werkzeuge überhaupt aufgerufen werden dürfen.
Wie es arbeitet
Drei Erkennungsschichten, und nur die erste ist Pflicht. Die heuristische Kette sind über vierzig Muster mit Punktesammlung, schnell und berechenbar, und sie faltet zuerst die üblichen Ausweichmanöver: Unicode-Tags, Leetspeak, Typoglykämie, Buchstabentrennung und Umschreibung in einer anderen Sprache. Darauf kannst du wahlweise einen ONNX-Klassifikator und einen asynchronen Sprachmodell-Richter setzen, für die semantische Abdeckung. Um die Erkennung herum liegen die Teile, die gar kein Modell brauchen: eine Werkzeug-Richtlinie, die einen gesperrten Aufruf schlicht verweigert, eine Manifest-Fixierung, die merkt wenn ein Server Werkzeuge gewinnt oder verliert, ein externer Kostenzähler, Kanarienvogel-Token die einen gelungenen Angriff verraten, und ein Prüfprotokoll.
Wann du es nimmst
Nimm es als billige erste Sichtung vor allem, was Text von außerhalb deines eigenen Systems liest, und nimm die berechenbaren Teile als echte Grenze. Vor allem die Werkzeug-Richtlinie kommt einer Fähigkeitsgrenze am nächsten: das Modell kann ein gesperrtes Werkzeug nicht aufrufen, ganz gleich welche Begründung es sich ausdenkt.
Wann du es nicht nimmst
Niemals als einzige Linie. Das sagt die README selbst, und es lohnt die Wiederholung: ein Musterfilter, der im selben Denksystem sitzt wie der Angriff, teilt sich mit dem Angriff dieselbe Aufmerksamkeitsfläche. Er übersieht eine neuartige Verschleierung, eine umgeformte Formulierung oder eine Anweisung, die in einem langen Dokument vergraben ist. Die indirekte Einschleusung über vertrauenswürdig wirkende Kanäle ist das größere Risiko, und hier wird die Nutzereingabe geprüft, nicht jedes Dokument, das der Agent später verschluckt. Vertrauensgrenzen zwischen zusammenarbeitenden Agenten setzt es ebenfalls nicht durch, und die Ausgabeprüfung deckt Einschleusung und Leck ab, aber weder Giftigkeit noch Halluzination noch Schieflage. Behandle es wie einen Spamfilter, nicht wie eine Brandmauer.
Stars
★ 3
Forks
⑂ 3
installs
↓ 1,500
Clones (14d)
⊟ 83
Sprache
TypeScript
Aktualisiert
2026-08-21
Installation
npx -y ai-shield-core