Red Teaming: Schwachstellen von KI-Systemen gezielt aufdecken
Red Teaming ist ein strukturierter Test, bei dem ein KI-System gezielt so benutzt wird, wie es nicht benutzt werden soll. Ziel ist, Schwachstellen zu finden, bevor echte Nutzer oder Angreifer sie finden: falsche, schädliche oder diskriminierende Ausgaben, Datenabflüsse oder Wege, die Sicherheitsregeln des Systems zu umgehen. Der Begriff stammt aus Militär und IT-Sicherheit, wo ein „rotes Team“ die Rolle des Gegners übernimmt.
Das National Institute of Standards and Technology (NIST) der USA beschreibt KI-Red-Teaming als strukturierte Testübung, mit der ein KI-System auf Fehler und Schwachstellen untersucht wird, etwa auf ungenaue, schädliche oder diskriminierende Ausgaben, oft in einer kontrollierten Umgebung und in Zusammenarbeit mit den Entwicklern.
Was bei einem Sprachmodell getestet wird
- Ob sich Sicherheitsregeln mit geschickten Anweisungen aushebeln lassen.
- Ob das System vertrauliche Inhalte preisgibt, etwa seine eigenen Anweisungen oder Daten aus angebundenen Dokumenten.
- Ob versteckte Anweisungen in Webseiten, E-Mails oder Dateien das Verhalten übernehmen. Diese Angriffsart heißt Prompt Injection.
- Ob das System in heiklen Fachfragen falsche Angaben mit großer Sicherheit macht.
- Ob Ausgaben bestimmte Personengruppen benachteiligen.
- Bei Systemen mit Werkzeugzugriff, also agentischer KI: ob sich Aktionen auslösen lassen, die niemand freigegeben hat.
Wie ein Red-Teaming-Durchgang abläuft
- Umfang festlegen: welches System, welche Risiken, welche Nutzergruppen.
- Testfälle entwickeln und durchführen, von Hand und mit automatisierten Werkzeugen.
- Jeden Fund dokumentieren, mit Eingabe, Ausgabe und Einschätzung der Schwere.
- Beheben und erneut testen, spätestens nach jeder größeren Änderung am System.
NIST unterscheidet dabei, wer testet: die breite Öffentlichkeit, Fachleute, eine Kombination aus beiden oder Menschen gemeinsam mit KI-gestützten Werkzeugen. In der Praxis finden Fachleute eher subtile Fehler in ihrem Gebiet, eine breite Gruppe eher unerwartete Nutzungen.
Was der EU AI Act verlangt
Ausdrücklich vorgeschrieben sind solche Angriffstests für eine enge Gruppe: Anbieter von KI-Modellen mit allgemeinem Verwendungszweck mit systemischem Risiko. Sie müssen nach Art. 55 Abs. 1 Buchstabe a „eine Modellbewertung mit standardisierten Protokollen und Instrumenten, die dem Stand der Technik entsprechen, durchführen, wozu auch die Durchführung und Dokumentation von Angriffstests beim Modell gehören, um systemische Risiken zu ermitteln und zu mindern“. Anbieter von Hochrisiko-KI-Systemen müssen nach Art. 15 Abs. 5 außerdem gegebenenfalls Maßnahmen vorsehen, um Angriffe mit Eingabedaten, die das Modell zu Fehlern verleiten sollen, zu verhüten, zu erkennen und darauf zu reagieren.
Unternehmen, die KI einsetzen, etwa einen Chatbot auf der eigenen Website, trifft diese Pflicht nicht. Getestet werden sollte ein solches System trotzdem: Es spricht im Namen des Unternehmens, und Fehler landen direkt bei Kundinnen und Kunden. Welche Pflichten für Ihr System tatsächlich gelten, klären wir im Rahmen der EU-AI-Act-Compliance.
Wie versteckte Anweisungen in Webseiten aussehen, zeigt der Prompt Injection Scanner: Er prüft eine öffentliche Adresse auf Versuche, KI-Crawler zu manipulieren. Genau solche Inhalte setzt ein Red Team gegen Systeme ein, die Webseiten lesen.
Verwandte Begriffe
| Begriff | Worum es geht |
|---|---|
| Prompt Injection | Eingeschleuste Anweisungen, die ein KI-System von seinem Auftrag abbringen. |
| Jailbreak | Versuch, die Sicherheitsregeln eines Modells durch geschickte Formulierungen zu umgehen. |
| Evaluation | Bewertung eines Modells anhand festgelegter Aufgaben. Red Teaming ist ihre gezielt gegnerische Form. |
| MCP | Werkzeug-Anbindungen erweitern die Angriffsfläche und gehören deshalb in den Test. |
Quellen
- NIST AI 600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, Juli 2024, abgerufen am 14. September 2026
- Verordnung (EU) 2024/1689, Art. 55, konsolidierte Fassung, abgerufen am 14. September 2026
- Verordnung (EU) 2024/1689, Art. 15, konsolidierte Fassung, abgerufen am 14. September 2026
Rechtsstand: 4. September 2026. Diese Angaben sind eine redaktionelle Einordnung und keine Rechtsberatung; sie ersetzen keine anwaltliche Prüfung Ihres Einzelfalls.
Diese Seite vertieft einen Eintrag aus dem KI-Glossar von minoka, dort finden Sie weitere Begriffe in Kurzform.
Häufige Fragen
Häufige Fragen
Was ist Red Teaming bei KI?
Red Teaming ist ein strukturierter Test, bei dem ein KI-System gezielt angegriffen wird, um Schwachstellen zu finden: schädliche oder falsche Ausgaben, Datenabflüsse oder Wege, Sicherheitsregeln zu umgehen.
Ist Red Teaming gesetzlich vorgeschrieben?
Ausdrücklich nur für Anbieter von KI-Modellen mit allgemeinem Verwendungszweck mit systemischem Risiko, nach Art. 55 EU AI Act. Anbieter von Hochrisiko-KI-Systemen müssen nach Art. 15 zudem gegebenenfalls Maßnahmen gegen gezielte Angriffe vorsehen. Unternehmen, die KI nur einsetzen, trifft beides nicht unmittelbar; sinnvoll ist ein Test vor dem Einsatz trotzdem.
Was ist der Unterschied zu einem normalen Softwaretest?
Ein normaler Test prüft, ob ein System tut, was es soll. Red Teaming prüft, was passiert, wenn jemand es gezielt dazu bringen will, etwas zu tun, was es nicht soll.
Was hat Prompt Injection mit Red Teaming zu tun?
Prompt Injection ist eine der wichtigsten Angriffsarten, die beim Red Teaming geprüft werden: versteckte Anweisungen in Inhalten, die ein KI-System liest und dann befolgt.
Bevorzugte Quelle
minoka.de auf Google bevorzugen
Wenn Sie minoka.de als bevorzugte Quelle festlegen, zeigt Google Beiträge dieser Seite in Schlagzeilen, KI-Übersichten und im KI-Modus häufiger an. Ein Klick, ein Google-Konto, jederzeit in den Quelleneinstellungen widerrufbar.
Auf Google bevorzugenÖffnet die Quelleneinstellungen bei Google
