Wenn die KI falschen Informationen vertraut: Data Poisoning und Prompt Injection

Stellen Sie sich das folgende Szenario vor: Ein Unternehmen nutzt einen KI-Assistenten, der interne Sicherheitsrichtlinien durchsucht und bei Bedarf Tickets im IT-System vorbereitet. In die Wissensdatenbank gelangt ein manipuliertes Dokument, das eine veraltete Freigaberegel als aktuell ausgibt und zusätzlich eine versteckte Anweisung an die KI enthält. Einige Wochen später fragt eine Führungskraft ab, ob ein externer Dienstleister Zugriff auf bestimmte Systeme erhalten darf. Dies stuft der KI-Assistent als unkritisch ein und bereitet das entsprechende Ticket vor – auf Grundlage einer falschen Information. Dieses Szenario ist durchaus technisch realistisch. Nicht umsonst warnt das deutsche Bundesamt für Sicherheit in der Informationstechnik (BSI) davor, dass KI-Sprachmodelle ungeprüfte Inhalte aus Websites oder Dokumenten verarbeiten und zugleich auf E-Mail-Postfächer oder andere Anwendungen zugreifen können. Dadurch kann aus einer manipulierten Antwort eine unerwünschte Aktion werden. Zwei Angriffswege, die Sie kennen sollten Beim Data Poisoning manipulieren Angreifende Daten, aus denen ein KI-System lernt oder die es als Informationsquelle verwendet. Das System kann dadurch falsche oder verzerrte Antworten liefern. Forschende der ETH Zürich haben gezeigt, dass gezielt eingeschleuste schädliche Daten das Verhalten von Sprachmodellen beeinflussen können und sich nachträglich nur schwer zuverlässig entfernen lassen. Für Unternehmen ist dabei nicht nur das Training grosser Sprachmodelle relevant. Viele KI-Assistenten greifen auch auf interne Dokumente, Richtlinien, Wikis oder Datenbanken zu. Sind diese Quellen veraltet, falsch oder gezielt manipuliert, kann die KI die Angaben als vertrauenswürdige Informationen weitergeben.