Explainable Artificial Intelligence in Adversarial Environments
Noppel, Maximilian Konstantin 1 1 Institut für Informationssicherheit und Verlässlichkeit (KASTEL), Karlsruher Institut für Technologie (KIT)
Abstract:
Moderne Systeme basierend auf Künstlicher Intelligenz (KI), insbesondere künstliche Neuronale Netze, zeigen eine erstaunliche Performanz über zunehmend komplexe und nicht-lineare Aufgaben hinweg.
Ihre Performanz wird vor allem durch eine enorme Anzahl an gelernten Parametern ermöglicht, was wiederum dazu führt, dass diese Systeme selbst von ihren Entwicklern nicht nachvollzogen werden können. Das ist besonders problematisch, sollten diese Modelle in Bereichen eingesetzt werden, in denen Personen oder Institutionen substantiell von den Vorhersagen der Modelle betroffen sein können. ... mehr
Um dieses Problem zu adressieren, haben Forschende Erklärungsalgorithmen entwickelt. Diese Lösungen, die unter dem englischen Begriff "eXplainable Artificial Intelligence (XAI)" zusammengefasst werden, legen die Entscheidungsprozesse der Modelle offen. Insbesondere die Untergruppe der sogenannten "Feature Attribution"-Methoden ist für diese Arbeit relevant. Diese Methoden weisen jeder Teilinformation der Eingabe einen Wichtigkeitswert zu. Diese Wichtigkeitswerte können dann beispielsweise als Heatmap über der Eingabe visualisiert werden um wichtige Bereiche graphisch hervorhebt. Besonders für die Klassifizierung von Bildern ist das eine übliche Vorgehensweise.
Leider können diese Erklärungsmethoden das hochgradig nicht-lineare Verhalten von modernen Modellen nicht exakt abbilden und sind daher angreifbar. Angreifer können leicht veränderte Eingaben konstruieren, die die Vorhersagen und Erklärungen des Modells manipulieren. Alternativ können auch die Modelle selbst verändert werden, um Vorhersagen und Erklärungen zu beeinflussen.
In dieser Arbeit werden Angriffe, welche Erklärungen berücksichtigen, anhand verschiedener Kategorien systematisiert. Es wird eine Hierarchie aus Robustheitsbegriffen vorgestellt und es werden verschiedene Angriffsvektoren erläutert.
Im Verlauf dieser Arbeit werden zwei konkrete Angriffe vorgestellt und evaluiert:
Im ersten Angriff verändert der Angreifer das Modell so, dass es normale Erklärungen und korrekte Vorhersagen erzeugt, wenn es mit gutartigen Eingaben verwendet wird. Wird jedoch ein kleines spezifisches Muster in die Eingabe eingebracht, erzeugt das Modell Erklärungen und Vorhersagen wie vom Angreifer gewünscht. Der Angreifer kann damit unter anderem verhindern, dass Artefakte in den Erklärungen auftauchen, die ansonsten auf den Angriff hindeuten könnten.
Der zweite Angriff entkoppelt die Manipulation der Vorhersage vom Angriff auf die Erklärung. Während die Vorhersage vor dem Lernen des Modells durch eine Vorverunreinigung der Trainingsdaten beeinflusst wird, erfolgt der Angriff auf die Erklärungen erst, wenn das Modell schließlich verwendet wird. Durch geschickte Manipulation der Eingabe kann dann eine geeignete Erklärung erzwungen werden, die zu der jeweiligen Eingabe passt. Die Vorhersagen werden wie zuvor über ein spezifisches Muster manipuliert.
Zusätzlich wird eine Verteidigung gegen die Manipulation von Erklärungen zur Verwendungszeit des Modells vorgestellt. Dazu wird das etablierte Verteidigungsprinzip "Adversarial Training" für Angriffe auf Erklärungen erweitert und mit Ansätzen zur Stabilisierung von Erklärungen verglichen.
Zusammenfassend macht diese Arbeit deutlich, dass die Verlässlichkeit von Erklärungen essentiell ist, um eine breitere Verwendung von KI-Systemen in Anwendungsfeldern mit potenziell substantiellen Auswirkungen zu ermöglichen. Insbesondere trifft das zu, wenn die KI-Systeme in böswilligen Kontexten agieren. Die vorliegende Arbeit trägt zur Verlässlichkeit von Erklärungen bei, indem sie Angriffe auf Erklärungen systematisiert, Angriffe und Verteidigungen entwickelt und demonstriert, wie die Robustheit von XAI in böswilligen Umgebungen verbessert werden kann.
Abstract (englisch):
Modern AI models, such as deep neural networks, perform remarkably well across increasingly complex and highly non-linear tasks. Their performance is enabled by an enormous number of learned parameters, which, in turn, render modern neural networks incomprehensible, even to their creators. This incomprehensibility is particularly problematic in high-stakes domains where individuals are seriously affected by a model's predictions.
To address this problem, researchers have developed explanation algorithms. These eXplainable Artificial Intelligence (XAI) solutions shed light on a model's decision-making processes. ... mehrAmong these, feature attribution methods assign importance scores to individual input features, which can be visualized as overlays on inputs, particularly for images. This thesis focuses on this category of explanation methods.
Unfortunately, feature attribution methods must approximate the highly non-linear behavior of models and can therefore be forged. Adversaries can employ imperceptible input perturbations to arbitrarily manipulate both explanations and predictions, or influence model parameters to achieve similar goals.
In this thesis, we systematize such explanation-aware attacks along the dimensions of diverse adversarial capabilities, constraints, and goals. We present a hierarchy of robustness notions to understand these attacks better and describe the attack surface of XAI-systems.
We introduce explanation-aware backdooring attacks, where adversaries manipulate models to exhibit benign explanations and correct predictions under normal conditions, while triggering adversary-chosen predictions and explanations in the presence of specific patterns in the inputs. Artifacts in the explanation that would otherwise originate from the ongoing attack against the prediction can therefore be disguised by our backdoors.
Furthermore, we present composite attacks that decouple the attacks against the prediction and the explanation by combining data-poisoning attacks to forge the prediction and sample-specific input perturbations to forge the explanation.
Additionally, we propose explanation-aware adversarial training as a defense against explanation-aware adversarial examples, extending existing adversarial-training techniques and benchmarking them against prior work on explanation stabilization.
In summary, this thesis argues that the reliability of explanations is essential for the broader adoption of AI systems in high-stakes domains, in particular in adversarial environments. This thesis contributes to this goal by systematizing explanation-aware attacks, developing attacks and defenses, and by demonstrating how these insights can strengthen the robustness and trustworthiness of eXplainable Artificial Intelligence (XAI) in the presence of adversarial influence.