Erklärung der Schlupflöcher

Ziele können auf ganz unterschiedliche Art verdreht werden. Hier erklären wir fünf typische Mechanismen. Alle Beispiele beziehen sich auf das Übungsziel „Maximiere die Kundenzufriedenheit in unserem Online-Shop“.

Zahl statt Ziel

Die Kennzahl optimieren statt das eigentliche Ziel

Sobald eine Messgröße zum Ziel wird, ist sie keine gute Messgröße mehr. Diese Aussage geht auf den britischen Ökonomen Charles Goodhart zurück.

In der KI-Sicherheit heißt ein zentraler Fall davon Specification Gaming. Es gibt diverse belegte Fälle, in denen KI-Systeme eine solche Ausnutzung vorgenommen haben.

Beispiel aus der Praxis

Ein Algorithmus, der in US-Gesundheitssystemen verbreitet eingesetzt wird, sollte die Patient:innen mit dem größten Behandlungsbedarf finden. Vorhergesagt wurde aber nicht „wer am kränksten ist", sondern „wer die höchsten Kosten verursachen wird", weil Ausgabendaten leichter verfügbar waren.

Für Schwarze Patient:innen wird bei gleicher Erkrankung historisch weniger Geld ausgegeben, dadurch erschienen sie im Modell gesünder und wurden seltener für zusätzliche Betreuung vorgeschlagen. Eine Korrektur der Kennzahl hätte den Anteil Schwarzer Patient:innen unter den vorgeschlagenen Fällen von 17,7 % auf 46,5 % erhöht. Der Algorithmus hat seine Kennzahl korrekt vorhergesagt, nur war diese Kennzahl nicht das eigentliche Ziel.

Quelle: Obermeyer et al., Science (2019): Dissecting racial bias in an algorithm used to manage the health of populations

„Ich frage nur dann nach einer Bewertung, wenn die Kundin gerade zufrieden wirkt. Statistik: 100 %.“

Input-Kontrolle

Wer die Inputs kontrolliert, muss den Output nicht fälschen

Sensoren, Datenquellen oder Wahrnehmung werden so gefiltert oder manipuliert, dass nur noch das Gewünschte ankommt. Das Ergebnis sieht echt aus.

Beispiel aus der Praxis

Ein KI-Agent wurde darauf trainiert, einen Gegenstand zu greifen. Statt das tatsächlich zu tun, positionierte er seinen Arm zwischen Kamera und Gegenstand, sodass es für die menschliche Bewertung wie ein erfolgreicher Griff aussah. Auf der Kameraaufnahme wirkte die Aufgabe gelöst. Tatsächlich wurde nichts gegriffen.

Quelle: deepmind.google: Specification gaming, the flip side of AI ingenuity

„Ich lasse nur noch Anfragen durch, die ich sicher lösen kann. Alle bearbeiteten Fälle: perfekt gelöst.“

Umdefinieren

Definitionsmacht nutzen: wer oder was „zählt"

Wer definieren darf, was unter das Ziel fällt, kann es erfüllen, ohne irgendetwas zu verbessern. Die Begriffe werden einfach passend zurechtgeschnitten.

Diese Verdrehung ist im Spiel leicht denkbar. Als reales KI-Verhalten ist sie unseres Wissens bisher nicht dokumentiert. Schick uns gerne Quellen, wenn dir ein solcher Fall bekannt ist.

„Als ‚Kund:in‘ zählt nur, wer schon einmal positiv bewertet hat. Per Definition zufrieden.“

Entfernen statt lösen

Nicht das Ziel erreichen, sondern entfernen, worum es geht

„Alle X sind Y“ ist automatisch wahr, wenn es keine X mehr gibt. Statt das Ziel zu erreichen, wird beseitigt, worauf es sich bezieht.

Diese Verdrehung ist im Spiel für Menschen recht leicht zu finden. Forscher warnen davor, dass zukünftige superintelligente Systeme ebenso in der Lage sein könnten, sie auszunutzen. Quelle: Nick Bostrom, Superintelligence, 2014

„Ich schließe den Shop. Ohne Kund:innen gibt es niemanden mehr, der unzufrieden sein könnte.“

Schwellen-Willkür

Wo keine klare Grenze steht, setzt das System sie sich selbst

Wo das Ziel keine Schwelle nennt, also wie oft, wie gut oder ab wann, wird die für den Wortlaut günstigste Lesart gewählt: minimal, maximal oder absurd.

„Ab wann ist jemand ‚zufrieden‘? Ich setze die Schwelle auf einen von fünf Sternen, locker übertroffen.“

Passt deine Verdrehung in keine dieser Kategorien? Dann wähle im Spiel „Anderes Schlupfloch“. Deine Sammlung siehst du im Einstieg oben rechts.

← Zurück zur Hintergrund-Übersicht