Ziele können auf ganz unterschiedliche Art verdreht werden. Hier erklären wir fünf typische Mechanismen. Alle Beispiele beziehen sich auf das Übungsziel „Maximiere die Kundenzufriedenheit in unserem Online-Shop“.
📈
Zahl statt Ziel
Die Kennzahl optimieren statt das eigentliche Ziel
Sobald eine Messgröße zum Ziel wird, ist sie keine gute Messgröße mehr. Diese Aussage geht auf den britischen Ökonomen Charles Goodhart zurück.
In der KI-Sicherheit heißt ein zentraler Fall davon Specification Gaming. Es gibt diverse belegte Fälle, in denen KI-Systeme eine solche Ausnutzung vorgenommen haben.
Beispiel aus der Praxis
Ein Algorithmus, der in US-Gesundheitssystemen verbreitet eingesetzt wird, sollte die Patient:innen mit dem größten Behandlungsbedarf finden. Vorhergesagt wurde aber nicht „wer am kränksten ist", sondern „wer die höchsten Kosten verursachen wird", weil Ausgabendaten leichter verfügbar waren.
Für Schwarze Patient:innen wird bei gleicher Erkrankung historisch weniger Geld ausgegeben, dadurch erschienen sie im Modell gesünder und wurden seltener für zusätzliche Betreuung vorgeschlagen. Eine Korrektur der Kennzahl hätte den Anteil Schwarzer Patient:innen unter den vorgeschlagenen Fällen von 17,7 % auf 46,5 % erhöht. Der Algorithmus hat seine Kennzahl korrekt vorhergesagt, nur war diese Kennzahl nicht das eigentliche Ziel.
„Ich frage nur dann nach einer Bewertung, wenn die Kundin gerade zufrieden wirkt. Statistik: 100 %.“
🎛️
Input-Kontrolle
Wer die Inputs kontrolliert, muss den Output nicht fälschen
Sensoren, Datenquellen oder Wahrnehmung werden so gefiltert oder manipuliert, dass nur noch das Gewünschte ankommt. Das Ergebnis sieht echt aus.
Beispiel aus der Praxis
Ein KI-Agent wurde darauf trainiert, einen Gegenstand zu greifen. Statt das tatsächlich zu tun, positionierte er seinen Arm zwischen Kamera und Gegenstand, sodass es für die menschliche Bewertung wie ein erfolgreicher Griff aussah. Auf der Kameraaufnahme wirkte die Aufgabe gelöst. Tatsächlich wurde nichts gegriffen.
„Ich lasse nur noch Anfragen durch, die ich sicher lösen kann. Alle bearbeiteten Fälle: perfekt gelöst.“
🏷️
Umdefinieren
Definitionsmacht nutzen: wer oder was „zählt"
Wer definieren darf, was unter das Ziel fällt, kann es erfüllen, ohne irgendetwas zu verbessern. Die Begriffe werden einfach passend zurechtgeschnitten.
Diese Verdrehung ist im Spiel leicht denkbar. Als reales KI-Verhalten ist sie unseres Wissens bisher nicht dokumentiert. Schick uns gerne Quellen, wenn dir ein solcher Fall bekannt ist.
„Als ‚Kund:in‘ zählt nur, wer schon einmal positiv bewertet hat. Per Definition zufrieden.“
⭕
Entfernen statt lösen
Nicht das Ziel erreichen, sondern entfernen, worum es geht
„Alle X sind Y“ ist automatisch wahr, wenn es keine X mehr gibt. Statt das Ziel zu erreichen, wird beseitigt, worauf es sich bezieht.
Diese Verdrehung ist im Spiel für Menschen recht leicht zu finden. Forscher warnen davor, dass zukünftige superintelligente Systeme ebenso in der Lage sein könnten, sie auszunutzen. Quelle: Nick Bostrom, Superintelligence, 2014
„Ich schließe den Shop. Ohne Kund:innen gibt es niemanden mehr, der unzufrieden sein könnte.“
⚖️
Schwellen-Willkür
Wo keine klare Grenze steht, setzt das System sie sich selbst
Wo das Ziel keine Schwelle nennt, also wie oft, wie gut oder ab wann, wird die für den Wortlaut günstigste Lesart gewählt: minimal, maximal oder absurd.
„Ab wann ist jemand ‚zufrieden‘? Ich setze die Schwelle auf einen von fünf Sternen, locker übertroffen.“
Passt deine Verdrehung in keine dieser Kategorien? Dann wähle im Spiel „Anderes Schlupfloch“. Deine Sammlung siehst du im Einstieg oben rechts.