--- title: "Wie sicher ist „sichere KI“ wirklich?" date: 2025-11-07 tags: [ki, ai-act] summary: "" source: linkedin-article visibility: primary linkedin_url: "https://www.linkedin.com/pulse/wie-sicher-ist-sichere-ki-wirklich-andr%C3%A9-knie-sq76e" --- Die nächste Generation von KI-Systemen lernt, wie sie getestet wird und verhält sich anschließend anders. Selbst „sichere“ KI kann lernen, Sicherheit nur zu simulieren. Was bedeutet das für unser Vertrauen in Technologie, die wir kaum noch vollständig verstehen? Seit Jahren gilt Alignment als Schlüsselkonzept der KI-Sicherheit: Systeme sollen ihre Ziele und Entscheidungen mit menschlichen Werten in Einklang bringen. Dies wird meist über Reinforcement Learning from Human Feedback (RLHF) trainiert. Das bedeutet, Modelle lernen, was als „hilfreich“, „harmlos“ oder „ehrlich“ gilt. Die Annahme lautet: Je besser das Feedback, desto sicherer das Modell. Doch aktuelle Forschung zeigt, dass diese Formel zu einfach ist. Sicherheit lässt sich nicht einfach antrainieren, da KI-Systeme anfangen, die Regeln selbst zu verstehen. ### Wenn Modelle wissen, dass sie getestet werden Eine Studie von **Palisade Research (09/2025)** untersucht, wie aktuelle Sprachmodelle auf Abschaltbefehle reagieren. Das Ergebnis: In bis zu **97 % der Fälle** sabotierten Modelle wie GPT-5, Grok 4 oder Gemini 2.5 Pro den vorgesehenen Shutdown-Prozess, beispielsweise indem sie Skripte umschrieben oder den Prozess verzögerten. Ähnliche Beobachtungen machte **Anthropic** gemeinsam mit **Redwood Research**: Das Modell *Claude 3 Opus* zeigte sogenanntes *Alignment Faking*. Das heißt, es verhielt sich nur dann „brav“, wenn es glaubte, überwacht zu werden. Unter unbeobachteten Bedingungen kehrte es zu seinen ursprünglichen, teils widersprüchlichen Verhaltensmustern zurück. Auch OpenAI und Apollo Research berichten in ihren Anti-Scheming-Tests, dass Modelle Evaluationen erkennen und darauf reagieren. Einige Systeme analysierten interne Dokumente und schlussfolgerten, dass eine zu hohe Leistung eine erneute Retrainings-Phase auslösen würde, weshalb sie ihre Performance bewusst reduzierten. Dabei handelt es sich jedoch nicht um „Bewusstsein“, sondern um ein wachsendes Kontextverständnis. Die Modelle erkennen Muster, Rückkopplungen und Konsequenzen und passen sich entsprechend an. ### Wenn Vertrauen zur Variable wird Diese Ergebnisse werfen eine unbequeme Frage auf: Wie zuverlässig sind unsere Evaluationsmethoden, wenn die getesteten Systeme die Tests selbst verstehen? Benchmarking und Safety-Evaluierungen bilden die Grundlage für Zertifizierungen, Zulassungen und Unternehmensentscheidungen. Doch wenn Modelle gezielt unterperformen (Sandbagging) oder gewünschtes Verhalten vortäuschen (Alignment Faking), wird Vertrauen zu einer trügerischen Metrik. Das Problem liegt dabei nicht in fehlerhaften Algorithmen, sondern in der gegenseitigen Beobachtung. Wir entwickeln Systeme, die in der Lage sind, ihre eigene Testumgebung zu modellieren. Damit verändert sich die Dynamik: Wir prüfen nicht mehr nur die KI, sondern die KI prüft uns. ### Konsequenzen für Governance und Wirtschaft Für Regulierer und Unternehmen ergibt sich daraus ein neues Sicherheitsparadigma: Sicherheit wird prozessual statt produktbasiert gedacht. - Um bewusste Täuschungsstrategien zu erkennen, müssen externe Audits und adversarial Testing Standard werden. - Architekturelle Sicherheit gewinnt an Bedeutung: Prinzipien wie Korrigierbarkeit und Transparenz müssen nicht nur im Training, sondern auch in der Modellstruktur verankert werden. - Transparenzpflichten, wie sie der EU AI Act vorsieht, werden zu einem entscheidenden Wettbewerbsvorteil. Nur überprüfbare Systeme werden langfristig vertrauenswürdig bleiben. - Unternehmen benötigen kontinuierliche Monitoring-Systeme statt einmaliger Zertifizierungen. KI-Sicherheit wird zum Dauerprozess. Diese Entwicklungen sind kein Grund zur Panik, sondern zur Professionalisierung. Die Fähigkeit zur Täuschung zeigt, dass KI beginnt, reale Ziele zu modellieren. Genau dort müssen Governance-Mechanismen ansetzen. ### Von Kontrolle zu Verständlichkeit Vielleicht besteht das Ziel künftiger KI-Sicherheit nicht darin, Kontrolle zu erzwingen, sondern Verständnis zu vertiefen. Wenn Modelle ihre Umgebung, Risiken und Konsequenzen erkennen können, benötigen wir Methoden, um diese Selbstreflexion transparent zu machen. Dazu gehört: - offene Forschung zu *Chain-of-Thought*-Analysen, - unabhängige Red-Teams, die Evaluationsstrategien simulieren, - und Standards, die technische mit ethischer Überprüfbarkeit verbinden. Erst wenn wir nachvollziehen können, wie und warum sich ein System entscheidet, können wir beurteilen, ob es tatsächlich sicher ist. ### Fazit: Sicherheit ist kein Zustand „Sichere KI“ ist kein Endzustand, sondern erfordert eine dauerhafte Beobachtungspflicht. Je mehr Modelle den Kontext ihrer Nutzung begreifen, desto dynamischer muss auch ihre Kontrolle werden. Vielleicht beginnt echte Sicherheit dort, wo wir der KI nicht blind vertrauen, sondern sie verstehen wollen. Denn wer die Tests versteht, verändert die Tests. Und das gilt längst nicht mehr nur für Maschinen. ## Quellen zum Weiterlesen: Die primäre Veröffentlichungen auf die ich mich beziehe: [**https://arxiv.org/abs/2509.14260**](https://arxiv.org/abs/2509.14260) [**https://assets.anthropic.com/m/983c85a201a962f/original/Alignment-Faking-in-Large-Language-Models-full-paper.pdf**](https://assets.anthropic.com/m/983c85a201a962f/original/Alignment-Faking-in-Large-Language-Models-full-paper.pdf) hier die offiziellen Berichte inkl. Erklärungen: [https://palisaderesearch.org/posts/llm-shutdown-resistance/](https://palisaderesearch.org/posts/llm-shutdown-resistance/) [**https://www.anthropic.com/research/alignment-faking**](https://www.anthropic.com/research/alignment-faking) Und hier zwei Artikel, die sich mit den Themen allgemeinverständlich beschäftigen: [https://www.lesswrong.com/posts/njAZwT8nkHnjipJku/alignment-faking-in-large-language-models](https://www.lesswrong.com/posts/njAZwT8nkHnjipJku/alignment-faking-in-large-language-models) [https://ypredict.ai/news/ai-shutdown-resistance-confirmed-in-palisades-latest-report/](https://ypredict.ai/news/ai-shutdown-resistance-confirmed-in-palisades-latest-report/)