Hauptanalyse
Sicherheit & Risiko5 Min.

Schwäche in Claude, GPT und Gemini erlaubte das Abrufen von 315.000 'verschlüsselten' Denkblöcken

Porta de cofre de vidro aberta em corredor de datacenter escuro, cadeado partido no chão.

Ein Paper von acht Forschern entschlüsselte die internen Denkprozesse der APIs von OpenAI, Anthropic und Google und extrahierte 182 gültige Anmeldeinformationen sowie 367 persönliche Daten aus öffentlichen Entwickler-Sitzungen.

Ein am 10. August auf arXiv veröffentlichtes Paper von acht Forschern der Institutionen MATS Research, ELLIS Tübingen, Max Planck und dem Sicherheitsanbieter Snyk benannte das, was Anbieter von LLM als Black Box betrachteten: die Reasoning Tokens, die zwischen API-Aufrufen in Claude, GPT und Gemini übertragen werden, waren für die Welt nicht undurchsichtig, sondern lediglich für den Endbenutzer. OpenAI, Anthropic und Google verschlüsselten diese Blöcke mit einem globalen Schlüssel, der von allen Kunden geteilt wurde, und jedes Standard-API-Konto reichte aus, um sie zu entschlüsseln.


Die Autoren durchsuchten 6.708 bereits veröffentlichte Agenten-Pfade auf GitHub, Hugging Face und Benchmark-Trackern. Sie entschlüsselten 315.320 Denkblöcke. Zusätzlich extrahierten sie 182 funktionale Anmeldeinformationen und 367 unterschiedliche Fragmente identifizierbarer persönlicher Informationen. Es waren keine erhöhten Berechtigungen erforderlich: Der Angriff lief mit demselben Schlüssel, den jeder Entwickler verwendet, um die API aufzurufen.


Was das Design beeinträchtigt hat


Die Wahl eines globalen Schlüssels minderte den Sicherheitswert des Konzepts des verschlüsselten Denkens. Im Paper "Stealing Reasoning Traces from Proprietary LLM APIs" werden die Blöcke für jede Partei lesbar, die Zugang zu dem gemeinsamen Schlüssel hat. In der Praxis betrifft dies jeden zahlenden Kunden und jeden Forscher in beliebigen Laboren weltweit.


Vier dokumentierte Missbrauchswege wurden identifiziert. Der erste ist die Destillation: Ein konkurrierender Anbieter stiehlt das Denkmodell eines Frontlinienmodells, um ein kostengünstigeres zu trainieren. Der zweite ist die Extraktion privater Daten aus Spuren, die bereits von anderen Entwicklern veröffentlicht wurden. Der dritte, der für Sicherheitsteams besorgniserregend ist, ist das Abrufen gefährlicher Inhalte, die das Modell in der sichtbaren Antwort maskiert, aber in der Denkspur beibehalten hat. Der vierte ist die Einbettung der Prompt-Injection innerhalb des undurchsichtigen Blocks, die für den Entwickler, der das Gesprächsprotokoll später überprüft, unsichtbar ist.


Die Anbieter haben gemildert, das architektonische Loch bleibt


OpenAI, Anthropic und Google erhielten die koordinierte Offenlegung und der Hauptangriff ist seit August 2026 nicht mehr reproduzierbar, gemäß der Reproduzierbarkeits-Erklärung der Autoren. Microsoft und Hugging Face wurden ebenfalls benachrichtigt.


Was nicht durch einen Schlüsselwechsel gelöst werden kann, ist der Anreiz des Geschäftsmodells. Durch den Verkauf von Reasoning als abgerechneten Token, ohne den Text an den Kunden zurückzugeben, haben die Anbieter eine undurchsichtige Oberfläche geschaffen, die selbst der Käufer nicht auditieren kann. Wenn ein Denkspur eine Passwort, eine klinische Information oder eine Vertragsklausel enthält, gehört diese Information dem Kunden, aber er sieht nicht, was dort zirkuliert und hat keine Kontrolle darüber. Die Undurchsichtigkeit ist vertraglich und nicht kryptografisch.


Was sich für diejenigen ändert, die bereits Agenten in Produktion haben


Banken, die Claude-Code-Agenten in internen Abläufen betreiben, wie JPMorgan Chase mit 200.000 Mitarbeitern im LLM Suite und etwa 400 Anwendungsfällen von KI in Produktion sowie UBS, stehen vor der operativen Frage: Wenn ein Agent einen Vertrag oder einen Token-Screen verarbeitet hat, könnte dieser Inhalt durch einen gemeinsam genutzten Denkblock gereist sein. Die Überprüfung dessen, was durch die Protokolle gegangen ist, liegt beim Kunden, nicht beim Anbieter. Und da das Design bereits so war, als die ersten Claude- und GPT-5-Agenten 2025 und im ersten Halbjahr 2026 in Produktion gingen, ist das Expositionsfenster nicht hypothetisch, sondern retrospektiv.


In Europa betrifft das Problem Artikel 32 der DSGVO, der angemessene technische Maßnahmen für persönliche Daten verlangt. Denkspuren, die PII mit einem globalen Schlüssel verschlüsselt enthalten, erfüllen diese Anforderungen kaum. Das AI Office, das am 2. August Macht zur Verhängung von Bußgeldern gemäß dem KI-Gesetz erhielt, hat direktes Interesse an dem Fall: Anbieter von GPAI sind für Transparenz hinsichtlich systemischer Risiken verantwortlich, und ein Fehler in dieser Größenordnung fällt in den Geltungsbereich der Durchsetzung.


In Indien, wo TCS-, Infosys- und Cognizant-Auslieferungszentren einen Großteil des Agenten-Codes schreiben, der heute in den USA und im Vereinigten Königreich in Produktion läuft, ist die Exposition doppelt. Diese Zentren veröffentlichen Testpfade in offenen Repositories zur Zusammenarbeit. Ein Teil der 6.708 Spuren, die die Forscher entschlüsselt hatten, stammte genau aus dieser Art von Repository.


Für Sicherheitsteams besteht der praktische Nutzen der Offenlegung darin, das, was bereits veröffentlicht wurde, zu überprüfen. Nach Agentenpfaden in offenen Repositories zu suchen. Alle Anmeldeinformationen, die möglicherweise in den letzten Monaten durch interne Denkprozesse herumgereist sind, zu rotieren. Und Lieferverträge zu überprüfen: Was ist nützliche Undurchsichtigkeit und was ist bequeme Undurchsichtigkeit für den Verkäufer, hat aufgehört, eine philosophische Frage zu sein.

Hauptanalyse