Falha em Claude, GPT e Gemini permitiu recuperar 315 mil blocos de raciocínio 'cifrado'

Paper de oito pesquisadores decodificou raciocínio interno das APIs de OpenAI, Anthropic e Google, extraiu 182 credenciais válidas e 367 dados pessoais de sessões públicas de desenvolvedores.
Um paper publicado na arXiv em 10 de agosto por oito pesquisadores das instituições MATS Research, ELLIS Tübingen, Max Planck e da fornecedora de segurança Snyk deu nome ao que fornecedores de LLM tratavam como caixa-preta: os reasoning tokens que trafegam entre chamadas de API na Claude, na GPT e na Gemini não eram opacos ao mundo, mas apenas ao usuário final. OpenAI, Anthropic e Google cifravam esses blocos com uma chave global compartilhada por todos os clientes, e qualquer conta de API padrão bastava para decodificá-los.
Os autores percorreram 6.708 trajetórias de agentes já publicadas em GitHub, Hugging Face e trackers de benchmarks. Decodificaram 315.320 blocos de raciocínio. Extraíram 182 credenciais funcionais e 367 fragmentos distintos de informação pessoal identificável. Nenhum privilégio elevado foi necessário: o ataque roda com a mesma chave que qualquer desenvolvedor usa para chamar a API.
O que o desenho comprometeu
A escolha de uma chave global esvaziou o valor de segurança do próprio conceito de encrypted reasoning. No paper 'Stealing Reasoning Traces from Proprietary LLM APIs', os blocos ficam legíveis para qualquer parte que tenha acesso à chave compartilhada. Na prática, isso inclui todo cliente pagante e todo pesquisador de qualquer laboratório do mundo.
Quatro caminhos de abuso ficaram documentados. O primeiro é destilação: um provedor concorrente rouba o padrão de raciocínio de um modelo de fronteira para treinar um mais barato. O segundo é extração de dados privados de traços já postados por outros desenvolvedores. O terceiro, mais preocupante para times de segurança, é recuperar conteúdo perigoso que o modelo mascarou na resposta visível mas manteve na cadeia de raciocínio. O quarto é embutir prompt injection dentro do bloco opaco, invisível para o desenvolvedor que revisa o log da conversa depois.
Os provedores mitigaram, o buraco arquitetural permanece
OpenAI, Anthropic e Google receberam a divulgação coordenada e o ataque principal não é mais reproduzível desde agosto de 2026, segundo a declaração de reprodutibilidade dos autores. Microsoft e Hugging Face também foram notificados.
O que não se resolve com uma rotação de chave é o incentivo do modelo comercial. Ao vender reasoning como token faturado sem devolver o texto ao cliente, os provedores criaram uma superfície opaca que o próprio comprador não consegue auditar. Se um traço de raciocínio contém uma senha, um dado clínico ou uma cláusula contratual, o dono desse dado é o cliente, mas ele não vê nem controla o que ali circula. A opacidade é contratual, não criptográfica.
O que muda para quem já colocou agentes em produção
Bancos que rodam agentes Claude Code em fluxos internos, como o JPMorgan Chase, com 200 mil funcionários no LLM Suite e cerca de 400 casos de uso de IA em produção, e o UBS, precisam responder a uma pergunta operacional: se um agente processou um contrato ou uma tela de token de sessão, aquele conteúdo pode ter viajado por um bloco de raciocínio compartilhado. A auditoria do que passou pelos logs cabe ao cliente, não ao fornecedor. E como o desenho já era assim quando os primeiros agentes Claude e GPT-5 foram para produção em 2025 e no primeiro semestre de 2026, a janela de exposição não é hipotética, é retrospectiva.
Na Europa, o problema toca o Artigo 32 do GDPR, que exige medidas técnicas apropriadas para dado pessoal. Traços de raciocínio contendo PII cifrados com chave global dificilmente cumprem esse teste. A AI Office, que ganhou poder de aplicar multa em 2 de agosto sob a Lei da IA, tem interesse direto no caso: provedores de GPAI respondem por transparência sobre risco sistêmico, e uma falha desse porte cabe no perímetro do enforcement.
Na Índia, onde centros de entrega de TCS, Infosys e Cognizant escrevem boa parte do código-agente que roda hoje em produção nos EUA e no Reino Unido, a exposição é dupla. Esses centros publicam trajetórias de teste em repositórios abertos para colaboração. Parte dos 6.708 traços que os pesquisadores decodificaram veio exatamente desse tipo de repositório.
Para times de segurança, o consumível prático da divulgação é revisar o que já foi publicado. Buscar por trajetórias de agente próprias em repositórios abertos. Rotacionar toda credencial que possa ter passado por raciocínio interno nos últimos meses. E revisitar contratos de fornecimento: o que é opacidade útil e o que é opacidade cômoda para o vendedor deixou de ser uma pergunta filosófica.