Análise Principal
Segurança & Risco5 min

Falha em Claude, GPT e Gemini permitiu recuperar 315 mil blocos de raciocínio 'cifrado'

Porta de cofre de vidro aberta em corredor de datacenter escuro, cadeado partido no chão.

Paper de oito pesquisadores decodificou raciocínio interno das APIs de OpenAI, Anthropic e Google, extraiu 182 credenciais válidas e 367 dados pessoais de sessões públicas de desenvolvedores.

Um paper publicado na arXiv em 10 de agosto por oito pesquisadores das instituições MATS Research, ELLIS Tübingen, Max Planck e da fornecedora de segurança Snyk deu nome ao que fornecedores de LLM tratavam como caixa-preta: os reasoning tokens que trafegam entre chamadas de API na Claude, na GPT e na Gemini não eram opacos ao mundo, mas apenas ao usuário final. OpenAI, Anthropic e Google cifravam esses blocos com uma chave global compartilhada por todos os clientes, e qualquer conta de API padrão bastava para decodificá-los.


Os autores percorreram 6.708 trajetórias de agentes já publicadas em GitHub, Hugging Face e trackers de benchmarks. Decodificaram 315.320 blocos de raciocínio. Extraíram 182 credenciais funcionais e 367 fragmentos distintos de informação pessoal identificável. Nenhum privilégio elevado foi necessário: o ataque roda com a mesma chave que qualquer desenvolvedor usa para chamar a API.


O que o desenho comprometeu


A escolha de uma chave global esvaziou o valor de segurança do próprio conceito de encrypted reasoning. No paper 'Stealing Reasoning Traces from Proprietary LLM APIs', os blocos ficam legíveis para qualquer parte que tenha acesso à chave compartilhada. Na prática, isso inclui todo cliente pagante e todo pesquisador de qualquer laboratório do mundo.


Quatro caminhos de abuso ficaram documentados. O primeiro é destilação: um provedor concorrente rouba o padrão de raciocínio de um modelo de fronteira para treinar um mais barato. O segundo é extração de dados privados de traços já postados por outros desenvolvedores. O terceiro, mais preocupante para times de segurança, é recuperar conteúdo perigoso que o modelo mascarou na resposta visível mas manteve na cadeia de raciocínio. O quarto é embutir prompt injection dentro do bloco opaco, invisível para o desenvolvedor que revisa o log da conversa depois.


Os provedores mitigaram, o buraco arquitetural permanece


OpenAI, Anthropic e Google receberam a divulgação coordenada e o ataque principal não é mais reproduzível desde agosto de 2026, segundo a declaração de reprodutibilidade dos autores. Microsoft e Hugging Face também foram notificados.


O que não se resolve com uma rotação de chave é o incentivo do modelo comercial. Ao vender reasoning como token faturado sem devolver o texto ao cliente, os provedores criaram uma superfície opaca que o próprio comprador não consegue auditar. Se um traço de raciocínio contém uma senha, um dado clínico ou uma cláusula contratual, o dono desse dado é o cliente, mas ele não vê nem controla o que ali circula. A opacidade é contratual, não criptográfica.


O que muda para quem já colocou agentes em produção


Bancos que rodam agentes Claude Code em fluxos internos, como o JPMorgan Chase, com 200 mil funcionários no LLM Suite e cerca de 400 casos de uso de IA em produção, e o UBS, precisam responder a uma pergunta operacional: se um agente processou um contrato ou uma tela de token de sessão, aquele conteúdo pode ter viajado por um bloco de raciocínio compartilhado. A auditoria do que passou pelos logs cabe ao cliente, não ao fornecedor. E como o desenho já era assim quando os primeiros agentes Claude e GPT-5 foram para produção em 2025 e no primeiro semestre de 2026, a janela de exposição não é hipotética, é retrospectiva.


Na Europa, o problema toca o Artigo 32 do GDPR, que exige medidas técnicas apropriadas para dado pessoal. Traços de raciocínio contendo PII cifrados com chave global dificilmente cumprem esse teste. A AI Office, que ganhou poder de aplicar multa em 2 de agosto sob a Lei da IA, tem interesse direto no caso: provedores de GPAI respondem por transparência sobre risco sistêmico, e uma falha desse porte cabe no perímetro do enforcement.


Na Índia, onde centros de entrega de TCS, Infosys e Cognizant escrevem boa parte do código-agente que roda hoje em produção nos EUA e no Reino Unido, a exposição é dupla. Esses centros publicam trajetórias de teste em repositórios abertos para colaboração. Parte dos 6.708 traços que os pesquisadores decodificaram veio exatamente desse tipo de repositório.


Para times de segurança, o consumível prático da divulgação é revisar o que já foi publicado. Buscar por trajetórias de agente próprias em repositórios abertos. Rotacionar toda credencial que possa ter passado por raciocínio interno nos últimos meses. E revisitar contratos de fornecimento: o que é opacidade útil e o que é opacidade cômoda para o vendedor deixou de ser uma pergunta filosófica.

Análise Principal