ooligo
claude-skill

Inventory your AI tools for preservation scope

Dificuldade
avançado
Tempo de setup
3-6 hours
Para
legal-ops-manager · in-house-counsel
Legal Ops

Stack

Um skill do Claude que transforma o inventário de ferramentas de IA de uma organização em um mapa de escopo de preservação: para cada ferramenta, onde os prompts e as respostas persistem, o que os apaga e sob qual relógio, se um legal hold já vigente alcança esses dados, e qual linguagem do questionário de custodiantes e da notificação de hold precisa mudar por causa da resposta. O bundle fica em apps/web/public/artifacts/ai-data-source-inventory-skill/ e contém SKILL.md mais três arquivos de referência, um dos quais você preenche antes da primeira execução.

O skill é somente leitura. Ele não coloca nem levanta nenhum hold, porque as duas coisas são decisões jurídicas que pertencem a uma pessoa com nome.

A lacuna que ele fecha

Mapas de dados construídos antes de 2023 listam e-mail, chat, repositórios de arquivos e sistemas de negócio. A camada de IA foi acrescentada a esses mesmos sistemas sem ser acrescentada ao mapa, e as duas respostas padrão para isso estão erradas de um jeito que parece responsável.

A primeira é tratar ferramentas de IA como um problema de segurança já resolvido. Um exercício de descoberta de shadow AI produz uma lista de aplicativos e um conjunto de bloqueios, e a lista é arquivada. Essa lista responde quem usa o quê. Ela não diz nada sobre qual registro esse uso deixa, que é a única pergunta que interessa à preservação.

A segunda é supor que retenção e preservação são o mesmo fato. São independentes, e as linhas interessantes são justamente aquelas em que divergem. O chat do Microsoft 365 Copilot é preservado por controles que a maioria das organizações já opera: prompts e respostas são copiados para uma pasta oculta na própria caixa de correio do Exchange Online do usuário, e a Microsoft documenta que a exclusão permanente é suspensa quando essa caixa está sob Litigation Hold, delay hold, hold de eDiscovery ou outra política de retenção para o mesmo local. Ou seja, um custodiante com hold na caixa de correio já tem o chat do Copilot preservado, tenha alguém decidido isso ou não. A memória do Copilot, dentro do mesmo produto, vai no sentido oposto: a Microsoft afirma que políticas e rótulos de retenção do Purview não se aplicam à memória do Copilot e que nenhum controle de administrador impõe retenção sobre ela, enquanto memórias salvas e inferidas continuam localizáveis via eDiscovery e Graph Explorer. Localizável e desprotegido é o pior par de propriedades que uma fonte de dados pode ter.

Quando usar

Quando um hold vai sair e a lista de fontes por custodiante é anterior à camada de IA. Quando a parte contrária apresenta um pedido de ESI ou uma proposta sob a Regra 26(f) que menciona logs de chatbot ou histórico de prompts. Quando um programa de exclusão defensável está prestes a começar a apagar e ninguém estabeleceu o que a camada de IA copia ou deixa para trás. Quando a área de segurança termina uma varredura de shadow AI e o resultado precisa de uma leitura de gestão documental em vez de uma leitura de segurança.

Quando NÃO usar

  • O hold já está atrasado. Emita a notificação com o escopo mais amplo defensável primeiro e faça o inventário depois. Inventário não é motivo para atrasar uma notificação.
  • Menos de umas oito ferramentas de IA, um único provedor de identidade, tudo atrás de SSO. Leia os quatro consoles de administração direto. O esquema é overhead nesse tamanho.
  • Você precisa coletar os dados, não delimitá-los. O arquivo references/2-retention-behavior-profiles.md registra se existe um caminho de exportação e quem pode executá-lo; ele não executa.
  • Você não consegue acessar nenhum console administrativo. Todas as fases depois da descoberta dependem de configuração de tenant que você precisa conseguir ler. Sem isso, a execução produz uma lista de alegações de marketing do fornecedor com cara de inventário.
  • Ninguém vai preencher a Parte D. O registro de ferramentas conhecidas em references/1-ai-tool-discovery-sources.md é o que faz uma ferramenta não descoberta aparecer como não registrada. Sem ele, todos os achados se leem igual.

O que o skill faz de fato

Seis fases, ordem fixa, com recusas duras em duas delas.

A fase 1 coleta de quatro planos de descoberta: concessões do provedor de identidade, gastos, telemetria de endpoint e navegador, e o registro de ferramentas conhecidas. Eles são deliberadamente redundantes porque cada um é cego numa direção diferente: o provedor de identidade não enxerga uma ferramenta que alguém paga com cartão pessoal, os gastos não enxergam planos gratuitos, a telemetria não enxerga a configuração do tenant, e o registro só enxerga o que as pessoas anotaram. Uma ferramenta encontrada por um plano é outra classe de confiança em relação a uma encontrada por três, e são os achados de plano único que carregam os problemas, porque uma ferramenta que ninguém comprou é uma ferramenta que ninguém configurou.

A fase 2 se recusa a prosseguir com menos de três planos, ou se qualquer plano retornar zero registros. Um plano com zero registros aparece como COLLECTION FAILED, nunca como resultado limpo. A falha característica desse trabalho é um inventário caprichado das doze ferramentas que foram fáceis de achar.

A fase 3 monta um perfil de retenção por ferramenta apenas a partir da documentação do fornecedor e da configuração do tenant. Todo campo carrega um source_url e uma data checked_on; um campo sem um dos dois aparece como unknown em vez de cair num valor padrão, porque um padrão plausível é como um inventário fica errado em silêncio. Os perfis se dividem por funcionalidade, não só por ferramenta: chat do Copilot e memória do Copilot são duas linhas com respostas opostas.

A fase 4 classifica o alcance em quatro estados, e essa é a decisão de projeto que separa o resultado de um mapa de dados. held significa que um controle existente já se aplica. retained-not-held significa que o dado existe e é localizável mas nenhum mecanismo de hold o alcança, então preservar é uma tarefa afirmativa de coleta com data, não algo que você coloca e esquece. not-retained significa que a interação não deixa registro durável: o Google afirma que o suporte do Vault ao aplicativo Gemini não se aplica aos recursos do Gemini integrados a outros aplicativos do Google Workspace, como o “Help me write” no Gmail e no Docs, porque essas interações não são retidas da mesma forma. vendor-held-only significa que o registro existe só nos sistemas do fornecedor, que seus holds não alcançam, o que é uma questão de posse, custódia ou controle para o jurídico e não uma tarefa de configuração para TI.

Depois ele roda o teste ao contrário, listando quais fontes de IA cada hold existente varre silenciosamente. Superpreservação é um achado reportável: infla o volume de revisão e contradiz qualquer cronograma escrito que afirme que interações de IA não são preservadas.

As fases 5 e 6 derivam os deltas do questionário e da notificação a partir de references/3-custodian-questionnaire-deltas.md e reportam, começando pelas linhas retained-not-held e vendor-held-only, porque essas exigem decisão nesta semana.

Custo e throughput

Computação não é o orçamento. O skill lê exportações e documentação do fornecedor; a redação de cada perfil consome mais ou menos 600-900 tokens de saída, então um parque de 40 ferramentas custa bem menos de um dólar em gasto de modelo.

O custo humano é o número inteiro, e é uma estimativa, não uma medição: reserve 2-4 horas para puxar os quatro planos se as exportações existirem, e depois 15-30 minutos por ferramenta entre documentação e verificação no tenant. Um inventário de 40 ferramentas é uma primeira passada de 10-20 horas, a maior parte na fase 3. A Parte D da referência de descoberta persiste, então a segunda execução é um diff e custa uma fração da primeira. Rode de novo a cada caso, e trimestralmente como prontidão permanente.

Modos de falha

  • Confundir “é retido” com “um hold alcança”. O time reporta uma cobertura que nenhum hold de fato produz. Guarda: reachable_by_existing_hold não pode ser inferido; o esquema exige nomear o controle específico que faz o alcance, e retenção do lado do fornecedor para os fins dele próprio não conta.
  • Verificar preservação olhando o aplicativo. Guarda: a Microsoft afirma que mensagens visíveis nos aplicativos de IA não refletem com precisão se elas estão retidas ou apagadas em definitivo. A verificação da fase 4 é uma busca de eDiscovery que devolve uma contagem de resultados contra um custodiante conhecido, nunca uma captura de tela.
  • Ler o período de retenção configurado como a data da exclusão. O próprio exemplo trabalhado da Microsoft mostra uma política de excluir-após-um-dia levando até 16 dias antes de os itens pararem de aparecer no eDiscovery, porque o timer job roda em ciclo de 1-7 dias e a pasta SubstrateHolds acrescenta pelo menos mais um dia. Guarda: o esquema separa policy_period de observed_deletion_lag, e as certificações de exclusão defensável citam o segundo.
  • Supor que licença significa captura. Os locais de retenção do Purview alcançam ChatGPT, Google Gemini, o Copilot de consumo e o DeepSeek apenas quando existe uma collection policy com captura de conteúdo configurada, o que exige a condição Content contains classifiers ajustada para All, e a Microsoft afirma que isso não inclui conteúdo de arquivos compartilhados com a IA generativa. Guarda: o estado da collection policy é um campo de configuração do tenant por ferramenta, não uma suposição no nível da organização.
  • Tratar os termos do fornecedor como estáveis. A ordem de preservação no caso do New York Times obrigou a OpenAI a guardar dados de log de saída que de outra forma teriam sido apagados; essa obrigação terminou em 2025-09-26 e a ordem foi encerrada por estipulação em 2025-10-09. O Google Vault só ganhou regras de retenção e litigation holds para o aplicativo Gemini em 2026-06-11. Um inventário escrito de um lado dessas datas está errado do outro lado. Guarda: todo perfil carrega checked_on, e o que passar do intervalo de reverificação aparece como unverified e é contado no cabeçalho do relatório.
  • O inventário vira um documento de RH no instante em que nomeia pessoas fazendo algo não aprovado, e a cooperação desaba. Guarda: a fase 1 agrega por ferramenta e contagem; o detalhe por custodiante é escrito em run_dir/custodians/ e referenciado por caminho, nunca embutido no relatório.

Frente às alternativas

Frente a um conector de fontes de IA de um fornecedor de eDiscovery. Onna, Exterro e Reveal vendem coleta de fontes em nuvem, e quando você tem um caso e precisa tirar os dados, um conector ganha de fazer na mão sempre. Ele resolve o problema vizinho. Você ainda precisa do inventário para saber quais conectores comprar, e não existem conectores para as fontes que não têm caminho de exportação nenhum, que é justamente onde ficam as linhas retained-not-held.

Frente ao Purview DSPM for AI sozinho. Para um parque centrado em Microsoft é o plano de descoberta mais forte disponível, e o bundle o usa como um deles. Dois limites impedem que ele seja a resposta: ele reporta uso de aplicativos de IA em vez do que sobrevive a esse uso, e seu alcance sobre ferramentas fora da Microsoft depende do plano do navegador mais uma collection policy que a maioria dos tenants não configurou.

Frente a pedir a lista de aplicativos para a TI. É a opção mais rápida, e a resposta é a lista do SSO, que exclui estruturalmente o uso sem SSO e com contas pessoais. Essa população excluída é exatamente a de pior postura de preservação, então o método mais rápido tem o ponto cego bem onde estão os achados.

Frente a uma planilha. A comparação honesta, já que é o que a maioria dos times faz. Serve com dez ferramentas. O que vale a pena não reescrever é o esquema de perfil com seu source_url obrigatório, a classificação de quatro estados e o teste inverso de hold, porque são justamente esses três que as pessoas erram quando montam a planilha sozinhas.

Relacionado: ediscovery-custodian-questionnaire-skill para a entrevista que alimenta este inventário, legal-hold-process para a mecânica da notificação, e microsoft-purview-ediscovery para o ferramental do lado do tenant por onde passa a maioria destes achados.

Arquivos deste artefato

Baixar tudo (.zip)