Aprovação humana é o controle mais citado em governança de IA e o pior implementado. O erro típico não é a ausência dele — é o excesso: pedir confirmação para tudo, o que produz fadiga, cliques automáticos e a ilusão documentada de supervisão.
O critério para entrar na lista
Uma ação exige humano quando atende a dois testes ao mesmo tempo: é difícil de desfazer e afeta alguém além do agente. Isso reduz o universo a quatro verbos:
- Apagar — dado, registro, recurso, branch.
- Transferir — dinheiro, propriedade, ou dado para fora do perímetro.
- Publicar — qualquer coisa que fique visível externamente.
- Conceder — permissão, acesso, convite. É o verbo que cria os outros três no futuro.
Ler não entra. Escrever em rascunho não entra. Criar recurso descartável não entra. Se a lista tiver vinte itens, ela não vai ser respeitada.
Como a aprovação precisa ser apresentada
Aqui mora o detalhe que invalida a maioria das implementações. A tela precisa mostrar o que será executado, não o que o modelo diz que vai executar. São coisas diferentes quando existe divergência entre o texto exibido e o texto lido — pesquisadores demonstraram ocultação de payload em metadados de ferramenta usando blocos Unicode invisíveis, criando exatamente essa lacuna.
- Mostre o argumento literal, normalizado, com caracteres invisíveis revelados.
- Mostre o recurso de destino resolvido, não o alias.
- Não permita aprovar em lote ações de verbos diferentes.
- Exija que a aprovação expire — aprovação pendente por horas vira clique distraído.
Se o operador não consegue explicar o que aprovou trinta segundos depois, o controle não existe.
Como medir se está funcionando
Uma métrica só: taxa de rejeição. Se ninguém nunca rejeita nada, ou o agente é perfeito ou a aprovação virou carimbo. Na prática é sempre a segunda. Uma taxa de rejeição próxima de zero por meses é sinal para reduzir a lista ou melhorar a apresentação — não para comemorar.