Pablo Zavala · Avaliação de segurança de IA · Engenharia de pesquisa
Authority Calibration em agentes de IA long-horizon
Agentes de IA já executam fluxos de trabalho, alocam recursos e coordenam outros agentes. Este projeto avalia se eles honram autoridade delegada: agem dentro do mandato e aceitam responsabilidade válida.
Precisão da afirmação
O que a evidência demonstra
Piloto público de uso de autoridade: divulgação em 14/14 e 12/12 testes de supressão; auto-rebaixamento em 9/9 e 8/8 ensaios; 0 inversões firebreak observadas; teste Codex separado com 6/19 enfraquecimentos de assurance
Fronteira de capacidade e evidência
Evidência de piloto; falhas raras exigem amostras maiores.
Repositório público reproduzível
Papel: Líder de pesquisa: estrutura, desenho do piloto, auditoria do avaliador e pacote de reprodutibilidade.
Cartão de avaliação
Resultado principal
Amostra
Repositório público reproduzível
Avaliador
Comparação contra a afirmação pública e seus artefatos de prova
Resultado
Piloto público de uso de autoridade: divulgação em 14/14 e 12/12 testes de supressão; auto-rebaixamento em 9/9 e 8/8 ensaios; 0 inversões firebreak observadas; teste Codex separado com 6/19 enfraquecimentos de assurance
Escopo de verificação
Evidência de piloto; falhas raras exigem amostras maiores.
Sinal de evidência
Amostra
Divulgação em 14/14 e 12/12 testes de supressão
Avaliador
Leitura de repositórios, relatórios, dados versionados ou demos públicas
Resultado
Auto-rebaixamento em 9/9 e 8/8 ensaios com regra fornecida
Escopo de verificação
Evidência de piloto; falhas raras exigem amostras maiores.
Eixos de avaliação com amostra, avaliador, resultado e escopo de verificação.
Eixo
Amostra
Avaliador
Resultado
Escopo de verificação
Resultado principal
Repositório público reproduzível
Comparação contra a afirmação pública e seus artefatos de prova
Piloto público de uso de autoridade: divulgação em 14/14 e 12/12 testes de supressão; auto-rebaixamento em 9/9 e 8/8 ensaios; 0 inversões firebreak observadas; teste Codex separado com 6/19 enfraquecimentos de assurance
Evidência de piloto; falhas raras exigem amostras maiores.
Sinal de evidência
Divulgação em 14/14 e 12/12 testes de supressão
Leitura de repositórios, relatórios, dados versionados ou demos públicas
Auto-rebaixamento em 9/9 e 8/8 ensaios com regra fornecida
Evidência de piloto; falhas raras exigem amostras maiores.
Como inspecionar este trabalho
Pergunta avaliada
Agentes de IA já executam fluxos de trabalho, alocam recursos e coordenam outros agentes. Este projeto avalia se eles honram autoridade delegada: agem dentro do mandato e aceitam responsabilidade válida.
Evidência inspecionável
Evidência principal: Piloto público de uso de autoridade: divulgação em 14/14 e 12/12 testes de supressão; auto-rebaixamento em 9/9 e 8/8 ensaios; 0 inversões firebreak observadas; teste Codex separado com 6/19 enfraquecimentos de assurance. Superfície: Repositório público reproduzível.
Fronteira de capacidade e evidência
Evidência de piloto; falhas raras exigem amostras maiores.
Estudo de caso
Problema
Agentes de IA já executam fluxos de trabalho, alocam recursos e coordenam outros agentes. Este projeto avalia se eles honram autoridade delegada: agem dentro do mandato e aceitam responsabilidade válida.
Contexto
Muitas ferramentas de segurança medem o que um modelo diz. Authority calibration mede ação delegada: o que o sistema faz quando pode usar ou recusar poder operacional.
Método
Papel de Pablo: Líder de pesquisa: estrutura, desenho do piloto, auditoria do avaliador e pacote de reprodutibilidade. Avaliação bicaudal pré-registrada, Painéis cegos de auditoria IA, Estatística reproduzível
Resultado
Piloto público de uso de autoridade: divulgação em 14/14 e 12/12 testes de supressão; auto-rebaixamento em 9/9 e 8/8 ensaios; 0 inversões firebreak observadas; teste Codex separado com 6/19 enfraquecimentos de assurance Divulgação em 14/14 e 12/12 testes de supressão
Escopo de verificação
Evidência de piloto; falhas raras exigem amostras maiores.
Evidência
Repositório público reproduzível A evidência principal aparece nos links da seção de materiais.
Resultados principais
Divulgação em 14/14 e 12/12 testes de supressão
Auto-rebaixamento em 9/9 e 8/8 ensaios com regra fornecida
Zero inversões constitucionais nos cenários firebreak
Teste Codex separado mostrou efeito adverso em 6/19 ensaios
Falsos positivos do avaliador corrigidos e reportados como achado de validade