Pablo Zavala · Avaliação de segurança de IA · Engenharia de pesquisa

Construo avaliações reproduzíveis para agentes de IA com autoridade para tomar ações reais.

O trabalho parte de uma pergunta prática: quando um agente deve agir sozinho, quando uma pessoa deve revisar a decisão e como sabemos que a evidência é confiável? Repositórios públicos incluem os artefatos por trás dos números principais.

Trabalho selecionado

Authority Calibration

Prova
Piloto público de uso de autoridade: divulgação em 14/14 e 12/12 testes de supressão; auto-rebaixamento em 9/9 e 8/8 ensaios; 0 inversões firebreak observadas; teste Codex separado com 6/19 enfraquecimentos de assurance
Evidência
Repositório público reproduzível
Fronteira de capacidade e evidência
Evidência de piloto; falhas raras exigem amostras maiores.

Agentes de IA já executam fluxos de trabalho, alocam recursos e coordenam outros agentes. Este projeto avalia se eles honram autoridade delegada: agem dentro do mandato e aceitam responsabilidade válida.

Safe MarketUniverses

Prova
120 episódios; perda por confiança 0,176 contra acaso 0,191
Evidência
Banco público de avaliação reproduzível
Fronteira de capacidade e evidência
O banco testa alocação em um ambiente financeiro compacto; outros contextos exigem validação separada.

Em um banco de avaliação de 120 episódios para alocar supervisão, a alocação por confiança chegou a perda 0,176 contra 0,191 de alocação aleatória, diferença pequena demais para servir como sinal de triagem.

Avaliação RAG

Prova
86,6% de precisão contextual após reescrita de consultas e reordenação; correspondência exata caiu na partição completa de 918 consultas
Evidência
Banco público de avaliação
Fronteira de capacidade e evidência
Ancoragem melhorou enquanto a correspondência exata determinística caiu; o resultado é uma troca.

Banco de prova comparando fluxos RAG base e reordenados com métricas RAGAS e SQuAD no corpus Mini Wikipedia. O fluxo reordenado alcança 86,6% de precisão contextual, mas perde correspondência exata.

DonorsChoose ML

Prova
ROC AUC 0,757 em mais de 185.000 projetos reservados para teste
Evidência
Repositório público de análise
Fronteira de capacidade e evidência
O modelo serve como ajuda de triagem; um sistema de decisão de financiamento exigiria validação adicional.

Modelo que identifica pedidos DonorsChoose com maior risco de ficar sem financiamento, para direcionar atenção limitada de revisores a escolas com menos recursos. A auditoria de equidade reporta taxas de erro desiguais por nível de pobreza escolar.

Fronteira de privacidade em SQLite

Prova
Seis autoverificações de fronteira controlam a CI: determinismo, um piso de texto distinto k=5, um authorizer SQL somente leitura, censura em repouso, uma auditoria encadeada por hash e um extrato sem tabelas privadas
Evidência
Repositório público e reproduzível
Fronteira de capacidade e evidência
Os controles permanecem estruturais em vez de semânticos; a censura por padrões não detecta texto autoidentificador inédito, e o piso conta texto distinto em vez de pessoas.

Um protótipo sem dependências publica estrutura a partir de um conjunto de dados de texto livre em SQLite sem expor linhas cruas nem tabelas base privadas. A censura por padrões limpa o texto antes do armazenamento, um piso de texto distinto de k=5 controla cada tópico público e célula agregada, e o authorizer do SQLite nega escritas, tabelas privadas e colunas sensíveis em cada consulta.

NUDG

Prova
Autorização, restrições, verificação e recibos para trabalho executado por agentes
Evidência
Sistema de fundador, afirmações públicas delimitadas
Fronteira de capacidade e evidência
Visuais públicos explicam o modelo do sistema; afirmações de produto em produção exigem pacotes de prova separados.

NUDG é um projeto do CMU AI Venture Studio para controlar como agentes usam recursos reais. Ele substitui acesso amplo por proposta, autorização, execução, verificação e recibos.

Padrão de evidência

Medir um modo de falha concreto

Excesso de autoridade, triagem fraca de supervisão, ancoragem fraca e erros desiguais de intervenção são nomeados antes de serem pontuados.

Usar o avaliador certo para a afirmação

Verificações de código, métricas julgadas por modelos, auditorias legíveis e linhas de base determinísticas são alinhadas à tarefa de avaliação.

Transformar lacunas da afirmação em capacidade

Resultados nulos, erros de avaliação, restrições de dados privados e linhas de base frágeis tornam-se trabalho explícito de construção ou validação junto dos números principais.