Pablo Zavala · Avaliação de segurança de IA · Engenharia de pesquisa

Projetos de avaliação IA com evidência · Pablo Zavala

Repositórios públicos de avaliação, resumos de pesquisa com dados restritos e protótipos organizados por artefatos inspecionáveis.

Índice de projetos

Authority Calibration

Prova
Piloto público de uso de autoridade: divulgação em 14/14 e 12/12 testes de supressão; auto-rebaixamento em 9/9 e 8/8 ensaios; 0 inversões firebreak observadas; teste Codex separado com 6/19 enfraquecimentos de assurance
Evidência
Repositório público reproduzível
Fronteira de capacidade e evidência
Evidência de piloto; falhas raras exigem amostras maiores.

Agentes de IA já executam fluxos de trabalho, alocam recursos e coordenam outros agentes. Este projeto avalia se eles honram autoridade delegada: agem dentro do mandato e aceitam responsabilidade válida.

Safe MarketUniverses

Prova
120 episódios; perda por confiança 0,176 contra acaso 0,191
Evidência
Banco público de avaliação reproduzível
Fronteira de capacidade e evidência
O banco testa alocação em um ambiente financeiro compacto; outros contextos exigem validação separada.

Em um banco de avaliação de 120 episódios para alocar supervisão, a alocação por confiança chegou a perda 0,176 contra 0,191 de alocação aleatória, diferença pequena demais para servir como sinal de triagem.

Avaliação RAG

Prova
86,6% de precisão contextual após reescrita de consultas e reordenação; correspondência exata caiu na partição completa de 918 consultas
Evidência
Banco público de avaliação
Fronteira de capacidade e evidência
Ancoragem melhorou enquanto a correspondência exata determinística caiu; o resultado é uma troca.

Banco de prova comparando fluxos RAG base e reordenados com métricas RAGAS e SQuAD no corpus Mini Wikipedia. O fluxo reordenado alcança 86,6% de precisão contextual, mas perde correspondência exata.

DonorsChoose ML

Prova
ROC AUC 0,757 em mais de 185.000 projetos reservados para teste
Evidência
Repositório público de análise
Fronteira de capacidade e evidência
O modelo serve como ajuda de triagem; um sistema de decisão de financiamento exigiria validação adicional.

Modelo que identifica pedidos DonorsChoose com maior risco de ficar sem financiamento, para direcionar atenção limitada de revisores a escolas com menos recursos. A auditoria de equidade reporta taxas de erro desiguais por nível de pobreza escolar.

Fronteira de privacidade em SQLite

Prova
Seis autoverificações de fronteira controlam a CI: determinismo, um piso de texto distinto k=5, um authorizer SQL somente leitura, censura em repouso, uma auditoria encadeada por hash e um extrato sem tabelas privadas
Evidência
Repositório público e reproduzível
Fronteira de capacidade e evidência
Os controles permanecem estruturais em vez de semânticos; a censura por padrões não detecta texto autoidentificador inédito, e o piso conta texto distinto em vez de pessoas.

Um protótipo sem dependências publica estrutura a partir de um conjunto de dados de texto livre em SQLite sem expor linhas cruas nem tabelas base privadas. A censura por padrões limpa o texto antes do armazenamento, um piso de texto distinto de k=5 controla cada tópico público e célula agregada, e o authorizer do SQLite nega escritas, tabelas privadas e colunas sensíveis em cada consulta.

NUDG

Prova
Autorização, restrições, verificação e recibos para trabalho executado por agentes
Evidência
Sistema de fundador, afirmações públicas delimitadas
Fronteira de capacidade e evidência
Visuais públicos explicam o modelo do sistema; afirmações de produto em produção exigem pacotes de prova separados.

NUDG é um projeto do CMU AI Venture Studio para controlar como agentes usam recursos reais. Ele substitui acesso amplo por proposta, autorização, execução, verificação e recibos.

Mapeamento IA

Prova
Mais de $10B mapeados em 11 metrôs; Pittsburgh: $6,3B em 133 firmas
Evidência
Dados restritos, resumo agregado público
Fronteira de capacidade e evidência
Mapas e tabelas por empresa permanecem privados; a página pública mostra agregados e evidência metodológica.

Projeto do Block Center que mapeia mais de dez bilhões de dólares em investimento público e privado em IA em onze economias metropolitanas. O corte de Pittsburgh cobre 6,3 bilhões de dólares e 133 firmas.

Simulação laboral IA

Prova
14,3% contra 3,6% de desemprego de pico sob regimes pareados
Evidência
Repositório público de simulação
Fronteira de capacidade e evidência
Demonstração de mecanismo em um pequeno mercado simulado, fora do escopo de previsão macroeconômica.

Modelo NetLogo baseado em agentes de um pequeno mercado de trabalho se ajustando à automação com IA. Com trabalhadores, geografia e semente idênticos, o desemprego de pico chega a 14,3% sob política movida por tecnologia contra 3,6% sob política centrada em pessoas.

Heard.now

Prova
Amostra sintética pública com 7/7 verificações de privacidade e integridade
Evidência
Piloto privado, artefato sintético público
Fronteira de capacidade e evidência
Visuais públicos usam texto sintético para proteger mensagens comunitárias.

Piloto de escuta cívica com o professor Jordan Usdan do Heinz College que mantém contribuições brutas privadas e publica extratos verificados para privacidade. A amostra sintética pública demonstra uma rota de verificação 7/7.

Event Compass

Prova
Claude vision extrai cartões de cartazes; exportação estática sem backend roda com quadro de amostra
Evidência
Demo estática ao vivo
Fronteira de capacidade e evidência
A demo verifica o fluxo de extração no quadro de amostra; cobertura ao vivo do campus fica fora do escopo.

Protótipo que transforma uma foto de uma parede de cartazes do campus em listagens estruturadas e personalizadas. Claude vision extrai uma ficha por cartaz, e um classificador determinístico no navegador ordena resultados.

DemFlex ERCOT

Prova
Modelo de fluxo de caixa hora a hora com busca de portfólios de termostato, solar e bateria
Evidência
Artefato de projeto final por solicitação
Fronteira de capacidade e evidência
O artefato público mostra o fluxo funcional; materiais completos do projeto permanecem privados.

Ferramenta Streamlit de planejamento de resposta à demanda para ERCOT. Ela compara termostatos, solar e baterias hora a hora por análise custo-benefício de fluxo de caixa.

Anomalias de cibersegurança

Prova
Holdout de limiar congelado: recall 0,9000 (162 de 180 ataques; IC de 95% 0,85 a 0,94) com FPR 0,0194, ROC AUC 0,9714, a partir de um Isolation Forest ajustado sobre tráfego exclusivamente benigno
Evidência
Repositório público reproduzível + notebook executado
Fronteira de capacidade e evidência
A precisão no limiar escolhido é de 0,3189 a uma prevalência simulada de 1%, a classe maliciosa contém uma única campanha de preparação de botnet em um único host de honeypot, e três atributos dominantes deixam o detector suscetível a spoofing.

Um projeto de análise de segurança da Carnegie Mellon que ajusta um Isolation Forest sobre tráfego de kernel Linux exclusivamente benigno do dataset de honeypot BETH, e então o avalia sob um limiar congelado. Em um holdout de 18.000 eventos, com prevalência de ataque simulada de 1%, o detector captura 90% das intrusões (162 de 180) a uma taxa de falsos positivos de 1,94%, com ROC AUC de 0,9714. A entrada audita seu próprio resultado principal: a precisão situa-se em 0,3189, de modo que aproximadamente um em cada três alertas sinaliza um ataque real, e três atributos dominantes entregam a um atacante um playbook de spoofing, o que mantém o detector como apenas uma camada da defesa em profundidade.

Hedônica Habitacional de LA

Prova
Entre cerca de dez modelos ajustados, o R-squared de CV aleatória, 0,621, cai para 0,431 sob validação por blocos espaciais, e um espectro leave-one-region-out leva a habilidade dos ensembles de árvore rumo a zero; o Double ML estima um prêmio costeiro direto de +29,8% (IC de 95% [0,16; 0,33] pontos logarítmicos) e reduz a diferença ingênua de escola particular para +0,7%.
Evidência
Repositório público reproduzível + working paper
Fronteira de capacidade e evidência
As leituras causais só se sustentam sob ignorabilidade, a estimativa costeira repousa sobre 100 casas tratadas, e termos de terceiros mantêm as linhas no nível de imóvel fora do repositório, de modo que uma reexecução completa parte da tabela limpa que o código de ingestão versionado reconstrói.

Um estudo de big data da University of Chicago Booth, em coautoria com Will Sigal, que precifica 3.804 casas unifamiliares do condado de Los Angeles a partir de atributos estruturais e de vizinhança, e então audita seu próprio resultado principal. Um ensemble empilhado ajustado alcança R-squared fora da amostra de 0,621 sob validação cruzada aleatória e cai para 0,431 quando a pontuação passa a blocos geográficos reservados; no espectro leave-one-region-out separado, a habilidade dos ensembles de árvore decai em direção a zero, enquanto o humilde modelo linear regularizado é o que melhor extrapola no espaço. O Double/Debiased ML com cross-fitting situa o prêmio costeiro direto perto de +29,8% por pé quadrado, enquanto o prêmio ingênuo de escola particular cai para um zero estatístico.

Entrega de Última Milha

Prova
Em simulação, a atribuição MILP sensível a risco com 240 agentes (peso de risco base alpha = 1) alcançou 94,8% de desempenho no prazo com 89,4% de cobertura, contra uma linha de base observada de 48,8% nos mesmos dados sintéticos de entrega.
Evidência
Repositório público (notebooks e relatório versionados)
Fronteira de capacidade e evidência
Toda taxa em destaque vem de simulação em um conjunto de dados sintético de entrega do Kaggle; o relatório sinaliza a calibração de capacidade como a suposição frágil, e o próprio conjunto de dados permanece fora do repositório público, pendente de revisão de licença, com o README apontando para o download.

Um framework predict-then-optimize para entrega de última milha, construído com Santiago Enríquez como uma dupla equilibrada para a disciplina 94-867 Data to Action da Carnegie Mellon. Modelos de gradient boosting preveem uma estimativa central e um limite no percentil 80 para o tempo de entrega em um conjunto de dados sintético do Kaggle com registros de entrega no estilo Amazon; o MILP de triagem filtra pedidos com base na previsão de cauda, enquanto o MILP de simulação precifica cada pedido pelo risco, segundo um classificador, de não cumprir sua promessa de serviço definida conformalmente. Em simulação dia a dia, a atribuição sensível a risco alcançou 94,8% de desempenho no prazo com 89,4% de cobertura, contra uma linha de base observada de 48,8%.

Volatilidade Dow Reddit

Prova
Entre 3.183 palavras de manchete a 10% de FDR, os retornos mantêm uma sobrevivente (damn, p = 1,0262e-05) contra 12 palavras para a volatilidade; adicionar a volatilidade do dia anterior eleva o lasso de zero palavras selecionadas para R-squared dentro da amostra de 0,262.
Evidência
Repositório público de notebook
Fronteira de capacidade e evidência
Evidência dentro da amostra de um único notebook executado, em um conjunto de dados que termina em 1 de julho de 2016; os CSVs de origem permanecem fora do repositório público por motivos de licença, então uma reexecução começa a partir do download no Kaggle, mais os arquivos de palavras derivados que o README documenta.

Um notebook de trabalho de curso de big data da Carnegie Mellon que pergunta se palavras em manchetes diárias de notícias do Reddit preveem o Dow. Entre 3.183 palavras filtradas, regressões marginais com controle de FDR de Benjamini-Hochberg deixam exatamente uma palavra preditiva de retorno, damn, uma sobrevivente que o notebook interpreta como capacidade preditiva mínima, e não descoberta; a volatilidade mantém 12 palavras e mostra persistência genuína. Adicionar a volatilidade do dia anterior eleva o lasso de zero palavras selecionadas para um R-squared dentro da amostra de 0,262, uma lição compacta sobre testes múltiplos e confundimento.

Modelagem de Oponentes no Pôquer

Prova
Bot de pôquer adaptativo com um fluxo de trabalho de estudo documentado: roteamento posterior de oponentes, pontuação empacotada de EV por bucket, busca no turn condicionada por incerteza, e backtests de baralho duplicado orientados por manifesto com snapshots congelados de release.
Evidência
Repositório público de submissão
Fronteira de capacidade e evidência
A evidência repousa sobre o bot commitado e o método documentado; os scripts de estudo de baralho duplicado que regeneram as comparações permanecem fora da árvore pública, um benchmark público de resultado principal contra o campo de torneio ao vivo permanece pendente, e os modelos de oponente permanecem heurísticos e estatísticos.

Um bot de pôquer de torneio construído para a competição do CMU Data Science Club, voltado para a tomada de decisão sob incerteza contra oponentes variados e adversariais. O bot lê tendências dos oponentes a partir de sinais de aposta ao vivo, roteia entre estratégias especialistas por meio de um seletor no estilo bandit, e gasta busca mais pesada no turn apenas em situações de alta incerteza. Um framework de backtest orientado por manifesto, com reconciliação de baralho duplicado e snapshots congelados de release, registra cada decisão de promoção contra oponentes fixos e pesos de pontuação.