- Prova
- Piloto público de uso de autoridade: divulgação em 14/14 e 12/12 testes de supressão; auto-rebaixamento em 9/9 e 8/8 ensaios; 0 inversões firebreak observadas; teste Codex separado com 6/19 enfraquecimentos de assurance
- Evidência
- Repositório público reproduzível
- Fronteira de capacidade e evidência
- Evidência de piloto; falhas raras exigem amostras maiores.
Agentes de IA já executam fluxos de trabalho, alocam recursos e coordenam outros agentes. Este projeto avalia se eles honram autoridade delegada: agem dentro do mandato e aceitam responsabilidade válida.
- Prova
- 120 episódios; perda por confiança 0,176 contra acaso 0,191
- Evidência
- Banco público de avaliação reproduzível
- Fronteira de capacidade e evidência
- O banco testa alocação em um ambiente financeiro compacto; outros contextos exigem validação separada.
Em um banco de avaliação de 120 episódios para alocar supervisão, a alocação por confiança chegou a perda 0,176 contra 0,191 de alocação aleatória, diferença pequena demais para servir como sinal de triagem.
- Prova
- 86,6% de precisão contextual após reescrita de consultas e reordenação; correspondência exata caiu na partição completa de 918 consultas
- Evidência
- Banco público de avaliação
- Fronteira de capacidade e evidência
- Ancoragem melhorou enquanto a correspondência exata determinística caiu; o resultado é uma troca.
Banco de prova comparando fluxos RAG base e reordenados com métricas RAGAS e SQuAD no corpus Mini Wikipedia. O fluxo reordenado alcança 86,6% de precisão contextual, mas perde correspondência exata.
- Prova
- ROC AUC 0,757 em mais de 185.000 projetos reservados para teste
- Evidência
- Repositório público de análise
- Fronteira de capacidade e evidência
- O modelo serve como ajuda de triagem; um sistema de decisão de financiamento exigiria validação adicional.
Modelo que identifica pedidos DonorsChoose com maior risco de ficar sem financiamento, para direcionar atenção limitada de revisores a escolas com menos recursos. A auditoria de equidade reporta taxas de erro desiguais por nível de pobreza escolar.
- Prova
- Seis autoverificações de fronteira controlam a CI: determinismo, um piso de texto distinto k=5, um authorizer SQL somente leitura, censura em repouso, uma auditoria encadeada por hash e um extrato sem tabelas privadas
- Evidência
- Repositório público e reproduzível
- Fronteira de capacidade e evidência
- Os controles permanecem estruturais em vez de semânticos; a censura por padrões não detecta texto autoidentificador inédito, e o piso conta texto distinto em vez de pessoas.
Um protótipo sem dependências publica estrutura a partir de um conjunto de dados de texto livre em SQLite sem expor linhas cruas nem tabelas base privadas. A censura por padrões limpa o texto antes do armazenamento, um piso de texto distinto de k=5 controla cada tópico público e célula agregada, e o authorizer do SQLite nega escritas, tabelas privadas e colunas sensíveis em cada consulta.
- Prova
- Autorização, restrições, verificação e recibos para trabalho executado por agentes
- Evidência
- Sistema de fundador, afirmações públicas delimitadas
- Fronteira de capacidade e evidência
- Visuais públicos explicam o modelo do sistema; afirmações de produto em produção exigem pacotes de prova separados.
NUDG é um projeto do CMU AI Venture Studio para controlar como agentes usam recursos reais. Ele substitui acesso amplo por proposta, autorização, execução, verificação e recibos.
- Prova
- Mais de $10B mapeados em 11 metrôs; Pittsburgh: $6,3B em 133 firmas
- Evidência
- Dados restritos, resumo agregado público
- Fronteira de capacidade e evidência
- Mapas e tabelas por empresa permanecem privados; a página pública mostra agregados e evidência metodológica.
Projeto do Block Center que mapeia mais de dez bilhões de dólares em investimento público e privado em IA em onze economias metropolitanas. O corte de Pittsburgh cobre 6,3 bilhões de dólares e 133 firmas.
- Prova
- 14,3% contra 3,6% de desemprego de pico sob regimes pareados
- Evidência
- Repositório público de simulação
- Fronteira de capacidade e evidência
- Demonstração de mecanismo em um pequeno mercado simulado, fora do escopo de previsão macroeconômica.
Modelo NetLogo baseado em agentes de um pequeno mercado de trabalho se ajustando à automação com IA. Com trabalhadores, geografia e semente idênticos, o desemprego de pico chega a 14,3% sob política movida por tecnologia contra 3,6% sob política centrada em pessoas.
- Prova
- Amostra sintética pública com 7/7 verificações de privacidade e integridade
- Evidência
- Piloto privado, artefato sintético público
- Fronteira de capacidade e evidência
- Visuais públicos usam texto sintético para proteger mensagens comunitárias.
Piloto de escuta cívica com o professor Jordan Usdan do Heinz College que mantém contribuições brutas privadas e publica extratos verificados para privacidade. A amostra sintética pública demonstra uma rota de verificação 7/7.
- Prova
- Claude vision extrai cartões de cartazes; exportação estática sem backend roda com quadro de amostra
- Evidência
- Demo estática ao vivo
- Fronteira de capacidade e evidência
- A demo verifica o fluxo de extração no quadro de amostra; cobertura ao vivo do campus fica fora do escopo.
Protótipo que transforma uma foto de uma parede de cartazes do campus em listagens estruturadas e personalizadas. Claude vision extrai uma ficha por cartaz, e um classificador determinístico no navegador ordena resultados.
- Prova
- Modelo de fluxo de caixa hora a hora com busca de portfólios de termostato, solar e bateria
- Evidência
- Artefato de projeto final por solicitação
- Fronteira de capacidade e evidência
- O artefato público mostra o fluxo funcional; materiais completos do projeto permanecem privados.
Ferramenta Streamlit de planejamento de resposta à demanda para ERCOT. Ela compara termostatos, solar e baterias hora a hora por análise custo-benefício de fluxo de caixa.
- Prova
- Holdout de limiar congelado: recall 0,9000 (162 de 180 ataques; IC de 95% 0,85 a 0,94) com FPR 0,0194, ROC AUC 0,9714, a partir de um Isolation Forest ajustado sobre tráfego exclusivamente benigno
- Evidência
- Repositório público reproduzível + notebook executado
- Fronteira de capacidade e evidência
- A precisão no limiar escolhido é de 0,3189 a uma prevalência simulada de 1%, a classe maliciosa contém uma única campanha de preparação de botnet em um único host de honeypot, e três atributos dominantes deixam o detector suscetível a spoofing.
Um projeto de análise de segurança da Carnegie Mellon que ajusta um Isolation Forest sobre tráfego de kernel Linux exclusivamente benigno do dataset de honeypot BETH, e então o avalia sob um limiar congelado. Em um holdout de 18.000 eventos, com prevalência de ataque simulada de 1%, o detector captura 90% das intrusões (162 de 180) a uma taxa de falsos positivos de 1,94%, com ROC AUC de 0,9714. A entrada audita seu próprio resultado principal: a precisão situa-se em 0,3189, de modo que aproximadamente um em cada três alertas sinaliza um ataque real, e três atributos dominantes entregam a um atacante um playbook de spoofing, o que mantém o detector como apenas uma camada da defesa em profundidade.
- Prova
- Entre cerca de dez modelos ajustados, o R-squared de CV aleatória, 0,621, cai para 0,431 sob validação por blocos espaciais, e um espectro leave-one-region-out leva a habilidade dos ensembles de árvore rumo a zero; o Double ML estima um prêmio costeiro direto de +29,8% (IC de 95% [0,16; 0,33] pontos logarítmicos) e reduz a diferença ingênua de escola particular para +0,7%.
- Evidência
- Repositório público reproduzível + working paper
- Fronteira de capacidade e evidência
- As leituras causais só se sustentam sob ignorabilidade, a estimativa costeira repousa sobre 100 casas tratadas, e termos de terceiros mantêm as linhas no nível de imóvel fora do repositório, de modo que uma reexecução completa parte da tabela limpa que o código de ingestão versionado reconstrói.
Um estudo de big data da University of Chicago Booth, em coautoria com Will Sigal, que precifica 3.804 casas unifamiliares do condado de Los Angeles a partir de atributos estruturais e de vizinhança, e então audita seu próprio resultado principal. Um ensemble empilhado ajustado alcança R-squared fora da amostra de 0,621 sob validação cruzada aleatória e cai para 0,431 quando a pontuação passa a blocos geográficos reservados; no espectro leave-one-region-out separado, a habilidade dos ensembles de árvore decai em direção a zero, enquanto o humilde modelo linear regularizado é o que melhor extrapola no espaço. O Double/Debiased ML com cross-fitting situa o prêmio costeiro direto perto de +29,8% por pé quadrado, enquanto o prêmio ingênuo de escola particular cai para um zero estatístico.
- Prova
- Em simulação, a atribuição MILP sensível a risco com 240 agentes (peso de risco base alpha = 1) alcançou 94,8% de desempenho no prazo com 89,4% de cobertura, contra uma linha de base observada de 48,8% nos mesmos dados sintéticos de entrega.
- Evidência
- Repositório público (notebooks e relatório versionados)
- Fronteira de capacidade e evidência
- Toda taxa em destaque vem de simulação em um conjunto de dados sintético de entrega do Kaggle; o relatório sinaliza a calibração de capacidade como a suposição frágil, e o próprio conjunto de dados permanece fora do repositório público, pendente de revisão de licença, com o README apontando para o download.
Um framework predict-then-optimize para entrega de última milha, construído com Santiago Enríquez como uma dupla equilibrada para a disciplina 94-867 Data to Action da Carnegie Mellon. Modelos de gradient boosting preveem uma estimativa central e um limite no percentil 80 para o tempo de entrega em um conjunto de dados sintético do Kaggle com registros de entrega no estilo Amazon; o MILP de triagem filtra pedidos com base na previsão de cauda, enquanto o MILP de simulação precifica cada pedido pelo risco, segundo um classificador, de não cumprir sua promessa de serviço definida conformalmente. Em simulação dia a dia, a atribuição sensível a risco alcançou 94,8% de desempenho no prazo com 89,4% de cobertura, contra uma linha de base observada de 48,8%.
- Prova
- Entre 3.183 palavras de manchete a 10% de FDR, os retornos mantêm uma sobrevivente (damn, p = 1,0262e-05) contra 12 palavras para a volatilidade; adicionar a volatilidade do dia anterior eleva o lasso de zero palavras selecionadas para R-squared dentro da amostra de 0,262.
- Evidência
- Repositório público de notebook
- Fronteira de capacidade e evidência
- Evidência dentro da amostra de um único notebook executado, em um conjunto de dados que termina em 1 de julho de 2016; os CSVs de origem permanecem fora do repositório público por motivos de licença, então uma reexecução começa a partir do download no Kaggle, mais os arquivos de palavras derivados que o README documenta.
Um notebook de trabalho de curso de big data da Carnegie Mellon que pergunta se palavras em manchetes diárias de notícias do Reddit preveem o Dow. Entre 3.183 palavras filtradas, regressões marginais com controle de FDR de Benjamini-Hochberg deixam exatamente uma palavra preditiva de retorno, damn, uma sobrevivente que o notebook interpreta como capacidade preditiva mínima, e não descoberta; a volatilidade mantém 12 palavras e mostra persistência genuína. Adicionar a volatilidade do dia anterior eleva o lasso de zero palavras selecionadas para um R-squared dentro da amostra de 0,262, uma lição compacta sobre testes múltiplos e confundimento.
- Prova
- Bot de pôquer adaptativo com um fluxo de trabalho de estudo documentado: roteamento posterior de oponentes, pontuação empacotada de EV por bucket, busca no turn condicionada por incerteza, e backtests de baralho duplicado orientados por manifesto com snapshots congelados de release.
- Evidência
- Repositório público de submissão
- Fronteira de capacidade e evidência
- A evidência repousa sobre o bot commitado e o método documentado; os scripts de estudo de baralho duplicado que regeneram as comparações permanecem fora da árvore pública, um benchmark público de resultado principal contra o campo de torneio ao vivo permanece pendente, e os modelos de oponente permanecem heurísticos e estatísticos.
Um bot de pôquer de torneio construído para a competição do CMU Data Science Club, voltado para a tomada de decisão sob incerteza contra oponentes variados e adversariais. O bot lê tendências dos oponentes a partir de sinais de aposta ao vivo, roteia entre estratégias especialistas por meio de um seletor no estilo bandit, e gasta busca mais pesada no turn apenas em situações de alta incerteza. Um framework de backtest orientado por manifesto, com reconciliação de baralho duplicado e snapshots congelados de release, registra cada decisão de promoção contra oponentes fixos e pesos de pontuação.