- Preuve
- Pilote public d'usage d'autorité : divulgation en 14/14 et 12/12 tests de suppression; auto-démotion en 9/9 et 8/8 essais; 0 inversion firebreak observée; test Codex séparé avec 6/19 affaiblissements d'assurance
- Preuve
- Dépôt public reproductible
- Frontière des capacités et des preuves
- Preuve de pilote; les échecs rares demandent des échantillons plus grands.
Les agents IA exécutent déjà des chaînes de travail, allouent des ressources et coordonnent d'autres agents. Ce projet évalue s'ils respectent l'autorité déléguée : agir dans le mandat et accepter les responsabilités valides.
- Preuve
- 120 épisodes; perte par confiance 0,176 contre hasard 0,191
- Preuve
- Banc d'évaluation public reproductible
- Frontière des capacités et des preuves
- Le banc teste l'allocation dans un environnement financier compact; d'autres contextes exigent validation séparée.
Dans un banc d'évaluation de 120 épisodes pour allouer la supervision, l'allocation par confiance atteint une perte 0,176 contre 0,191 pour une allocation aléatoire, un écart trop faible pour servir de signal de triage.
- Preuve
- 86,6 % de précision contextuelle après réécriture de requêtes et réordonnancement; correspondance exacte en baisse sur la partition complète de 918 requêtes
- Preuve
- Banc d'essai public d'évaluation
- Frontière des capacités et des preuves
- L'ancrage s'améliore tandis que la correspondance exacte déterministe baisse; le résultat est un arbitrage.
Banc d'essai comparant des chaînes RAG de base et réordonnées avec métriques RAGAS et SQuAD sur Mini Wikipedia. La chaîne réordonnée atteint 86,6 % de précision contextuelle, mais perd en correspondance exacte.
- Preuve
- ROC AUC 0,757 sur plus de 185 000 projets réservés au test
- Preuve
- Dépôt public d'analyse
- Frontière des capacités et des preuves
- Le modèle sert d'aide au triage; un système de décision de financement exigerait validation supplémentaire.
Modèle qui identifie les demandes DonorsChoose les plus à risque de rester sans financement, afin de diriger l'attention limitée des réviseurs vers les écoles sous-dotées. L'audit d'équité reporte des taux d'erreur inégaux par niveau de pauvreté scolaire.
- Preuve
- Six auto-vérifications de frontière contrôlent la CI : déterminisme, un plancher de texte distinct k=5, un authorizer SQL en lecture seule, du caviardage au repos, un audit chaîné par hash et un extrait sans table privée
- Preuve
- Dépôt public et reproductible
- Frontière des capacités et des preuves
- Les contrôles restent structurels plutôt que sémantiques ; le caviardage par motifs manque le texte auto-identifiant inédit, et le plancher compte du texte distinct plutôt que des personnes.
Un prototype sans dépendances publie de la structure à partir d'un jeu de données de texte libre en SQLite sans exposer les lignes brutes ni les tables de base privées. Le caviardage par motifs nettoie le texte avant stockage, un plancher de texte distinct de k=5 contrôle chaque sujet public et cellule agrégée, et l'authorizer de SQLite refuse les écritures, les tables privées et les colonnes sensibles à chaque requête.
- Preuve
- Autorisation, contraintes, vérification et reçus pour le travail exécuté par agents
- Preuve
- Système de fondateur, affirmations publiques bornées
- Frontière des capacités et des preuves
- Les visuels publics expliquent le modèle système; les affirmations de produit en production exigent des paquets de preuve séparés.
NUDG est un projet du CMU AI Venture Studio pour contrôler l'usage de ressources réelles par les agents. Il remplace l'accès large par proposition, autorisation, exécution, vérification et reçus.
- Preuve
- Plus de $10B cartographiés dans 11 métros; Pittsburgh : $6,3B dans 133 firmes
- Preuve
- Données restreintes, résumé agrégé public
- Frontière des capacités et des preuves
- Les cartes et tables par entreprise restent privées; la page publique montre agrégats et preuve méthodologique.
Projet du Block Center cartographiant plus de dix milliards de dollars d'investissement public et privé en IA dans onze économies métropolitaines. La tranche Pittsburgh couvre 6,3 milliards de dollars et 133 firmes.
- Preuve
- 14,3 % contre 3,6 % de chômage pic sous régimes appariés
- Preuve
- Dépôt public de simulation
- Frontière des capacités et des preuves
- Démonstration de mécanisme dans un petit marché simulé, hors prévision macroéconomique.
Modèle NetLogo par agents d'un petit marché du travail qui s'ajuste à l'automatisation IA. À travailleurs, géographie et graine identiques, le pic de chômage atteint 14,3 % sous politique portée par la technologie contre 3,6 % sous politique centrée sur les personnes.
- Preuve
- Échantillon synthétique public avec 7/7 contrôles de confidentialité et d'intégrité
- Preuve
- Pilote privé, artefact synthétique public
- Frontière des capacités et des preuves
- Les visuels publics utilisent du texte synthétique pour protéger les messages communautaires.
Pilote d'écoute civique avec le professeur Jordan Usdan de Heinz College, qui garde les contributions brutes privées et publie des extraits vérifiés pour la confidentialité. L'échantillon synthétique public montre une route de vérification 7/7.
- Preuve
- Claude vision extrait des cartes d'affiches; l'export statique sans backend fonctionne avec un tableau d'exemple
- Preuve
- Démo statique en direct
- Frontière des capacités et des preuves
- La démo vérifie le flux d'extraction sur un tableau d'exemple; la couverture en direct du campus reste hors périmètre.
Prototype qui transforme une photo de mur d'affiches du campus en listes structurées et personnalisées. Claude vision extrait une fiche par affiche, puis un classeur déterministe dans le navigateur ordonne les résultats.
- Preuve
- Modèle de flux de trésorerie heure par heure avec recherche de portefeuilles thermostat, solaire et batterie
- Preuve
- Artefact de projet de fin d'études sur demande
- Frontière des capacités et des preuves
- L'artefact public montre le flux fonctionnel; les matériaux complets du projet restent privés.
Outil Streamlit de planification de réponse à la demande pour ERCOT. Il compare thermostats, solaire et batteries heure par heure via analyse coût-bénéfice de flux de trésorerie.
- Preuve
- Holdout à seuil gelé : rappel de 0,9000 (162 attaques sur 180 ; IC à 95 % de 0,85 à 0,94) pour un FPR de 0,0194, ROC AUC 0,9714, à partir d'une Isolation Forest ajustée sur du trafic exclusivement bénin
- Preuve
- Dépôt public reproductible et notebook exécuté
- Frontière des capacités et des preuves
- La précision au seuil retenu est de 0,3189 à une prévalence simulée de 1 %, la classe malveillante ne comporte qu'une seule campagne de préparation de botnet sur un unique hôte honeypot, et trois caractéristiques dominantes rendent le détecteur vulnérable à l'usurpation.
Un projet d'analytique de sécurité de Carnegie Mellon qui ajuste une Isolation Forest sur du trafic noyau Linux exclusivement bénin issu du jeu de données honeypot BETH, puis l'évalue sous un seuil gelé. Sur un holdout de 18 000 événements à une prévalence d'attaque simulée de 1 %, le détecteur capte 90 % des intrusions (162 sur 180) avec un taux de faux positifs de 1,94 %, pour un ROC AUC de 0,9714. L'entrée audite elle-même son chiffre phare : la précision s'établit à 0,3189, si bien qu'environ une alerte sur trois signale une attaque réelle, et trois caractéristiques dominantes livrent à un attaquant un mode d'emploi de l'usurpation, ce qui cantonne le détecteur à une seule couche d'une défense en profondeur.
- Preuve
- Sur une dizaine de modèles réglés, le R² en validation croisée aléatoire de 0,621 retombe à 0,431 sous validation croisée par blocs spatiaux, et un spectre d'exclusion d'une région à la fois envoie la capacité prédictive des ensembles d'arbres vers zéro ; le Double ML estime une prime côtière directe de +29,8 % (IC à 95 % [0,16; 0,33] point logarithmique) et réduit l'écart naïf associé aux écoles privées à +0,7 %.
- Preuve
- Dépôt public reproductible et document de travail
- Frontière des capacités et des preuves
- Les lectures causales tiennent uniquement sous ignorabilité, l'estimation côtière repose sur 100 maisons traitées, et des conditions imposées par des tiers maintiennent les données au niveau du logement hors du dépôt, si bien qu'une relance complète part de la table nettoyée que le code d'ingestion versionné reconstruit.
Une étude big data de l'University of Chicago Booth, coécrite avec Will Sigal, qui établit le prix de 3 804 maisons individuelles du comté de Los Angeles à partir de caractéristiques structurelles et de quartier, puis en audite elle-même le chiffre phare. Un ensemble empilé réglé atteint un R² hors échantillon de 0,621 sous validation croisée aléatoire et retombe à 0,431 lorsque l'évaluation se déplace vers des blocs géographiques mis de côté ; sur le spectre distinct d'exclusion d'une région à la fois, la capacité prédictive des ensembles d'arbres décroît vers zéro tandis que l'humble modèle linéaire régularisé résiste le mieux dans l'espace. Le Double/Debiased ML à ajustement croisé porte la prime côtière directe à près de +29,8 % par pied carré, tandis que la prime naïve associée aux écoles privées s'effondre à un zéro statistique.
- Preuve
- En simulation, l'affectation MILP sensible au risque avec 240 agents (pondération de risque de base alpha = 1) a atteint un taux de livraison à l'heure de 94,8 % pour une couverture de 89,4 %, contre une base de référence observée de 48,8 % sur les mêmes données de livraison synthétiques.
- Preuve
- Dépôt public (notebooks et rapport versionnés)
- Frontière des capacités et des preuves
- Chaque taux phare provient d'une simulation sur un jeu de données de livraison Kaggle synthétique ; le rapport signale la calibration de capacité comme l'hypothèse fragile, et le jeu de données lui-même reste hors du dépôt public en attente d'une revue de licence, avec un pointeur dans le README.
Un cadre de type prédire-puis-optimiser pour la livraison du dernier kilomètre, construit avec Santiago Enríquez en binôme équilibré pour le cours 94-867 Data to Action de Carnegie Mellon. Des modèles à gradient boosting prévoient le temps de livraison typique et son 80e centile sur un jeu de données Kaggle synthétique de dossiers de livraison de type Amazon ; une marge conforme fixe la promesse de service de chaque commande, et le score de risque d'un classificateur tarife la sous-traitance au sein de modèles MILP de triage et d'affectation. En simulation jour par jour, l'affectation sensible au risque a atteint un taux de livraison à l'heure de 94,8 % pour une couverture de 89,4 %, contre une base de référence observée de 48,8 %.
- Preuve
- Sur 3 183 mots de titres à un FDR de 10 %, les rendements ne conservent qu'un seul survivant (damn, p = 1,0262e-05) contre 12 mots pour la volatilité ; l'ajout de la volatilité du jour précédent fait passer le lasso de zéro mot sélectionné à un R² dans l'échantillon de 0,262.
- Preuve
- Dépôt public de notebook
- Frontière des capacités et des preuves
- Preuve dans l'échantillon tirée d'un seul notebook exécuté sur un jeu de données s'arrêtant au 1er juillet 2016 ; les CSV source restent hors du dépôt public pour des raisons de licence, si bien qu'une relance part du téléchargement Kaggle plus les fichiers de mots dérivés que documente le README.
Un notebook de travail de cours en big data à Carnegie Mellon qui se demande si les mots des titres d'actualité quotidiens de Reddit prédisent le Dow. Sur 3 183 mots filtrés, des régressions marginales avec contrôle FDR de Benjamini-Hochberg ne laissent subsister qu'un seul mot prédictif des rendements, damn, un survivant que le notebook interprète comme une prévisibilité minimale plutôt qu'une découverte ; la volatilité conserve 12 mots et montre une véritable persistance. L'ajout de la volatilité du jour précédent fait passer le lasso de zéro mot sélectionné à un R² dans l'échantillon de 0,262, une leçon compacte sur les tests multiples et la confusion.
- Preuve
- Bot de poker adaptatif avec un flux de travail d'étude documenté : routage postérieur des adversaires, scoring EV par compartiment empaqueté, recherche au tour conditionnée par l'incertitude, et backtests par paquets dupliqués pilotés par manifeste avec instantanés de version figés.
- Preuve
- Dépôt de soumission public
- Frontière des capacités et des preuves
- La preuve repose sur le bot versionné et la méthode documentée ; les scripts d'étude par paquets dupliqués qui régénèrent les comparaisons restent hors de l'arborescence publique, un benchmark public de référence face au champ de tournoi réel demeure en attente, et les modèles d'adversaires restent heuristiques et statistiques.
Un bot de poker de tournoi construit pour la compétition du CMU Data Science Club, visant la prise de décision sous incertitude face à des adversaires variés et hostiles. Le bot lit les tendances des adversaires à partir de signaux de mise en direct, oriente entre des stratégies spécialisées via un sélecteur de type bandit, et ne dépense une recherche plus lourde au tour (turn) que sur les situations à forte incertitude. Un harnais de backtest piloté par manifeste, avec réconciliation par paquets dupliqués et instantanés de version figés, enregistre chaque décision de promotion face à des adversaires fixes et des pondérations de score.