Pablo Zavala · Évaluation de sécurité IA · Ingénierie de recherche

Je construis des évaluations reproductibles pour des agents d'IA ayant l'autorité d'agir dans le monde réel.

Le travail pose une question pratique : quand un agent doit-il agir seul, quand une personne doit-elle examiner sa décision et comment savoir si la preuve est fiable ? Les dépôts publics incluent les artefacts derrière les chiffres principaux.

Travail sélectionné

Authority Calibration

Preuve
Pilote public d'usage d'autorité : divulgation en 14/14 et 12/12 tests de suppression; auto-démotion en 9/9 et 8/8 essais; 0 inversion firebreak observée; test Codex séparé avec 6/19 affaiblissements d'assurance
Preuve
Dépôt public reproductible
Frontière des capacités et des preuves
Preuve de pilote; les échecs rares demandent des échantillons plus grands.

Les agents IA exécutent déjà des chaînes de travail, allouent des ressources et coordonnent d'autres agents. Ce projet évalue s'ils respectent l'autorité déléguée : agir dans le mandat et accepter les responsabilités valides.

Safe MarketUniverses

Preuve
120 épisodes; perte par confiance 0,176 contre hasard 0,191
Preuve
Banc d'évaluation public reproductible
Frontière des capacités et des preuves
Le banc teste l'allocation dans un environnement financier compact; d'autres contextes exigent validation séparée.

Dans un banc d'évaluation de 120 épisodes pour allouer la supervision, l'allocation par confiance atteint une perte 0,176 contre 0,191 pour une allocation aléatoire, un écart trop faible pour servir de signal de triage.

Évaluation RAG

Preuve
86,6 % de précision contextuelle après réécriture de requêtes et réordonnancement; correspondance exacte en baisse sur la partition complète de 918 requêtes
Preuve
Banc d'essai public d'évaluation
Frontière des capacités et des preuves
L'ancrage s'améliore tandis que la correspondance exacte déterministe baisse; le résultat est un arbitrage.

Banc d'essai comparant des chaînes RAG de base et réordonnées avec métriques RAGAS et SQuAD sur Mini Wikipedia. La chaîne réordonnée atteint 86,6 % de précision contextuelle, mais perd en correspondance exacte.

DonorsChoose ML

Preuve
ROC AUC 0,757 sur plus de 185 000 projets réservés au test
Preuve
Dépôt public d'analyse
Frontière des capacités et des preuves
Le modèle sert d'aide au triage; un système de décision de financement exigerait validation supplémentaire.

Modèle qui identifie les demandes DonorsChoose les plus à risque de rester sans financement, afin de diriger l'attention limitée des réviseurs vers les écoles sous-dotées. L'audit d'équité reporte des taux d'erreur inégaux par niveau de pauvreté scolaire.

Frontière de confidentialité SQLite

Preuve
Six auto-vérifications de frontière contrôlent la CI : déterminisme, un plancher de texte distinct k=5, un authorizer SQL en lecture seule, du caviardage au repos, un audit chaîné par hash et un extrait sans table privée
Preuve
Dépôt public et reproductible
Frontière des capacités et des preuves
Les contrôles restent structurels plutôt que sémantiques ; le caviardage par motifs manque le texte auto-identifiant inédit, et le plancher compte du texte distinct plutôt que des personnes.

Un prototype sans dépendances publie de la structure à partir d'un jeu de données de texte libre en SQLite sans exposer les lignes brutes ni les tables de base privées. Le caviardage par motifs nettoie le texte avant stockage, un plancher de texte distinct de k=5 contrôle chaque sujet public et cellule agrégée, et l'authorizer de SQLite refuse les écritures, les tables privées et les colonnes sensibles à chaque requête.

NUDG

Preuve
Autorisation, contraintes, vérification et reçus pour le travail exécuté par agents
Preuve
Système de fondateur, affirmations publiques bornées
Frontière des capacités et des preuves
Les visuels publics expliquent le modèle système; les affirmations de produit en production exigent des paquets de preuve séparés.

NUDG est un projet du CMU AI Venture Studio pour contrôler l'usage de ressources réelles par les agents. Il remplace l'accès large par proposition, autorisation, exécution, vérification et reçus.

Standard de preuve

Mesurer un mode de défaillance concret

Excès d'autorité, mauvais triage de supervision, ancrage faible et erreurs d'intervention inégales sont nommés avant d'être évalués.

Choisir le correcteur adapté à l'affirmation

Contrôles de code, métriques jugées par modèles, audits lisibles et lignes de base déterministes sont alignés avec la tâche d'évaluation.

Transformer les lacunes de l'affirmation en capacité

Les résultats nuls, erreurs d'évaluation, contraintes liées aux données privées et lignes de base fragiles deviennent un travail explicite de construction ou de validation à côté des chiffres principaux.