Pablo Zavala · Evaluación de seguridad de IA · Ingeniería de investigación

Construyo evaluaciones reproducibles para agentes de IA con autoridad para tomar acciones reales.

El trabajo plantea una pregunta práctica: cuándo debe actuar un agente por su cuenta, cuándo debe revisarlo una persona y cómo sabemos que la evidencia es confiable. Los repositorios públicos incluyen los artefactos detrás de los números principales.

Trabajo seleccionado

Authority Calibration

Prueba
Piloto público de uso de autoridad: divulgación en 14/14 y 12/12 pruebas de supresión; auto degradación en 9/9 y 8/8 ensayos con regla; 0 inversiones firebreak observadas; prueba separada en Codex detectó 6/19 debilitamientos de assurance
Evidencia
Repositorio público reproducible
Frontera de capacidad y evidencia
Evidencia de piloto; fallas raras quedan fuera de medición.

Los agentes de IA ya ejecutan flujos de trabajo, asignan recursos y coordinan otros agentes. Este proyecto evalúa si usan la autoridad delegada correctamente: dentro del mandato y sin rechazar poder que sí poseen.

Safe MarketUniverses

Prueba
120 episodios; pérdida por confianza 0,176 frente a azar 0,191
Evidencia
Banco de prueba público reproducible
Frontera de capacidad y evidencia
El banco de prueba evalúa asignación en un entorno financiero compacto; otros contextos requieren validación separada.

En un banco de prueba de 120 episodios para asignar supervisión, la asignación por confianza llegó a pérdida 0,176 frente a 0,191 de asignación aleatoria, una diferencia insuficiente como señal de triaje.

Evaluación RAG

Prueba
86,6 por ciento de precisión contextual tras reescritura de consultas y reordenamiento; la coincidencia exacta cayó en la partición completa de 918 consultas
Evidencia
Banco público de evaluación
Frontera de capacidad y evidencia
La fundamentación mejoró mientras la coincidencia exacta determinística bajó; el resultado es una tensión entre métricas.

Banco de prueba que compara flujos RAG base y reordenados con métricas RAGAS y SQuAD en Mini Wikipedia. El flujo reordenado alcanza 86,6 por ciento de precisión contextual, pero pierde coincidencia exacta.

DonorsChoose ML

Prueba
ROC AUC 0,757 en más de 185.000 proyectos de aula reservados para prueba
Evidencia
Repositorio público de análisis
Frontera de capacidad y evidencia
El modelo sirve como ayuda de triaje; usarlo como sistema de decisión de financiamiento exige validación adicional.

Modelo que identifica solicitudes de aula en DonorsChoose con mayor riesgo de quedar sin financiamiento, para dirigir atención de revisores hacia escuelas con menos recursos. La auditoría de equidad reporta tasas de error desiguales por nivel de pobreza escolar.

Frontera de privacidad en SQLite

Prueba
Seis autoverificaciones de frontera controlan CI: determinismo, un piso de texto distinto k=5, un authorizer SQL de solo lectura, censura en reposo, una auditoría encadenada por hash y un extracto sin tablas privadas
Evidencia
Repositorio público y reproducible
Frontera de capacidad y evidencia
Los controles son estructurales, no semánticos; la censura por patrones no detecta texto autoidentificante novedoso, y el piso cuenta texto distinto en lugar de personas.

Un prototipo sin dependencias publica estructura a partir de un conjunto de datos de texto libre en SQLite sin exponer filas crudas ni tablas base privadas. La censura por patrones limpia el texto antes de almacenarlo, un piso de texto distinto de k=5 controla cada tema público y celda agregada, y el authorizer de SQLite deniega escrituras, tablas privadas y columnas sensibles en cada consulta.

NUDG

Prueba
Autorización, restricciones, verificación y recibos para trabajo ejecutado por agentes
Evidencia
Sistema de fundador, afirmaciones públicas acotadas
Frontera de capacidad y evidencia
Los visuales públicos explican el modelo del sistema; las afirmaciones de producto en producción requieren paquetes de prueba separados.

NUDG es un proyecto de CMU AI Venture Studio para controlar cómo los agentes usan recursos reales. Sustituye acceso amplio por capas de propuesta, autorización, ejecución, verificación y recibos.

Estándar de evidencia

Medir un modo de falla concreto

Exceso de autoridad, mal triaje de supervisión, fundamentación débil y errores desiguales de intervención se nombran antes de puntuarse.

Usar el evaluador adecuado para la afirmación

Verificaciones de código, métricas juzgadas por modelos, auditorías legibles y líneas base determinísticas se alinean con la tarea de evaluación.

Convertir las brechas de la afirmación en capacidad

Los resultados nulos, errores del evaluador, restricciones de datos privados y líneas base frágiles se convierten en trabajo explícito de construcción o validación junto a los números principales.