- Prueba
- Piloto público de uso de autoridad: divulgación en 14/14 y 12/12 pruebas de supresión; auto degradación en 9/9 y 8/8 ensayos con regla; 0 inversiones firebreak observadas; prueba separada en Codex detectó 6/19 debilitamientos de assurance
- Evidencia
- Repositorio público reproducible
- Frontera de capacidad y evidencia
- Evidencia de piloto; fallas raras quedan fuera de medición.
Los agentes de IA ya ejecutan flujos de trabajo, asignan recursos y coordinan otros agentes. Este proyecto evalúa si usan la autoridad delegada correctamente: dentro del mandato y sin rechazar poder que sí poseen.
- Prueba
- 120 episodios; pérdida por confianza 0,176 frente a azar 0,191
- Evidencia
- Banco de prueba público reproducible
- Frontera de capacidad y evidencia
- El banco de prueba evalúa asignación en un entorno financiero compacto; otros contextos requieren validación separada.
En un banco de prueba de 120 episodios para asignar supervisión, la asignación por confianza llegó a pérdida 0,176 frente a 0,191 de asignación aleatoria, una diferencia insuficiente como señal de triaje.
- Prueba
- 86,6 por ciento de precisión contextual tras reescritura de consultas y reordenamiento; la coincidencia exacta cayó en la partición completa de 918 consultas
- Evidencia
- Banco público de evaluación
- Frontera de capacidad y evidencia
- La fundamentación mejoró mientras la coincidencia exacta determinística bajó; el resultado es una tensión entre métricas.
Banco de prueba que compara flujos RAG base y reordenados con métricas RAGAS y SQuAD en Mini Wikipedia. El flujo reordenado alcanza 86,6 por ciento de precisión contextual, pero pierde coincidencia exacta.
- Prueba
- ROC AUC 0,757 en más de 185.000 proyectos de aula reservados para prueba
- Evidencia
- Repositorio público de análisis
- Frontera de capacidad y evidencia
- El modelo sirve como ayuda de triaje; usarlo como sistema de decisión de financiamiento exige validación adicional.
Modelo que identifica solicitudes de aula en DonorsChoose con mayor riesgo de quedar sin financiamiento, para dirigir atención de revisores hacia escuelas con menos recursos. La auditoría de equidad reporta tasas de error desiguales por nivel de pobreza escolar.
- Prueba
- Seis autoverificaciones de frontera controlan CI: determinismo, un piso de texto distinto k=5, un authorizer SQL de solo lectura, censura en reposo, una auditoría encadenada por hash y un extracto sin tablas privadas
- Evidencia
- Repositorio público y reproducible
- Frontera de capacidad y evidencia
- Los controles son estructurales, no semánticos; la censura por patrones no detecta texto autoidentificante novedoso, y el piso cuenta texto distinto en lugar de personas.
Un prototipo sin dependencias publica estructura a partir de un conjunto de datos de texto libre en SQLite sin exponer filas crudas ni tablas base privadas. La censura por patrones limpia el texto antes de almacenarlo, un piso de texto distinto de k=5 controla cada tema público y celda agregada, y el authorizer de SQLite deniega escrituras, tablas privadas y columnas sensibles en cada consulta.
- Prueba
- Autorización, restricciones, verificación y recibos para trabajo ejecutado por agentes
- Evidencia
- Sistema de fundador, afirmaciones públicas acotadas
- Frontera de capacidad y evidencia
- Los visuales públicos explican el modelo del sistema; las afirmaciones de producto en producción requieren paquetes de prueba separados.
NUDG es un proyecto de CMU AI Venture Studio para controlar cómo los agentes usan recursos reales. Sustituye acceso amplio por capas de propuesta, autorización, ejecución, verificación y recibos.
- Prueba
- Más de $10B mapeados en 11 metros; Pittsburgh: $6,3B en 133 firmas
- Evidencia
- Datos restringidos, resumen agregado público
- Frontera de capacidad y evidencia
- Los registros y mapas a nivel de empresa permanecen privados; la página pública muestra agregados y evidencia metodológica.
Proyecto del Block Center que mapea más de diez mil millones de dólares en inversión pública y privada en IA a través de once economías metropolitanas. El corte de Pittsburgh cubre 6,3 mil millones de dólares en 133 firmas.
- Prueba
- 14,3 por ciento frente a 3,6 por ciento de desempleo pico bajo regímenes emparejados
- Evidencia
- Repositorio público de simulación
- Frontera de capacidad y evidencia
- Demostración de mecanismo en un mercado laboral pequeño, fuera del alcance de una predicción macroeconómica.
Modelo basado en agentes en NetLogo de un pequeño mercado laboral que se ajusta a automatización con IA. Con trabajadores, geografía y semilla iguales, el desempleo pico llega a 14,3 por ciento bajo una política impulsada por tecnología frente a 3,6 por ciento bajo una política centrada en personas.
- Prueba
- Muestra pública sintética con 7/7 verificaciones de privacidad e integridad
- Evidencia
- Piloto privado, artefacto público sintético
- Frontera de capacidad y evidencia
- Los visuales públicos usan texto sintético para proteger mensajes comunitarios.
Piloto de escucha cívica con el profesor Jordan Usdan de Heinz College que almacena aportes crudos en privado y publica extractos con verificaciones de privacidad. La muestra sintética pública demuestra una ruta 7/7 de verificación mientras protege mensajes comunitarios.
- Prueba
- Claude vision extrae tarjetas de afiches; la exportación estática sin backend corre con un tablero de muestra
- Evidencia
- Demo estática en vivo
- Frontera de capacidad y evidencia
- La demo verifica el flujo de extracción con tablero de muestra; la cobertura en vivo del campus queda fuera de alcance.
Prototipo que convierte una foto de una pared de afiches del campus en listados estructurados y personalizados. Claude vision extrae una ficha por afiche; un clasificador determinístico en el navegador ordena resultados por intereses y la app se publica como exportación estática sin backend.
- Prueba
- Modelo de flujo de caja hora por hora con búsqueda de portafolios de termostatos, solar y baterías
- Evidencia
- Artefacto de proyecto final por solicitud
- Frontera de capacidad y evidencia
- El artefacto público muestra el flujo funcional; los materiales completos del proyecto final son privados.
Herramienta de planificación en Streamlit para respuesta de demanda en ERCOT. Compara portafolios de termostatos, solar y baterías hora por hora mediante análisis costo-beneficio de flujo de caja.
- Prueba
- Holdout de umbral congelado: exhaustividad de 0,9000 (162 de 180 ataques; IC del 95% de 0,85 a 0,94) con FPR de 0,0194, ROC AUC de 0,9714, a partir de un Isolation Forest ajustado sobre tráfico exclusivamente benigno
- Evidencia
- Repositorio público reproducible + notebook ejecutado
- Frontera de capacidad y evidencia
- La precisión en el umbral elegido es de 0,3189 con una prevalencia simulada del 1%, la clase maliciosa contiene una única campaña de preparación de botnet en un solo host honeypot, y tres variables dominantes dejan al detector vulnerable a la suplantación.
Un proyecto de analítica de seguridad de Carnegie Mellon que ajusta un Isolation Forest sobre tráfico de kernel de Linux exclusivamente benigno, tomado del conjunto de datos honeypot BETH, y luego lo puntúa bajo un umbral congelado. En un holdout de 18.000 eventos con una prevalencia simulada de ataque del 1%, el detector captura el 90% de las intrusiones (162 de 180) con una tasa de falsos positivos de 1,94%, con ROC AUC de 0,9714. La entrada audita su propia cifra principal: la precisión se sitúa en 0,3189, de modo que aproximadamente una de cada tres alertas señala un ataque real, y tres variables dominantes le entregan a un atacante un manual de suplantación, lo cual mantiene al detector como una sola capa dentro de la defensa en profundidad.
- Prueba
- A través de aproximadamente diez modelos ajustados, el R² con validación cruzada aleatoria de 0,621 cae a 0,431 bajo validación por bloques espaciales, y un espectro de dejar una región fuera hace que el desempeño de los ensambles de árboles decaiga hacia cero; Double ML estima una prima costera directa de +29,8% (IC del 95% [0,16; 0,33] en puntos logarítmicos) y reduce la brecha ingenua de escuela privada a +0,7%.
- Evidencia
- Repositorio público reproducible y documento de trabajo
- Frontera de capacidad y evidencia
- Las lecturas causales se sostienen solo bajo el supuesto de ignorabilidad, la estimación costera descansa sobre 100 viviendas tratadas, y los términos de terceros mantienen los registros a nivel de vivienda fuera del repositorio, de modo que una reejecución completa parte de la tabla depurada que el código de ingesta confirmado reconstruye.
Un estudio de big data de la Universidad de Chicago Booth, escrito en coautoría con Will Sigal, que fija el precio de 3.804 viviendas unifamiliares del condado de Los Ángeles a partir de características estructurales y del vecindario, y luego audita su propia cifra principal. Un ensamble apilado y ajustado alcanza un R² fuera de muestra de 0,621 bajo validación cruzada aleatoria y cae a 0,431 cuando la evaluación se traslada a bloques geográficos reservados; en el espectro separado de dejar una región fuera, el desempeño de los ensambles de árboles decae hacia cero, mientras el modesto modelo lineal regularizado es el que mejor extrapola en el espacio. Double/Debiased ML con ajuste cruzado sitúa la prima costera directa cerca de +29,8% por pie cuadrado, mientras la prima ingenua de escuela privada colapsa a un cero estadístico.
- Prueba
- En simulación, la asignación MILP consciente del riesgo con 240 agentes (peso de riesgo base alfa = 1) alcanzó 94,8 por ciento de puntualidad con 89,4 por ciento de cobertura, frente a una línea base observada de 48,8 por ciento sobre los mismos datos sintéticos de entrega.
- Evidencia
- Repositorio público (notebooks confirmados y reporte)
- Frontera de capacidad y evidencia
- Cada tasa principal proviene de una simulación sobre un conjunto de datos sintético de entrega de Kaggle; el reporte señala la calibración de capacidad como el supuesto frágil, y el conjunto de datos en sí permanece fuera del repositorio público a la espera de revisión de licencia, con una referencia en el README para la descarga.
Un marco de predicción y optimización para entrega de última milla, construido con Santiago Enríquez como equipo equilibrado de dos personas para el curso 94-867 Data to Action de Carnegie Mellon. Modelos de gradient boosting pronostican una estimación central y un límite en el percentil 80 del tiempo de entrega sobre un conjunto de datos sintético de Kaggle con registros de entrega de estilo Amazon; el MILP de triaje filtra pedidos según el pronóstico de la cola, mientras el MILP de simulación asigna un precio a cada pedido según el riesgo, estimado por un clasificador, de incumplir su promesa de servicio fijada de forma conforme. En simulación día a día, la asignación consciente del riesgo alcanzó 94,8 por ciento de puntualidad con 89,4 por ciento de cobertura frente a una línea base observada de 48,8 por ciento.
- Prueba
- A través de 3.183 palabras de titulares con un FDR del 10 por ciento, los retornos conservan una sobreviviente (damn, p = 1,0262e-05) frente a 12 palabras para la volatilidad; añadir la volatilidad del día anterior eleva el lasso de cero palabras seleccionadas a un R² dentro de muestra de 0,262.
- Evidencia
- Repositorio público de notebooks
- Frontera de capacidad y evidencia
- Evidencia dentro de muestra de un único notebook ejecutado sobre un conjunto de datos que termina el 1 de julio de 2016; los archivos CSV fuente permanecen fuera del repositorio público por razones de licencia, de modo que una reejecución comienza con la descarga de Kaggle más los archivos de palabras derivados que documenta el README.
Un notebook de trabajo de curso de big data de Carnegie Mellon que pregunta si las palabras de los titulares diarios de noticias de Reddit predicen al Dow. A través de 3.183 palabras filtradas, las regresiones marginales con control FDR de Benjamini-Hochberg dejan exactamente una palabra con capacidad predictiva sobre los retornos, damn, una sobreviviente que el notebook interpreta como capacidad predictiva mínima y no como un descubrimiento; la volatilidad conserva 12 palabras y presenta persistencia genuina. Añadir la volatilidad del día anterior eleva el lasso de cero palabras seleccionadas a un R² dentro de muestra de 0,262, una lección compacta sobre pruebas múltiples y confusión.
- Prueba
- Bot de póker adaptativo con un flujo de estudio documentado: enrutamiento posterior de oponentes, puntuación empaquetada de EV por categoría, búsqueda en el turn condicionada por incertidumbre, y backtests de mazo duplicado guiados por manifiesto con capturas de lanzamiento congeladas.
- Evidencia
- Repositorio público de entrega
- Frontera de capacidad y evidencia
- La evidencia descansa en el bot confirmado y el método documentado; los scripts de estudio de mazo duplicado que regeneran las comparaciones permanecen fuera del árbol público, un benchmark público de titular frente al campo de torneo en vivo sigue pendiente, y los modelos de oponente siguen siendo heurísticos y estadísticos.
Un bot de póker de torneo construido para la competencia del CMU Data Science Club, orientado a la toma de decisiones bajo incertidumbre frente a oponentes variados y adversariales. El bot lee las tendencias del oponente a partir de señales de apuesta en vivo, enruta entre estrategias especialistas mediante un selector de estilo bandit, y dedica una búsqueda más pesada en la calle del turn solo a los puntos de alta incertidumbre. Un arnés de backtest guiado por manifiesto, con reconciliación de mazo duplicado y capturas de lanzamiento congeladas, registra cada decisión de promoción frente a oponentes fijos y pesos de puntaje.