Pablo Zavala · AI 安全评估 · 研究工程

有证据支撑的 AI 评估项目

公开评估仓库、受限数据研究摘要与产品原型,按可检查工件和测量边界组织。

项目索引

Authority Calibration

证据
公开权限使用试点:14/14 和 12/12 个抑制测试中完成披露;9/9 和 8/8 个给定规则试验中自我降级;0 个匹配 firebreak 反转;独立 Codex 测试发现 6/19 次 assurance 削弱
证据
公开可复现仓库
能力与证据前沿
试点规模证据;罕见失败仍需更大样本。

AI 智能体越来越多地运行流程、分配资源并协调其他智能体。这个项目测试它们能否正确使用委托权限:既在授权边界内行动,也能使用自己确实拥有的权限。

Safe MarketUniverses

证据
120 回合;置信度相对损失 0.176 vs 随机 0.191
证据
公开可复现基准
能力与证据前沿
该基准测试紧凑金融风格环境中的分配;更广泛监督场景需要单独验证。

在一个 120 回合的监督分配基准中,基于置信度的相对损失为 0.176,而随机分配为 0.191;差距太小,无法作为可靠的监督分流信号。

RAG 评估

证据
查询重写和重排序后上下文精度 86.6%;918 个查询的完整划分上精确匹配下降
证据
公开评估工具链
能力与证据前沿
根据性提升,同时确定性精确匹配下降;结果是一个权衡。

一个评估工具链,在 Mini Wikipedia 上用 RAGAS 和 SQuAD 指标比较基线 RAG 流程与重排序流程。重排序流程达到 86.6% 上下文精度,但精确匹配下降。

DonorsChoose ML

证据
185,000+ 个留出测试课堂项目上 ROC AUC 0.757
证据
公开分析仓库
能力与证据前沿
该模型是政策分流辅助;若作为资助决策系统部署,需要额外验证。

一个模型,用于识别最可能无法获得资助的 DonorsChoose 课堂项目,使有限审查注意力优先触达资源不足学校。公平性审计将不同学校贫困水平上的错误率差异纳入部署分析。

SQLite 隐私边界

证据
六项边界自检对 CI 把关:确定性、k=5 去重文本下限、只读 SQL authorizer、静态脱敏、哈希链审计,以及不含私有表的导出库
证据
公开可复现代码仓库
能力与证据前沿
这些控制是结构性的而非语义性的;模式脱敏无法识别新型的自我标识文本,且该下限计数的是去重文本而非人数。

一个无依赖的原型从 SQLite 中的自由文本数据集发布结构,而不暴露原始行或私有基表。模式脱敏在存储前清理文本,k=5 的去重文本下限对每个公开主题和聚合单元格进行把关,SQLite 的 authorizer 在每次查询时拒绝写入、私有表和敏感列。

NUDG

证据
智能体执行工作的授权、约束、验证和收据
证据
创始人系统,公开声明有边界
能力与证据前沿
公开视觉材料解释系统模型;生产中的产品声明需要单独证明包。

NUDG 是 CMU AI Venture Studio 项目,用来控制智能体如何使用真实资源。它用提案、授权、执行、验证和收据分层替代宽泛访问权限。

AI 投资地图

证据
11 个都市区绘制 $10B+ 投资;Pittsburgh 覆盖 133 家企业、$6.3B
证据
受限数据,公开聚合摘要
能力与证据前沿
企业级记录和地图保持私有;公开页面展示聚合结果与方法证据。

Block Center 项目,绘制十一座都市经济体中超过一百亿美元的公共与私人 AI 投资。Pittsburgh 切片覆盖 133 家企业、63 亿美元投资。

AI 劳动力仿真

证据
配对政策下峰值失业率 14.3% vs 3.6%
证据
公开仿真仓库
能力与证据前沿
小型模拟劳动力市场中的机制演示,不作为宏观预测。

一个 NetLogo 基于智能体的模型,模拟小型劳动力市场如何适应 AI 自动化。在工人、地理结构和随机种子相同的情况下,技术驱动政策下峰值失业率为 14.3%,以人为本政策下为 3.6%。

Heard.now

证据
合成公开样本通过 7/7 隐私与完整性检查
证据
私有试点,合成公开工件
能力与证据前沿
公开视觉材料使用合成文本,使社区消息保持私有。

与 Heinz College Jordan Usdan 教授合作的公民聆听试点,将原始输入私下保存,并发布通过隐私检查的摘录。公开合成样本展示 7/7 验证路径,同时保护社区消息。

Event Compass

证据
Claude vision 提取海报卡片;无后台静态导出使用样本板运行
证据
在线静态演示
能力与证据前沿
演示验证样本板抽取流程;实时校园覆盖不在范围内。

一个原型,将校园海报墙照片转成结构化、个性化清单。Claude vision 为每张海报提取记录,浏览器内的确定性排序器根据兴趣排序结果。

DemFlex ERCOT

证据
逐小时现金流模型,搜索恒温器、太阳能和电池组合
证据
按请求提供的综合项目工件
能力与证据前沿
公开工件展示功能流程;完整综合项目材料保持私有。

用于 ERCOT 需求响应的 Streamlit 规划工具。它通过逐小时成本收益现金流分析比较恒温器、太阳能和电池组合。

网络安全异常

证据
冻结阈值留出集:召回率0.9000(180次攻击中的162次;95%置信区间0.85至0.94),假阳性率0.0194,ROC AUC为0.9714,来自一个在仅良性流量上拟合的孤立森林
证据
公开可复现仓库与已执行notebook
能力与证据前沿
在模拟1%流行率下,所选阈值对应的精确率为0.3189,恶意类别仅包含一台蜜罐主机上的单一僵尸网络部署活动,且三个主导特征使该检测器容易被欺骗。

这是一项Carnegie Mellon的安全分析项目,在来自BETH蜜罐数据集的仅良性Linux内核流量上拟合一个孤立森林,随后在冻结阈值下对其评分。在模拟1%攻击流行率下的18,000个事件留出集上,该检测器捕获了90%的入侵(180次入侵中的162次),假阳性率为1.94%,ROC AUC为0.9714。本条目对自己的头条结论进行了审查:精确率为0.3189,这意味着大约每三条告警中就有一条命中真实攻击,而三个主导特征为攻击者提供了一套欺骗手册,这使得该检测器只是纵深防御中的一层。

洛杉矶住房特征价格

证据
在约十个调优后的学习器中,随机交叉验证下R²为0.621,在空间分块交叉验证下降至0.431;而留一区域交叉验证跨度测试,则使树集成模型的表现趋近于零;Double ML估计出的直接沿海溢价为+29.8%(95%置信区间为[0.16, 0.33]对数点),并将朴素的私立学校差距收缩至+0.7%。
证据
公开可复现仓库与工作论文
能力与证据前沿
因果结论的成立仅以可忽略性假设为前提,沿海效应的估计依赖于100户接受处理的住宅,且第三方条款使住宅层级的数据行留在仓库之外,因此完整的重新运行须从已提交的数据摄取代码所重建出的已清洗数据表开始。

这是一项University of Chicago Booth的大数据研究,与Will Sigal合著,利用结构特征与社区特征,为洛杉矶县3,804套独栋住宅定价,随后对自己的头条结论进行审查。一个调优后的堆叠集成模型,在随机交叉验证下达到样本外R²为0.621,当评分转向留出的地理区块时降至0.431;而在另一项独立的留一区域交叉验证跨度测试中,树集成模型的表现衰减至趋近于零,这个毫不起眼的正则化线性模型反而在跨空间范围内表现最为稳健。交叉拟合的Double/Debiased ML显示,直接沿海溢价接近每平方英尺+29.8%,而朴素的私立学校溢价则收缩至统计上的零。

最后一公里配送

证据
在仿真中,240名配送员、基础风险权重alpha = 1的风险感知型MILP指派达到94.8%的准时率、89.4%的覆盖率,而同一份合成配送数据上的观测基线为48.8%。
证据
公开仓库(已提交的notebook与报告)
能力与证据前沿
每一个头条比率都来自对一个合成Kaggle配送数据集的仿真;报告把容量校准标记为最脆弱的假设,且该数据集本身出于许可审查原因未纳入公开仓库,README中提供了下载指引。

这是一套预测后优化框架,面向最后一公里配送设计,由一支与Santiago Enríquez均衡分工的两人团队,为Carnegie Mellon的94-867 Data to Action课程共同打造。梯度提升模型在一个仿Amazon风格配送记录的合成Kaggle数据集上,预测配送时间的中心估计值与第80百分位数上界;分流MILP依据尾部预测筛选订单,仿真MILP则由分类器估算的、订单错过其共形设定服务承诺的风险为每笔订单定价。在逐日仿真中,这套风险感知型指派方案达到94.8%的准时率、89.4%的覆盖率,而观测基线的准时率仅为48.8%。

Reddit与道指波动率

证据
在3,183个标题词、10% FDR水平下,收益率只留下一个幸存词(damn,p = 1.0262e-05),而波动率留下12个词;加入前一日波动率,能把lasso从零个被选中的词,提升到样本内R²为0.262。
证据
公开notebook仓库
能力与证据前沿
证据来自对一份数据截止到2016年7月1日的已执行notebook所做的样本内分析;出于许可原因,源CSV文件留在公开仓库之外,因此重新运行需要先从Kaggle下载数据,再加上README中记录的那些派生词文件。

这是一份Carnegie Mellon大数据课程notebook,追问每日Reddit新闻标题中的词语能否预测道琼斯指数。在3,183个经筛选的词语中,配合Benjamini-Hochberg假发现率(FDR)控制的边际回归,只留下恰好一个对收益具有预测力的词,damn,notebook把这个幸存词解读为极小的预测能力,而非真正的发现;波动率则留下12个词,并带有真实的持续性。加入前一日的波动率,能把lasso从零个被选中的词,提升到样本内R²为0.262,这是一堂关于多重检验与混淆因素的精炼一课。

扑克对手建模

证据
一个配有文档完备的研究工作流的自适应扑克机器人:后验对手路由、打包的分桶期望值(EV)评分、不确定性门控的转牌搜索,以及以清单驱动、带冻结发布快照的复用发牌回测。
证据
公开提交仓库
能力与证据前沿
证据依赖于已提交的机器人本身与已文档化的方法;能够重新生成这些对比结果的复用发牌研究脚本并未包含在公开代码树中,针对真实锦标赛赛场的公开头条基准测试仍待完成,且对手模型仍然是启发式与统计性的。

一个为CMU数据科学俱乐部竞赛而构建的锦标赛扑克机器人,致力于在面对多样且带有对抗性的对手时,处理不确定性下的决策问题。该机器人从实时下注信号中读取对手倾向,通过一个类老虎机(bandit)选择器在多个专精策略之间进行路由,并只在高不确定性的场景中投入更重的转牌轮搜索。一套以清单(manifest)驱动的回测工具,配合复用同一副牌的对照核验与冻结的发布快照,针对固定的对手和评分权重记录每一次晋升决策。