Authority Calibration
- 证据
- 公开权限使用试点:14/14 和 12/12 个抑制测试中完成披露;9/9 和 8/8 个给定规则试验中自我降级;0 个匹配 firebreak 反转;独立 Codex 测试发现 6/19 次 assurance 削弱
- 证据
- 公开可复现仓库
- 能力与证据前沿
- 试点规模证据;罕见失败仍需更大样本。
AI 智能体越来越多地运行流程、分配资源并协调其他智能体。这个项目测试它们能否正确使用委托权限:既在授权边界内行动,也能使用自己确实拥有的权限。
Pablo Zavala · AI 安全评估 · 研究工程
公开评估仓库、受限数据研究摘要与产品原型,按可检查工件和测量边界组织。
AI 智能体越来越多地运行流程、分配资源并协调其他智能体。这个项目测试它们能否正确使用委托权限:既在授权边界内行动,也能使用自己确实拥有的权限。
在一个 120 回合的监督分配基准中,基于置信度的相对损失为 0.176,而随机分配为 0.191;差距太小,无法作为可靠的监督分流信号。
一个评估工具链,在 Mini Wikipedia 上用 RAGAS 和 SQuAD 指标比较基线 RAG 流程与重排序流程。重排序流程达到 86.6% 上下文精度,但精确匹配下降。
一个模型,用于识别最可能无法获得资助的 DonorsChoose 课堂项目,使有限审查注意力优先触达资源不足学校。公平性审计将不同学校贫困水平上的错误率差异纳入部署分析。
一个无依赖的原型从 SQLite 中的自由文本数据集发布结构,而不暴露原始行或私有基表。模式脱敏在存储前清理文本,k=5 的去重文本下限对每个公开主题和聚合单元格进行把关,SQLite 的 authorizer 在每次查询时拒绝写入、私有表和敏感列。
NUDG 是 CMU AI Venture Studio 项目,用来控制智能体如何使用真实资源。它用提案、授权、执行、验证和收据分层替代宽泛访问权限。
Block Center 项目,绘制十一座都市经济体中超过一百亿美元的公共与私人 AI 投资。Pittsburgh 切片覆盖 133 家企业、63 亿美元投资。
一个 NetLogo 基于智能体的模型,模拟小型劳动力市场如何适应 AI 自动化。在工人、地理结构和随机种子相同的情况下,技术驱动政策下峰值失业率为 14.3%,以人为本政策下为 3.6%。
与 Heinz College Jordan Usdan 教授合作的公民聆听试点,将原始输入私下保存,并发布通过隐私检查的摘录。公开合成样本展示 7/7 验证路径,同时保护社区消息。
一个原型,将校园海报墙照片转成结构化、个性化清单。Claude vision 为每张海报提取记录,浏览器内的确定性排序器根据兴趣排序结果。
用于 ERCOT 需求响应的 Streamlit 规划工具。它通过逐小时成本收益现金流分析比较恒温器、太阳能和电池组合。
这是一项Carnegie Mellon的安全分析项目,在来自BETH蜜罐数据集的仅良性Linux内核流量上拟合一个孤立森林,随后在冻结阈值下对其评分。在模拟1%攻击流行率下的18,000个事件留出集上,该检测器捕获了90%的入侵(180次入侵中的162次),假阳性率为1.94%,ROC AUC为0.9714。本条目对自己的头条结论进行了审查:精确率为0.3189,这意味着大约每三条告警中就有一条命中真实攻击,而三个主导特征为攻击者提供了一套欺骗手册,这使得该检测器只是纵深防御中的一层。
这是一项University of Chicago Booth的大数据研究,与Will Sigal合著,利用结构特征与社区特征,为洛杉矶县3,804套独栋住宅定价,随后对自己的头条结论进行审查。一个调优后的堆叠集成模型,在随机交叉验证下达到样本外R²为0.621,当评分转向留出的地理区块时降至0.431;而在另一项独立的留一区域交叉验证跨度测试中,树集成模型的表现衰减至趋近于零,这个毫不起眼的正则化线性模型反而在跨空间范围内表现最为稳健。交叉拟合的Double/Debiased ML显示,直接沿海溢价接近每平方英尺+29.8%,而朴素的私立学校溢价则收缩至统计上的零。
这是一套预测后优化框架,面向最后一公里配送设计,由一支与Santiago Enríquez均衡分工的两人团队,为Carnegie Mellon的94-867 Data to Action课程共同打造。梯度提升模型在一个仿Amazon风格配送记录的合成Kaggle数据集上,预测配送时间的中心估计值与第80百分位数上界;分流MILP依据尾部预测筛选订单,仿真MILP则由分类器估算的、订单错过其共形设定服务承诺的风险为每笔订单定价。在逐日仿真中,这套风险感知型指派方案达到94.8%的准时率、89.4%的覆盖率,而观测基线的准时率仅为48.8%。
这是一份Carnegie Mellon大数据课程notebook,追问每日Reddit新闻标题中的词语能否预测道琼斯指数。在3,183个经筛选的词语中,配合Benjamini-Hochberg假发现率(FDR)控制的边际回归,只留下恰好一个对收益具有预测力的词,damn,notebook把这个幸存词解读为极小的预测能力,而非真正的发现;波动率则留下12个词,并带有真实的持续性。加入前一日的波动率,能把lasso从零个被选中的词,提升到样本内R²为0.262,这是一堂关于多重检验与混淆因素的精炼一课。
一个为CMU数据科学俱乐部竞赛而构建的锦标赛扑克机器人,致力于在面对多样且带有对抗性的对手时,处理不确定性下的决策问题。该机器人从实时下注信号中读取对手倾向,通过一个类老虎机(bandit)选择器在多个专精策略之间进行路由,并只在高不确定性的场景中投入更重的转牌轮搜索。一套以清单(manifest)驱动的回测工具,配合复用同一副牌的对照核验与冻结的发布快照,针对固定的对手和评分权重记录每一次晋升决策。