Pablo Zavala · AI 安全评估 · 研究工程

文章与分析

Pablo Zavala 关于 AI 治理、评估、经济学和制度设计的笔记。

已发布文章

Tribunal:当 AI 决策需要一份账本

2026年7月6日. Tribunal 将高风险 AI 输出转化为可审查的决策程序:盲审提案、密封承诺、按角色批评、否决、异议、批准规则和哈希链 ledger。

Heard.now 与可核查的公民倾听

2026年7月6日. Heard.now 把公民 AI 设计成一个可核查的倾听循环: 居民用日常语言表达, 私人输入留在发布边界之后, 每个结论都带着样本限制, 竞选团队还要说明哪些意见改变了行动。

JROS:带收据的 Resource OS

2026年7月6日. JROS 把求职转化为受治理的资源工作:来源、主张、申请包、验证运行,以及人类审批门。

课程书应当展示自己的来路

2026年7月6日. LectureForge 是一个把授权教学材料转化为私有、可检查课程书草稿的工作流。公开工件是方法,而不是书本身。

AEGIS 与可验证智能体工作的市场

2026年7月4日. AEGIS 将跨所有者智能体工作表述为合约、验证器承诺、出价记录、收据、争议路径、结算授权包和执行收据,并让发布主张受证据约束。

把交易模拟作为人工审查测试

2026年7月2日. Safe MarketUniverses 把金融作为一个紧凑实验场,检验一个实际的智能体安全问题:模型给出的不确定性,能否把稀缺人工审查指向审查本来会有帮助的决策。

决策者的偏见:机构为何误判GLP-1减重药物

2026年3月24日. GLP-1药物疗效确切,而公共医保覆盖却停滞不前,这一落差最适合被解读为机构内部的行为经济学失灵:财政评分锚定、继承而来的现状默认选项,以及损失厌恶导致的延迟,而多属性目标函数与两项框架干预措施可以纠正这些失灵。

治理实验课应当两次运行、结果如一

2026年3月16日. 通过Colab notebook教授AI治理,其中"Run all"在免费硬件上确定性地运行,配合固定随机种子、带日期的快照、样本上限,以及与供应商无关的回退机制,让学生能够审计每一项论断,并通过一份结构化的小型简报,把每一次实验都变成一条从问题到方法、到局限、再到建议的完整论证链。

时间可采性:按构造可审计的决策

2026年2月15日. 一篇形式化的金融学书稿把时间变成一份契约,使得每一项决策只能读取在其之前发布的数据,前瞻性偏差因此按构造消失,每一项策略都成为一件确定性的、可审计的产物,并在概念上与可验证的AI决策相连接。

千兆城市:证据、公平与BEAD行动手册

2025年7月10日. 一份四页的证据备忘录提炼了美国千兆光纤的实证记录,把每一项主张标注为因果性或描述性:Chattanooga的26.9亿美元市政回报、Google Fiber进入市场后在位运营商速度提升约20%的反应、2%与近9%的住房溢价、推动企业新设的速度门槛、反复出现的采纳落差,以及BEAD应当强制执行的一套部署行动手册。

算法的裁决:当聚合公平掩盖子群体伤害

2024年11月11日. 一项基于合成审前数据的研究生练习显示出按种族分布的差异化错误率,而聚合公平摘要会将其掩盖;这是一种安全审查应当发现、可审计的决策记录会使其显现的失效模式。