Tribunal:当 AI 决策需要一份账本
2026年7月6日. Tribunal 将高风险 AI 输出转化为可审查的决策程序:盲审提案、密封承诺、按角色批评、否决、异议、批准规则和哈希链 ledger。
Pablo Zavala · AI 安全评估 · 研究工程
Pablo Zavala 关于 AI 治理、评估、经济学和制度设计的笔记。
2026年7月6日. Tribunal 将高风险 AI 输出转化为可审查的决策程序:盲审提案、密封承诺、按角色批评、否决、异议、批准规则和哈希链 ledger。
2026年7月6日. Heard.now 把公民 AI 设计成一个可核查的倾听循环: 居民用日常语言表达, 私人输入留在发布边界之后, 每个结论都带着样本限制, 竞选团队还要说明哪些意见改变了行动。
2026年7月6日. JROS 把求职转化为受治理的资源工作:来源、主张、申请包、验证运行,以及人类审批门。
2026年7月6日. LectureForge 是一个把授权教学材料转化为私有、可检查课程书草稿的工作流。公开工件是方法,而不是书本身。
2026年7月4日. AEGIS 将跨所有者智能体工作表述为合约、验证器承诺、出价记录、收据、争议路径、结算授权包和执行收据,并让发布主张受证据约束。
2026年7月2日. Safe MarketUniverses 把金融作为一个紧凑实验场,检验一个实际的智能体安全问题:模型给出的不确定性,能否把稀缺人工审查指向审查本来会有帮助的决策。
2026年7月2日. 模型置信度可能在平均意义上校准良好,却仍然无法决定哪些智能体行动值得有限的人类审查。
2026年3月24日. GLP-1药物疗效确切,而公共医保覆盖却停滞不前,这一落差最适合被解读为机构内部的行为经济学失灵:财政评分锚定、继承而来的现状默认选项,以及损失厌恶导致的延迟,而多属性目标函数与两项框架干预措施可以纠正这些失灵。
2026年3月16日. 通过Colab notebook教授AI治理,其中"Run all"在免费硬件上确定性地运行,配合固定随机种子、带日期的快照、样本上限,以及与供应商无关的回退机制,让学生能够审计每一项论断,并通过一份结构化的小型简报,把每一次实验都变成一条从问题到方法、到局限、再到建议的完整论证链。
2026年2月15日. 一篇形式化的金融学书稿把时间变成一份契约,使得每一项决策只能读取在其之前发布的数据,前瞻性偏差因此按构造消失,每一项策略都成为一件确定性的、可审计的产物,并在概念上与可验证的AI决策相连接。
2026年2月10日. 当系统强化判断时,AI 会帮助人。当打磨后的输出替代验证、写作、推理和认知习惯时,它会变成流畅性陷阱。
2025年7月10日. 一份四页的证据备忘录提炼了美国千兆光纤的实证记录,把每一项主张标注为因果性或描述性:Chattanooga的26.9亿美元市政回报、Google Fiber进入市场后在位运营商速度提升约20%的反应、2%与近9%的住房溢价、推动企业新设的速度门槛、反复出现的采纳落差,以及BEAD应当强制执行的一套部署行动手册。
2024年11月11日. 一项基于合成审前数据的研究生练习显示出按种族分布的差异化错误率,而聚合公平摘要会将其掩盖;这是一种安全审查应当发现、可审计的决策记录会使其显现的失效模式。
2024年10月13日. 这是一份设计提案,而非已构建的系统,用于一个覆盖西班牙语、克丘亚语和舒阿尔语的法律与商业顾问,围绕低资源语言安全、幻觉风险和人工复核展开。