AI 基建
0%
第八部分 · 安全、可解释性与治理

第八部分 · 安全、可解释性与治理

作者Changkun Ou
阅读时长约 1 分钟

「要推动负责任的创新,就需要深入理解这些模型可能带来的风险。」

Laura Weidinger 等,"Ethical and social risks of harm from Language Models"

安全不是放在栈顶的一层外壳。模型内部发生了什么,谁能监督它,它能拿到哪些权限,运行时策略怎样落地,红队怎样度量边界,权重记住了什么,造成伤害后谁负责,这些问题会从不同方向影响整个系统。第八部分把它们放在一起,是因为前面已经建立了那套需要被约束的机器。

第 54 章 从模型内部开始,讲为什么一个神经元很少只意味一件事,稀疏自编码器(一种学得的特征集,每次只有少数特征被激活)又怎样让分析有了入口,同时也带来失真。第 55 章 讨论当被监督对象超过监督者时,信任和控制这两条路各自能走多远。第 56 章 进入权限、凭证和工具调用。第 57 章第 58 章 处理运行边界:护栏、审核器、越狱(绕过模型拒绝机制的提示)、红队,以及拒绝为何只是一道软边界。第 59 章 转向权重记住了什么,以及对数据主体的承诺;第 60 章 追问一条服务路径怎样用经过证明的硬件、而不是合同,来兑现它的隐私承诺;第 61 章 最后补上对权利人、用户、监管者与公众的义务。

这一部分不会寻找一个总开关。真正要追问的,是证据在哪里产生,权限在哪里授予,策略在哪里变成代码,控制主张又能在哪里被检验。只有这些位置清楚,安全才不是一句愿望。

评论

登录后评论