状态: 活跃研究受治理的 AI 系统证据、审计与回放负责任的 AI
受治理的智能体系统
为 AI 智能体设置单一受控执行边界:不可逆动作须经人工审批,工具访问基于策略授权。
摘要
本方向研究如何在实践中使智能体式 AI 变得可治理。我们不赋予智能体宽泛的自主权,而是将所有有后果的动作经由单一执行边界:强制策略、对不可逆操作要求人工审批、记录证据,并通过补偿动作支持回滚。该工作是应用型且迭代式的,并非经过验证的生产标准。
问题与动机
能够调用工具并采取真实动作的智能体系统难以被信任:自主性与问责性存在张力。多数部署要么过度限制智能体(削弱其用处),要么治理不足(带来不可逆的危害风险)。
研究问题
- 单一执行边界能否在不实质性降低任务成功率的前提下强制策略?
- 哪些类别的动作确实需要人工审批,该边界如何被可靠地划定?
- 一个动作要做到可事后审计与回滚,必须捕获哪些证据?
方法
- 构建一个具备固定工具接口、强制策略的执行边界原型。
- 为每个动作接入证据捕获与补偿动作登记表。
- 开展基于场景的评估,比较受治理与不受治理下的任务完成情况。
观察
来自内部工作的现时观察。这些不是经验证的结果,除非所链接的发表另有说明,否则未经同行评审。
- 观察到(内部、未经验证):将动作经由单一边界,使策略变更可集中审计。
- 观察到:不可逆动作边界的划定具有领域特异性,仍是一个开放的设计问题。
局限
- 迄今的评估为内部、基于场景的评估,并非行业基准。
- 未对对抗性场景下的安全保证作任何主张。
- 相关结果未经同行评审。
后续工作
- 将不可逆动作分类形式化。
- 对外发布一套可复现的场景测试集。
社区参与
本方向为技术性研究,不涉及社区数据。
披露
- 资助
- 基础设施与工程支持由 Octopus Core Pty Ltd 提供。
- 利益冲突
- Octopus Core 在相邻领域开发商业治理产品;相关发现独立于该商业利益进行报告。
