跳到主要内容
Octopus Research Institute
状态: 活跃研究受治理的 AI 系统证据、审计与回放负责任的 AI

受治理的智能体系统

为 AI 智能体设置单一受控执行边界:不可逆动作须经人工审批,工具访问基于策略授权。

摘要

本方向研究如何在实践中使智能体式 AI 变得可治理。我们不赋予智能体宽泛的自主权,而是将所有有后果的动作经由单一执行边界:强制策略、对不可逆操作要求人工审批、记录证据,并通过补偿动作支持回滚。该工作是应用型且迭代式的,并非经过验证的生产标准。

问题与动机

能够调用工具并采取真实动作的智能体系统难以被信任:自主性与问责性存在张力。多数部署要么过度限制智能体(削弱其用处),要么治理不足(带来不可逆的危害风险)。

研究问题

  • 单一执行边界能否在不实质性降低任务成功率的前提下强制策略?
  • 哪些类别的动作确实需要人工审批,该边界如何被可靠地划定?
  • 一个动作要做到可事后审计与回滚,必须捕获哪些证据?

方法

  • 构建一个具备固定工具接口、强制策略的执行边界原型。
  • 为每个动作接入证据捕获与补偿动作登记表。
  • 开展基于场景的评估,比较受治理与不受治理下的任务完成情况。

观察

来自内部工作的现时观察。这些不是经验证的结果,除非所链接的发表另有说明,否则未经同行评审。
  • 观察到(内部、未经验证):将动作经由单一边界,使策略变更可集中审计。
  • 观察到:不可逆动作边界的划定具有领域特异性,仍是一个开放的设计问题。

局限

  • 迄今的评估为内部、基于场景的评估,并非行业基准。
  • 未对对抗性场景下的安全保证作任何主张。
  • 相关结果未经同行评审。

后续工作

  • 将不可逆动作分类形式化。
  • 对外发布一套可复现的场景测试集。

社区参与

本方向为技术性研究,不涉及社区数据。

披露

资助
基础设施与工程支持由 Octopus Core Pty Ltd 提供。
利益冲突
Octopus Core 在相邻领域开发商业治理产品;相关发现独立于该商业利益进行报告。

相关发表

相关项目