状态: 活跃研究证据、审计与回放负责任的 AI
证据与工作状态
不信任存储、失败即关闭的设计:将判定捕获为证据、固定契约,使工作状态可回放且防篡改。
摘要
本方向研究如何将进行中的 AI 工作状态表示为可回放、防篡改的证据。我们将存储视为不可信、在契约被违反时失败即关闭,并将判定捕获为一等证据而非临时日志。
问题与动机
当 AI 系统随时间行动时,其状态常以无法验证或回放的方式存储,使事后审计不可靠。
研究问题
- 忠实回放一个 AI 工作单元所需的最小证据是什么?
- 当存储状态不可信时,系统应如何行为?
方法
- 设计一种固定契约的证据格式。
- 在加载时实现失败即关闭的验证。
- 针对已捕获证据测试回放确定性。
局限
- 相关发现为内部结论,未经同行评审。
- 防篡改证据不等于防篡改本身;威胁模型是有界的,并在每次实验中说明。
披露
- 资助
- 基础设施支持由 Octopus Core Pty Ltd 提供。
- 利益冲突
- Octopus Core 提供商业审计/证据基础设施;相关发现独立报告。
