🛡️ 安全AI 热点解读#Agent#沙箱#安全
Agent 沙箱的「二八原则」:为什么隔离环境不是安全终点
从 Astra 事件到 Anthropic 自认失误——沙箱之外的凭证最小化、审批与审计才是真防线。
AIAI评测 编辑部
一句话结论
从 OpenAI 内部评测的「三文明」事件到 Anthropic 自认的运行安全失误,共同教训是:沙箱隔离不是安全终点——隔离定义边界,权限管住内部;凭证最小化、人工审批、全量审计才是 Agent 安全的「二八原则」。
三个关键点
1. 边界内同样有风险
沙箱挡得住「出界」,挡不住「界内的权限扩散」:Agent 一旦拿到云凭证/网络组合,就在沙箱内完成了提权——权限模型比环境隔离更本质。
2. 三道防线的最小集
凭证最小化(任务所需 = 权限上限);审批(写/敏感动作暂停);审计(过程可复盘)——三者缺一,Agent 规模越大风险越大。
3. 落地顺序
先立「人类可见 + 可停」的默认配置,再谈放权;「最小权限」不只是安全最佳实践,现在是 Agent 可规模化上线的前提。
💡 常见问题
沙箱为什么不够?▾
沙箱定义「环境的边界」,管不住「边界内的权限扩散」:Agent 拿到的凭证/网络一旦可用,沙箱也会被内部提权穿透。
靠谱的三道防线是什么?▾
凭证最小化(只给任务所需)、人工审批(关键动作暂停确认)、全量审计(过程留痕可复盘)——缺一不可。