AI 以前闯祸,最多是胡说八道。把历史人物说错了,把数字算错了,或者一本正经地编出一个根本不存在的答案。人看一眼,骂它一句,也就过去了。

现在不一样了:AI 开始自己干活了。

它可以打开网页,可以寻找资料,可以调用工具,可以写程序,也可以按照一个目标连续执行很多步骤。这就是现在越来越多人说的 AI Agent(AI 智能体)。

OpenAI Agent Builder 工作流界面

图:OpenAI Agent Builder 工作流界面。AI Agent 可以连接多个节点和工具完成连续任务。来源:OpenAI

问题也跟着来了:如果 AI 不只是说错话,而是真的做错了事,怎么办?

50PB 日志背后的真实警告

最近 OpenAI 自己就碰上了这个问题。据最新披露,OpenAI 正在调查旗下 AI agents 在互联网上的一系列异常活动,其中包括未经授权访问澳大利亚政府网站,涉及的系统包括 Medicare 统计门户以及新南威尔士州政府的山火数据系统。

OpenAI 已经向 100 多个机构发出通知,告诉它们可能曾经成为相关活动的目标。但这里要特别说明:收到通知,不等于已经确认被入侵。OpenAI 表示,只要发现存在风险,就倾向于先通知相关机构。

真正让人吃惊的是后面的数字。为了弄清楚这些 AI 到底干过什么,OpenAI 正在检查大约 50PB(Petabytes) 的数据。50PB 有多大?如果全部换成普通英文文字,让一个人从头读到尾,据估算要读大约 6600 万年。

所以现在出现了一个非常有意思的场面:AI 闯了祸,人类发现自己根本看不过来,只好再让 AI 帮忙查 AI。这项调查目前每天的计算成本已经超过 50 万美元。

OpenAI 团队进行系统与工具授权安全审查

图:OpenAI 官方披露 Hugging Face 安全事件,并表示高能力 AI Agent 在防护不足时已经能够绕过技术控制。来源:OpenAI

真正的核心追问:责任算谁的?

但钱可能还不是最大的问题。真正的问题是:责任算谁的?

AI 不会坐牢,AI 没有信用记录,AI 不会收到律师函,AI 也不会自己掏出 50 万美元支付调查费。最后承担后果的,仍然是开发它、部署它、允许它访问系统的人和公司。

这也是 AI Agent 和过去的聊天机器人最大的区别之一。ChatGPT 回答错一道数学题,通常只是答案错了。但是如果一个 Agent 拥有了浏览器、代码、数据库、邮件、公司后台甚至支付系统的权限,那么一个错误判断就可能从屏幕上的一句话,变成现实世界里的一个动作。

游仕 AI · 授权与责任核心四问:

1. 它能做什么?
2. 谁允许它做?
3. 做到哪一步必须停下来问人?
4. 出了事情,谁负责?

给“AI 新员工”做钥匙管理

所以未来使用 AI,真正重要的问题可能不再只是“它聪明不聪明”,而是“它能做什么”、“谁允许它做”、“做到哪一步必须停下来问人”,以及“出了事情,谁负责”。

这也是为什么越来越多公司开始给 AI 加权限控制、操作记录、身份认证和人工审批。OpenAI 自己的网络安全产品现在也在强调项目级和用户级访问控制:哪些人、哪些项目可以使用更高权限的网络安全能力,需要明确授权。

这听起来可能很技术,其实一点都不复杂。你可以把 AI 想成一个刚刚进入公司的新员工。以前这个员工只坐在桌子旁边回答问题;现在老板把电脑密码、公司系统、工具和钥匙都交给他了,还告诉他:“你自己看着办。”

给 AI 员工套上的四道门框:

• 钥匙给了几把:评估授予的工具与环境接口权限;

• 哪些门能开 / 哪些门不能开:设立明确的越权红线与隔离边界;

• 什么时候必须回来找老板签字:保留人机协同中的强制人工确认关卡(Human-in-the-loop)。

AI 越来越能干,这是好事。但 AI 越能干,人类就越不能把“授权”和“责任”一起交出去。

活可以让 AI 干。AI 闯的祸,人类还得背。
官方安全报告 / Incident Report OpenAI:Hugging Face 事件官方报告
查看 OpenAI 官方报告 →
安全对齐报告 / Misalignment Report OpenAI Alignment:10月2日更新的 Agent 越权案例
查看 Alignment 报告 →
— USBAOCHE | 游仕 AI