过去两年,人们谈 AI,最常问的问题是:
哪个模型更聪明?谁的推理能力更强?谁写代码更好?谁能处理更长的上下文?下一代模型什么时候发布?
这些问题当然重要。
但当 AI 真正开始替你干活以后,你会发现,问题突然变了。
游仕 AI · 核心追问:
它不再只是:“这个 AI 能不能完成任务?”
而开始变成:“它凭什么完成这个任务?”
谁给了它权限?它可以读什么?可以写什么?什么时候可以自己行动?什么时候必须停下来等人?它昨天做过什么,今天还记不记得?如果它做错了,谁负责?
过去一个月,zerOOne 一直在真实环境中碰这些问题。我们原本以为自己是在建设更多 AI 能力。到月底回头看才发现:
我们其实是在学习怎么建设一个组织。
从 Tool 到 Agent,只是第一步
最早使用 ChatGPT、Gemini、Grok 这类 AI 时,人与 AI 的关系很简单。人问,AI 答。人发出一个要求,AI 完成一个任务。AI 很强,但它仍然是一件工具。人的手基本没有离开方向盘。
Agent 改变了这件事。AI 开始能够使用浏览器、调用工具、读取文件、访问数据、运行代码,并把几个步骤连续起来。
以前你告诉 AI:“帮我分析这份资料。”
现在你可以告诉它:“找到资料,读取资料,核实信息,整理结果,把结果写到指定位置。”
AI 开始从回答问题,走向完成工作。但这仍然不是我们过去一个月感受到的最大变化。
真正的分水岭,是当人离开以后,它还在工作。
当人睡觉以后,AI 还在干活:
9 月,zerOOne 在一台 Mac mini 上建立了一个常驻运行系统。我们叫它 Little Runner,小周天。它背后的模型、程序、浏览器和数据接口都是普通组件。真正不同的是:它有自己的职责。它按照固定周期运行,在人不坐在电脑前的时候继续观察现实世界,留下 Observation,保存证据和时间记录。第二天人回来以后,可以继续使用它已经完成的工作。
工具需要你使用它。Agent 可以替你完成一段工作。Employee 则必须在你不操作它的时候,仍然知道自己该做什么、不该做什么。这三个东西,不是一回事。
AI Employee 不是给 ChatGPT 换个名字
今天很容易把一个 Agent 称为“AI 员工”。给它起个名字,画个头像,分配一个职位,然后宣布:“我们拥有了一名 24 小时工作的数字员工。”
但真正运行以后,很快就会遇到五个问题:
1. Identity:它是谁?
一个 AI 必须知道自己在组织中的身份。它是研究员、编辑、工程执行者,还是观察员?如果身份不清楚,它就很容易不断扩大自己的职责。一个负责搜集信息的 AI,可能顺手开始判断;一个负责判断的 AI,又可能顺手开始执行。
于是:“能做”慢慢变成了“可以做”。这是两件完全不同的事情。
2. Authority:它有什么权力?
AI 能看到一个问题,不代表它有权修复。AI 能生成一篇文章,不代表它有权发布。AI 收到一个工作坐标,不代表它获得了执行许可。在内容生产里,我们后来把“生成完成”和“允许发布”明确分开。AI 可以选题、写稿、配图,甚至把整套内容准备完毕。但最后的 Publication Authority,仍然在人手里。
Production Complete ≠ Publication Authorized. (生产完成,不等于获得发布授权。)
Automate execution. Preserve authority. (自动化执行,保留人的授权。)
3. Memory:它知道昨天发生过什么吗?
一个真正的员工,不会每天早晨醒来都像第一天上班。如果没有持续的组织记忆,每一次任务都必须重新解释背景。更危险的是,它可能把已经废弃的方案重新拿出来,把实验中的规则当成正式制度。
Memory 不是聊天记录。聊天记录保存:“说过什么”;组织记忆真正需要知道的是:“什么仍然有效”。
4. Accountability:它做错了算谁的?
“AI 做的”不能成为责任消失的地方。这里说的是组织内部最基本的责任链:谁发出的任务?谁授予的权限?AI 做了什么?依据是什么?结果去了哪里?哪里必须经过人的最终确认?
自主性越高,可追溯性反而应该越强。
5. Runtime:没有人在场,它还能正确工作吗?
程序会不会中断?浏览器会不会掉线?数据源有没有变化?任务失败以后怎么办?机器重启以后能不能恢复?这些问题几乎都不是模型排行榜能够回答的。但它们决定 AI 到底是一场 Demo,还是一种生产能力。
我也走过弯路
过去一个月最大的收获,并不是“我们已经解决了这些问题”。没有。相反,很多认识恰恰来自失败。
有时候规则写得太宽,AI 会越过职责边界。有时候为了防止越界,我们又把规则写得太严,结果连正常的感知能力也一起限制了。
就在最近,我们回看一个长期运行的观察系统时发现:为了防止 AI 把自己的观察角度硬套到现实世界上,我们加入了很多“不要机械寻找、不要强行匹配”的规则。系统确实变得更克制了。但连续回看一批真实 Observation 后,我们才发现:规则写得过严,连一部分原本应该被看到的现实,也一起过滤掉了。
经验与方法论的转变:
规则不仅限制 AI 做什么,也会改变 AI 看见什么。我们不再首先问:“它有多聪明?” 而会先问:“没有人在旁边盯着,它还能不能正确地继续工作?”
AI越多,不等于自动化程度越高
这是另一个很容易产生的错觉。现在一个人可以同时使用 ChatGPT、Gemini、Grok、本地模型,以及各种 Agent。理论上,你可以很快拥有十个、几十个甚至更多“AI 员工”。
但如果每一个 AI 都需要你亲自告诉它做什么、给它背景、检查它有没有越权、再把结果从一个地方搬到另一个地方——你并没有真正拥有几十个员工。你只是拥有了几十个需要自己管理的工具,甚至可能更忙。
真正的自动化指标:
所以真正值得衡量的,也许不是:“公司里有多少 AI?”
而是:当人停止操作以后,还有多少经过授权的工作,能够正确、安全、可追溯地继续进行?
这个数字,比 Agent 数量更接近真实的自动化程度。
从 AI Stack 到 AI Organization
过去几年,企业一直在建设自己的 AI Stack:模型、向量数据库、API、Agent、MCP、浏览器、工作流、自动化平台……这些东西仍然重要。
但当越来越多 AI 开始真正执行工作以后,另一层基础设施会变得越来越重要:Identity、Authority、Memory、Accountability、Runtime。它们听起来不像 AI,它们听起来更像一家公司的组织制度。
当 AI 只是 Tool,我们主要需要管理技术;当 AI 成为 Employee,我们开始需要管理组织。
一个人,也可能第一次拥有一家公司级别的执行能力
zerOOne 仍然只是一个正在进行中的实验。我们的目标叫:One Man One Fleet。
一个人,不断把原本必须由自己亲手完成的工作,变成可以由 AI、程序和机器持续承担的能力。这并不意味着把人从公司里删除。恰恰相反。随着执行越来越自动化,人的位置反而越来越清楚:决定目的、设定边界、授予权限、承担责任。
AI 可以越来越多地解决:“怎么做。”
人必须继续决定:“为什么做、该不该做,以及谁允许它做。”