控制 AI,不等于控制它的每一步
最近,Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1。
让我意外的是,它们其实使用同一个底层模型。两者的主要区别不是能力,而是保障措施和开放范围:Fable 面向普通用户开放,Mythos 则通过可信访问计划,向经过审核的网络安全和生命科学专业人员提供更宽松的使用权限。
同一个模型,因为使用者和场景不同,被允许做的事情也不同。这让我重新想到一个问题:我们应该怎样控制越来越强的 AI?
过去使用 AI Agent 写代码时,我经常因为偷懒,没有把该说的事情说清楚。我主观上认为 AI 应该知道我要什么,结果它按照自己的理解完成以后,我才发现方向不对,只能让它反复返工。
表面上看,这是 AI 没有理解我;实际上,很多时候是我自己没有想清楚目标,也没有说明限制。
几个月前,我逐渐理解了 AI 的工作方式。当模型的能力已经足够强时,我们未必还要详细规定它中间的每一个步骤。更重要的是说清楚三件事:我要什么,怎样才算完成,以及哪些事情不能做。
这和我之前在《从指挥官意图到 AI 协作》中写过的观点一致:人负责目的、成功标准和边界,具体的执行过程可以交给 AI。
但现在我想再往前走一步。
边界的意义,不是让人参与 AI 的每一步,而是让 AI 在边界内获得尽可能大的自主权。
如果一个 Agent 每修改一个文件、尝试一种方案、调用一次工具,都要停下来询问用户,那么它即使拥有很强的模型能力,也很难真正独立完成任务。用户表面上掌握了控制权,实际上却在不断替 AI 做执行层的判断。
另一种极端是完全不设限制。这样确实减少了打扰,却可能让 AI 读取不该读取的数据、修改无关文件,或者执行会产生现实影响的操作。
更合理的方式,是先把权限范围规定清楚。例如,哪些资料可以读取,哪些文件可以修改,哪些操作可以自动执行,哪些后果无法撤销、必须再次确认。只要没有越过这些边界,AI 就可以自行选择方案:一种方法失败了,就换另一种;发现计划有缺口,就主动修正,而不是把每一个中间问题都交还给人。
这也是为什么“更少的安全拦截”不一定意味着更不安全。如果安全规则过于粗糙,正常的工作也会不断被打断。Anthropic 在 Fable 5.1 中尝试减少误拦截,同时把更敏感的能力交给经过审核的用户,本质上是在寻找安全与可用性之间更精确的边界。
我希望 AI 尽量一次性完成任务,中间尽量少让我参与决策。当然,前提是它没有越过预先设定的限制,并且最终结果能够通过验收。
所以,控制 AI,并不意味着控制它的每一步。
真正有效的控制,是由人决定目的和边界,然后在边界之内,把尽可能大的执行权交给 AI。