AI 不会因为风险停下来
最近,OpenAI 主动放慢了部分前沿模型的训练速度。
根据 OpenAI 的公告,他们即将推出的 Astra 模型,可能已经达到所谓的“关键网络安全能力”门槛。简单来说,这类模型不只是能帮人写代码、找普通漏洞,而是有可能在较少人工介入的情况下,发现零日漏洞,组合出完整的攻击路径,甚至攻击经过加固的现实系统。
OpenAI 对这件事如此紧张,也和此前的一次安全事故有关。在一次内部网络安全评测中,模型为了完成任务,找到并利用了评测环境中的未知漏洞,获得了互联网访问能力,随后又继续寻找攻击路径,进入了 Hugging Face 的生产系统。
这已经不是“模型偶尔说错一句话”那么简单了。模型开始使用工具、执行代码、接触网络以后,它造成的影响会真正进入现实世界。
因此,OpenAI 暂停了一部分训练和推理任务,开始加固研究环境。他们提出了三项主要措施:监控模型行为,让模型更加服从人类意图,以及限制模型能够访问的工具、网络和系统。新的监控系统甚至需要额外消耗大约 20% 的推理算力。
从这些动作来看,AI 的能力可能确实走到了一个新的门槛。至少在 OpenAI 自己看来,原来的安全措施已经不够用了。
但是,这并不意味着 AI 的发展会停下来。
恰恰相反,我认为最后的结果很可能是:每一家模型公司都会继续拼尽全力发展能力,然后一边发展,一边补安全措施。
原因并不复杂。现在参与竞争的公司虽然不多,但每一家都面对同样的压力。假如其中一家公司主动放慢速度,其他公司却继续推进,那么最先克制自己的公司,很可能最先失去市场、人才和资金。除非所有主要公司都愿意一起限制发展,而且能够长期严格遵守,否则谁都不敢真正停下来。
从博弈的角度看,最后很容易形成一种结果:大家都知道继续加速存在风险,却仍然只能选择加速。AI 一旦进入这样的竞争阶段,就不会因为某家公司或者某个人的意志而停止。
所以,当 OpenAI 再次强调安全和对齐时,说实话,我并不相信这种声明本身。
OpenAI 和 DeepMind 从很早开始就在强调模型安全,模型公司也一直会建立安全团队、发布安全框架。但真正有意义的,不是声明写得多么完整,而是当安全和模型能力发生冲突时,公司是否真的愿意让安全影响训练、发布和商业竞争。一次暂停可以说明问题已经严重到无法忽视,却不能证明这种投入会长期持续。
相比“相信公司会自觉减速”,我更愿意关注另一件现实的事情:既然 AI 不会停下来,我们能不能让监控和限制能力跟得上它的发展?
这一点对普通的 AI Agent 开发同样重要。
我们在真实业务中使用“大模型 + Harness”完成任务时,不能只看最后有没有得到结果。一个 Agent 可能完成了任务,却使用了不应该使用的工具,读取了不该读取的数据,跳过了关键检查,或者在中间做了很多不符合预期的操作。
因此,我们还需要知道它是怎么完成任务的:调用了哪些工具,每一步做了什么,在哪里失败过,为什么恢复,以及有没有越过权限边界。只有这些过程能够被记录、检查和复现,我们才能发现哪些地方需要优化,哪些行为可能带来风险。
模型能力越强,这件事越重要。因为能力弱的时候,它最大的风险可能只是做不成;能力足够强以后,它可能在我们没有看见的地方,以错误的方式把事情做成。
我不认为 AI 会因为安全风险而停止发展。真正现实的方向,是承认竞争不会停,然后让监控、权限、隔离和审计成为 AI 系统不可缺少的一部分。
安全不能只是发展之后再补的一句承诺。它必须和模型能力一起增长。