AI 不需要看完所有内容,先要知道为什么看
最近,Google 推出了一项智能体式视频理解功能。
以往的模型处理视频,通常会按照固定帧率读取内容。新的方式则不再平均地处理整段视频,而是根据目标,动态决定看什么、以什么速度看,以及应该查看画面、音频还是转录文本。按照 Google 公布的测试结果,这种方式不仅减少了 token 消耗和成本,准确率还有所提高。
具体数据是在什么条件下得到的,能不能在普通任务中复现,还需要更多实际使用来验证。但这种处理方式本身让我觉得很熟悉。
在开发谈小简时,我也需要处理很长的会议录音和转录文本。大模型无法一次稳定地处理全部内容时,常见办法就是分段:先把长内容切成若干部分,分别处理,再把结果汇总起来。
但简单地切开也会产生问题。一句话可能刚好横跨两个分段,前一段只有开头,后一段只有结尾,单独处理时就可能丢失原来的意思。因此,分段之间还需要保留一部分重叠内容,也就是 overlap,让相邻片段拥有一段共同的上下文。
这种方法的效果还可以,却也说明了一个问题:面对长内容,真正困难的并不是让 AI 把所有内容都读一遍,而是怎样在效率和信息完整性之间作出选择。
Google 的智能体式视频理解,相当于把一部分选择交给了模型。它不再以固定方式扫描全部视频,而是围绕任务主动寻找相关内容。需要统计快速动作时,就用更高帧率重新查看某个片段;需要从几小时的视频里寻找一句话时,就优先从音频和转录文本中定位。
不过,AI 决定看什么之前,还有一个更重要的问题:我们为什么要看?
同一段会议录像,如果目标是整理待办事项,模型应该关注负责人、截止时间和已经确定的决策;如果目标是分析沟通问题,它需要关注的可能是语气、分歧和没有得到回应的意见;如果只是制作摘要,又会采用另一套选择标准。
内容没有变化,目标不同,值得关注的部分就不同。
所以,我并不认为这项能力意味着以后可以把所有内容交给 AI,让它自己决定什么重要。AI 的选择仍然需要服务于人的目标。人是需求的提出者,应该先说明自己想解决什么问题;AI 理解目标以后,再决定需要查看哪些内容,以及采用什么方式处理。
这也意味着,模型能够处理的上下文越来越长,并不会让人的作用消失。以前,我们需要亲自切分内容、寻找重点;以后,这些执行工作可能更多地交给 AI,但我们仍然需要决定目的是什么、什么样的结果才算有用。
AI 不需要平均地看完所有内容,但必须知道自己为什么看。
而这个“为什么”,最终仍然来自人。