GPT-6 Astra:更强的模型,然后呢?
前几天,OpenAI 发布了 GPT-6 Astra。最近,我也终于在自己的模型列表中看到了它。
按照 OpenAI 的说法,这是他们目前能力最强的模型,主要面向复杂推理、编程、电脑操作、研究和文档制作。它最值得关注的地方,不是回答一个问题时变得更聪明,而是能够在代码、浏览器和专业软件之间完成更复杂的多步骤任务。
这里的“来了”并不代表所有人现在都能使用。OpenAI 采取的是分阶段开放方式,官方列出的范围包括 ChatGPT Plus、Pro、Business、Enterprise 和 API;企业工作区还可能需要管理员开启,免费用户则不在这份开放说明之中。因此,不同用户看到 Astra 的时间和使用方式并不相同。
这看起来正是很多人期待的 AI:不只是告诉你应该怎么做,而是能够把一件事情真正做完。
但看到这些消息以后,我首先想到的却是另一个问题:模型更强了,然后呢?
Astra 强在哪里?
如果只看 OpenAI 公布的数据,Astra 相比 GPT-5.6 Sol 的优势主要集中在复杂任务上。
在偏向命令行和工具操作的 Terminal-Bench 4.0 中,Astra 的成绩是 57.9%,Sol 是 37.3%;在衡量专业工作自动化能力的 AutomationBench 中,两者分别是 41.4% 和 18.1%。面对 51.2 万到 100 万 token 的长上下文检索,Astra 的成绩是 96.3%,Sol 是 73.8%。这些都是 OpenAI 自己公布的评测结果,生产环境中的效果仍可能受到提示词、工具和系统设置影响。
第三方的早期评测也呈现出类似趋势。CodeRabbit 用它做代码审查时,Astra 的整体有效缺陷发现率只比 Sol 高大约 4%,但在更困难的跨文件审查中,相对提升达到 20%。这至少说明,简单任务留给模型发挥的空间有限;当信息散落在多个文件中、任务需要维持较长的推理链路时,Astra 的优势才更容易体现出来。
一位实际使用者用同样的提示词测试日常写作和研究,也得出了相近的结论:整理一小段文字时,很难看出 Astra 和旧模型的差异;但在“研究多个来源,再完成初稿并自行检查”这样的多步骤任务中,Astra 更容易自己走到最后一步,减少中途要求用户继续推动的次数。
这可能是理解 Astra 最重要的一点:它不是为了让一句普通回答显得更惊艳,而是为了提高复杂任务最终完成的概率。
不过,更强并不意味着任何任务都应该使用它。
Astra 的 API 标准价格是每百万输入 token 10 美元、输出 token 50 美元,都是 Sol 的 2.5 倍。OpenAI 表示,Astra 在部分评测中使用了更少的输出 token,因此尽管单价更高,每项任务的估算成本反而可能更低。但这只是特定评测中的结果,不能直接推导为所有实际任务都更便宜。
Artificial Analysis 的测试也显示,推理强度从 high 提升到 max 后,综合得分只从 51 提升到 53,平均任务成本却从 1.72 美元上升到 3.26 美元,完成时间也接近翻倍。至少从这些结果看,Astra 更适合真正困难、能够从更强推理中获益的任务,而不是替代便宜模型完成所有日常工作。
它也没有消除长任务本身的风险。模型越能自主运行,任务方向一旦设错,它就可能越坚定地沿着错误方向执行。前面那位测试者就发现,Astra 可以毫不停顿地完成文章,却因为读者对象没有说明清楚,最终写出了一篇面向错误人群的功能清单。减少中途干预是优点,但前提是目标、边界和验收标准足够明确。
此外,OpenAI 在安全说明中也公开承认,Astra 虽然比 Sol 更能遵守授权边界、更能抵抗提示词注入,但它在对抗性测试中更有能力控制自己的思维过程,因此更难通过思维链监控发现异常。这并不代表日常使用一定不安全,却说明模型能力增强的同时,监督它的方法也需要继续进化。
真正的问题可能不是模型够不够强
AI 的能力进化得越快,我反而越容易产生一种焦虑。
以前还可以认为,很多事情没有做成,是因为技术能力有限,或者一个人完成项目的成本太高。现在,AI 已经可以阅读整个代码库、修改多个模块、调用工具、运行测试,甚至连续工作很长时间。至少在“能不能做出来”这件事上,门槛确实越来越低了。
可对我来说,真正困惑的事情并不是没有项目。
我有几个很早就想做的小项目,只是一直没有真正完成和发布。我所缺少的也不完全是想法,而是确定性:不知道做出来以后有没有人用,不知道它能不能带来收益,也不知道投入是否值得。
但这又是一个悖论。
大多数独立开发者并不是只做一两个项目,就能找到确定的收益。如果一定要在开始以前证明它能赚钱,那么很多项目永远不会开始。需求是不是真的存在、别人愿不愿意使用,往往只有把东西做出来、交给市场以后才知道。
AI 的确降低了这种试错成本,但这并不意味着我们应该批量生产一堆没人需要的软件。做出垃圾的速度更快,并不会让垃圾变得更有价值。
问题在于,我眼里的“没用”,也不一定是真的没用。
有人卖 AI 课程和教程,有人收费帮助别人注册 Steam 账号,甚至有人靠帮别人下载、安装软件赚钱。这些事情在熟悉电脑的人看来可能太简单了,简单到不像一门生意,但它们确实解决了一部分人的问题。
每个人看到的世界不同,拥有的知识和遇到的困难也不同。我可以判断一个产品对自己没有用,却很难只凭自己的经验断定它对所有人都没有用。
所以,AI 降低的不只是开发成本,也降低了验证一个想法的成本。与其长时间猜测一个项目有没有价值,不如先把它做到能够使用和发布,再让真实反馈修正自己的判断。
更强的模型,仍然需要人决定做什么
即使一个项目最后没有赚到钱,完成它也不一定毫无意义。
首先,完成属于自己的作品,本身就会带来成就感。其次,它仍然有小概率获得收益,也可能恰好解决一小部分人的需求。最后,从想法到开发、测试、发布的整个过程,本身就是一次能力训练。
当然,Astra 不能替我决定哪个项目值得做,也不能保证作品发布以后一定有人使用。它能够减少执行过程中的阻力,却无法提供收益的确定性,更不能替我回答为什么要开始。
这可能就是“然后呢”的答案。
GPT-6 Astra 值得关注,因为它让 AI 从回答问题进一步走向完成工作。但对我来说,真正重要的并不是又多了一个更强的模型,而是工具已经走到这里以后,我是否愿意挑出一个想法,在没有确定回报的情况下把它完成并发布。
模型能不能完成更长的任务,可以通过评测和实际项目验证。至于我能不能完成自己的作品,最终还是要用作品回答。