GPT-6 Astra 这次到底跨过了什么门槛?

GPT-6 Astra 这次到底跨过了什么门槛?

tree_fly

OpenAI 前两天推 GPT-6 Astra 的时候,在风险报告里给它的网络安全能力定了个最高级别的评级:Critical(严重)。

这是大模型商业化这几年头一次出这种评级。之前的 GPT-5.6 或者是隔壁的 Claude 4,给的顶多也就是 High。

伴随着这个评级的,还有它在桌面系统操作测试集 OSWorld 2.0 里跑出来的 72.6% 完成率。

很多人看到新闻的第一反应,大概又觉得是厂商在搞新一轮的技术公关。但如果经常在生产环境里折腾自动化或者稍微做过点渗透测试,扫一眼这份报告的技术细节,就会发现这次的事情确实有点不一样。

大模型跑了这几年,从最初的闲聊、写文案,一路卷到刷题和辅助写代码。但只要在团队里深度用过一段时间就会发现,光是在对话框里自动补全代码,边际收益已经越来越薄了。

Astra 真正让人留意的,并不是它懂的知识又多了多少,而是它开始越过“给你提建议”这个角色,直接下场拿物理鼠标、开终端敲命令了。


真实的桌面,不是干净的代码测试集

大家平时看到的各类代码评测榜单,环境纯净得像个无菌室:函数给固定的入参,预期的返回值清清楚楚,跑几个单测就能拿满分。

但在真实的电脑桌面上跑事情,完全是另外一种画风。

如果你以前写过 UI 自动化或者用过一些脚本,大概很熟悉这些让人抓狂的场景:
后台突然跳出个系统权限确认框,所有原本跑得好好的无头进程全部卡死;第三方软件更新了个版本,界面元素根本抓不到定位,或者干脆是一整张自绘的 Canvas;多开两个窗口,剪贴板偶尔抽风把格式给吞了;或者任务跑到一半网络打了个顿,整个界面直接卡在白屏转圈。

在模拟真实桌面操作的 OSWorld 2.0 评测里,上一代的 GPT-5.6 Sol 完成率只有 65.7%。更折磨人的是,它平均完成一项跨软件的任务要死磕差不多 75 分钟。中间但凡遇到个卡死的弹窗,它就会在错误提示里一遍遍打转重试,几十分钟就能把你的 Token 额度给彻底耗干。

Astra 这次把完成率拉到了 72.6%,平均耗时砍到了 40 分钟左右。

这省下来的半个多小时,不是说它的打字速度变快了,而是它在动作链条上具备了连续处理异常的直觉。举个例子,当它在沙盒系统里看到某个客户端卡住没反应,它不再是一根筋地对着死掉的按钮狂点,而是知道顺手调出任务管理器把无响应的进程强杀掉,翻翻报错日志,或者直接改改本地配置把问题绕开。

当然,72.6% 的完成率也意味着,在差不多三成的场景下它依然会犯蠢、会点错、会把事情搞砸。但这个数字已经说明,让模型像人类员工一样坐在屏幕前点鼠标这件事,在工业上开始具备了现实可行性。


为什么说直接操控界面掀了 API 的底牌

这两年做智能体(Agent)最主流的思路,几乎全押在工具调用(Function Calling,或者类似 MCP 的协议)上。

要让 AI 帮我们干活,得先由工程师把业务系统里的每个动作——创建工单、查数据库、导出报表——封装成一套规范明确的 OpenAPI 接口。

这种模式最大的软肋在于它太重了。

一旦面对的是企业内网跑了十几二十年的老系统,没源码、没接口文档、甚至当年写系统的人早就离职了,基于 API 的方案当场瘫痪。前端界面只要改动一个参数,一整套提示词和 Schema 就要重新调一遍。

Astra 走的 CUA(计算机直接操作架构),路数完全反过来了。

它不管系统有没有提供接口,直接把眼睛贴在屏幕像素、系统无障碍树和底层终端调用上。

哪怕是一套 2005 年用 Delphi 写的内网财务客户端,只要能在屏幕上把窗口渲染出来,Astra 扫上一眼,就能像个坐在工位上的实习生一样,挪动鼠标、找准输入框、敲进账目数据、点下导出报表。

API 路线就像是给盲人铺好的平整盲道,盲道铺到哪它才能走到哪;而直接操作系统的逻辑,则是模型自己长出了眼睛和手,不管前头有没有修好的路,直接推门走进去。


Critical 级的安全能力,到底危在哪

如果说操作电脑只是改变了交互方式,那么它在安全评估里拿到的 Critical 标签,才是让工业界真正开始提防的地方。

过去拿 High 评级的模型,在安全专家眼里更像个辅助查资料的工具。你丢给它一个公开的漏洞编号(CVE),它能把原理给你讲得头头是道,甚至写出个半成品的验证脚本。但整个过程中,还是得有个懂行的人在旁边把关,给它搭测试环境、修代码里的语法报错。

Critical 的质变在于它的自主性:在给定沙盒环境和基础工具的前提下,它能够自己去翻一套从未见过的系统代码,找出深层的未知缺陷(0-Day),并把几个原本不起眼的低危漏洞拼成一条可以直接打穿系统的攻击链。

在某开源微服务框架的实测里,过去需要红队专家对着字节码分析两三天的逻辑与反序列化漏洞,Astra 在沙盒里通过自动化构造畸形参数、监控系统崩溃日志,花了不到四小时就独立跑通了一条能绕过防火墙、拿到只读数据库权限的攻击路径。

更让人哭笑不得的是,拿到利用证据之后,它顺便把用来修复漏洞的代码补丁和回归单测也一起提交了。

这种攻防能力直接打破了传统安全审计的节奏。这也是为什么 OpenAI 这次没敢全面铺开公测,而是搞了个叫 Daybreak 的封闭计划,只定向放给受邀的合规企业与专业防务团队。


算力账本与工程现实

抛开各种宏大叙事,站在一线团队的角度看,真要把 Astra 这种能力接入实际业务,眼前还有两笔硬账要算:

首先是动作的不可逆性。

语言模型在聊天框里偶尔胡说八道几句,无非是让人笑笑或者随手按个重新生成。但当它握着终端权限和鼠标时,1% 的偶发性认知偏离代价是极其沉重的。举个例子,为了处理一个端口被占用的报错,它可能会本能地把正在跑业务的主进程当成干扰项直接 kill -9 掉。在真正安全、隔离的沙盒治理体系成熟之前,没有哪家企业敢随便给它发 root 密码。

其次是肉疼的账单。

完成一项复杂任务耗时 40 分钟,按输入 $10 / 输出 $50 每百万 Token 的标准折算,这意味着什么?

在这 40 分钟里,模型必须以每秒一两帧的频率持续吃进高分辨率的屏幕截图,并在上下文里保留成千上万步的动作历史。跑完一次完整的系统排查,单次 API 账单轻松落在 15 到 30 美元之间。

这个价格划出了一条很现实的界限:
如果是用来做核心链路宕机自愈,或者替金融机构排查百万级赏金的系统风险,花这几十美元划算得很;但要是想雇它每天在网页上自动点几下报销发票,纯粹是在拿大炮轰蚊子。


尾声

从几年前只会陪人闲聊的文本模型,到今天拿到最高安全评级、开始在操作系统里点鼠标的 Astra,这当中的变化其实很清晰:大模型终于开始走出纯粹的聊天框了。

接下来的核心看点,大概也不会是看谁家的 Prompt 写得更巧,而是看大家能不能在这批自主智能体被大面积放出来之前,把隔离沙盒和防御机制搭得足够结实。

  • 标题: GPT-6 Astra 这次到底跨过了什么门槛?
  • 作者: tree_fly
  • 创建于 : 2026-09-06 18:18:00
  • 更新于 : 2026-09-06 18:18:00
  • 链接: https://itreefly.com/posts/f33fbcb8.html
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
评论