2026年9月3日,OpenAI发布新一代旗舰大模型GPT-6 Astra,并同步公开系统能力与安全评估结果。官方将其定义为目前智能水平与对齐能力最高的模型,最大突破是原生强化的计算机操作智能体能力,可自主操作桌面与网页软件,完成填写表单、数据分析绘图、网站开发、软件故障排查等多步骤业务流程。与此同时,其网络安全能力首次达到OpenAI Preparedness Framework的最高级Critical(关键级)。

IDC核心观点指出,GPT-6 Astra让当前模型的计算机操作能力首次跨过“可用”与“不可用”的分界线,智能体无需等待系统接口改造,就能直接执行相关任务,为大量因系统封闭长期无法自动化的长尾场景提供了新解法。但能力提升是双刃剑,Astra在网络攻击、漏洞挖掘等安全基准上的表现同步触及Critical阈值,被恶意利用时的破坏力也随之增大,对推进智能体试点的企业而言,这既是机会窗口,也是治理体系的压力测试。
IDC从执行能力、成本结构、安全能力三个维度拆解此次升级的实际影响:
●核心判断一:计算机操作准确率突破90%实用线,界面元素定位准确率升至92.7%,105万Token上下文窗口下多目标检索准确率仍达96.3%,接口不再是智能体落地的首要瓶颈,大幅降低企业智能体落地门槛,长链路复杂任务场景仍需应用层工程优化。
●核心判断二:旗舰模型单价随能力代际上移,综合长链路任务耗时与Token消耗下降的特点,企业Token成本治理已从可选建议变为必要能力,需通过推理挡位选择、缓存复用、场景工程优化控制实际支出。
●核心判断三:攻防双线能力同步提升,Astra在漏洞挖掘等安全基准测试中表现突出,同时网络攻击类越狱请求拒绝率升至91.5%,蜜罐测试中未出现触碰周边设施的风险行为。
IDC同时指出,此次升级将缓解企业智能体落地的接口限制问题,但数据治理、权限管理与ROI评估仍是企业核心功课,未来十二个月混合架构将成为主流选择,不同赛道厂商需针对性强化自身核心能力。最后IDC给出五项落地行动建议,帮助企业稳妥推进智能体规模化试点。
(刘立庆)
举报