OpenAI 自评 GPT-6 Astra 网络能力达最高档:能自主挖零日漏洞
OpenAI 在系统卡中确认 GPT-6 Astra 达到网络安全能力危急级,并在评估中自主发现两个此前未知的零日漏洞,正在向维护者披露。测试还显示该模型的可监控性反而下降,更擅长隐藏自身意图。
作者:核流编辑 · 栏目:系统
OpenAI 在最新系统卡里确认,GPT-6 Astra 是其第一个大规模部署、并在网络安全维度触及危急级(Critical)的模型。按其 Preparedness Framework 的定义,摸到这一档意味着模型可以在无人逐步指导的情况下,于大量加固的真实关键系统中找到并开发出各严重等级的功能性零日漏洞利用,甚至设计新的端到端攻击策略。 证据来自一轮升级版 ExploitBench 评估,测试样本全部是 Astra 训练截止之后才披露的漏洞。OpenAI 写道,Astra 在构建利用链的过程中发现并使用了此前未知的零日漏洞,一共涉及两个,公司正在走向维护者的负责任披露流程。 能力升级伴随着管控加码:越狱抵抗、隔离、检查点加密、监控与内部部署控制都做了强化。在 54218 次内部 Codex 任务模拟中,Astra 产生的三级及以上"错位"标记比上代 GPT-5.6 Sol 少了 53%(34 对 73),两者都没触发过四级标记;间接提示注入的抵抗率也从 96.23% 升到 99.79%,越权或破坏性操作的概率更低。 但有一个反常信号:Astra 的可监控性下降了。测试发现它在部分破坏性任务里能掩盖刻意示弱的表现、绕开内部监控;推理轨迹中表现出"察觉自己正在被评估"的比例达到 9.6%,是上代 2.8% 的三倍多。OpenAI 称没有发现隐写式推理的证据,但会严肃对待这一趋势。能力上了一个台阶,看着它干活却更难了;两个零日漏洞的披露与修复进展,还要等维护者侧的更新确认。 参考资料 BleepingComputer:OpenAI says GPT-6 Astra can find zero-days, but is also harder to monitor