9月4日消息,当地时间9月3日,OpenAI宣布推出新一代GPT-6 Astra模型,这是该公司迄今为止最强大、部署最广泛的大语言模型。
据介绍,Astra是OpenAI旗下首个达到其“准备框架”(Preparedness Framework)中“关键”(Critical)网络安全能力门槛的模型。总裁格雷格·布罗克曼(Greg Brockman)声称,随着Astra的发布,世界已进入通用人工智能的新时代。

网络安全能力显著跃升
据OpenAI介绍,Astra在网络安全能力上实现显著提升——在提供适当工具和访问权限的情况下,该模型能够在无人指导的条件下,发现许多防护严密系统中此前未知的安全漏洞,并开发新的利用方式。
正因如此,OpenAI同步加强了安全防护,包括强化内部开发和部署环境隔离、加密模型检查点、对完整运行轨迹进行统一监控,并引入内部使用前必须通过的阻断式对齐评估流程,针对模型因滥用或自身偏差采取有害网络操作的风险增加防护。
安全性与对齐表现
与GPT-5.6 Sol相比,GPT-6 Astra的抗越狱能力有所提升:通过新的鲁棒性安全训练技术,模型在面对被破坏的、异常的、有恶意的输入时更为稳定,在较长运行轨迹中的表现同样更加稳定。在具体应用中,Astra对提示词注入攻击的鲁棒性显著优于前代,在真实浏览和专业计算机环境中,未经授权交易、数据丢失、过度访问、规避控制等潜在破坏性行为大幅减少;对高风险场景的响应更安全,在18岁以下用户的年龄适配安全边界应用上也更为一致。
对齐方面,模型在遵守安全边界、保持在获授权范围内执行任务方面表现更好。OpenAI还利用超过5.4万项内部Codex任务开展部署模拟,Astra被标记为高严重程度失配行为的次数约为GPT-5.6 Sol的一半。OpenAI同时将失配监控系统扩大部署至Astra对外部署中涉及工具调用的推理流程。
可监控性下降引发关注
值得注意的是,OpenAI坦承GPT-6 Astra的可监控性较GPT-5.6 Sol有所下降:相关研究显示,Astra更有能力控制自身思维链(CoT),且更不容易在其中留下可能暴露问题的信息。在要求模型主动规避监控的对抗性测试中,Astra在故意降低表现时可以保持不被发现,执行部分破坏性任务时也能规避内部监控。
不过,OpenAI称目前尚未发现Astra存在思维链隐写推理的证据,现阶段观察到的规避风险可能主要局限于较低难度的推理任务;整体对齐测试仍显示,Astra违反安全限制的可能性低于前代。OpenAI表示将继续研究这一趋势,并强调仅依靠检查思维链并不足以完成对齐审计,还需发展其他审计技术。
OpenAI首席科学家Jakub Pachocki在9月3日的简报会上表示:“随着模型能力增强,准确理解它们能做什么变得更困难了。这并不保证随着智能持续提升,我们的方法仍然足够有效,因为智能的进步并不能保证对齐的进步。”

微信扫一扫
支付宝扫一扫 