OpenAI宣布其下一代人工智能模型Astra为首款突破公司设定的“关键”网络安全能力阈值的产品。该模型可在无需人类指导的情况下发现并利用此前未知的安全漏洞,被归入其“准备框架”中最先进类别。
OpenAI于2023年推出“准备框架”,用于跟踪和应对先进AI可能带来的严重危害风险;其中“关键”阈值指模型可能引入前所未有的严重危害新途径。公司表示,Astra已达到该阈值,具备自主识别与开发“零日漏洞”的能力。
Astra计划“尽快”发布,但其高级网络安全功能初始阶段仅限部分测试人员使用;后续将通过Daybreak Blue计划向经批准用户开放,专用于防御性网络安全工作。该计划配套专为网络安全设计的安全措施,包括对模型内部部署行为的实时监控及自动中止潜在未经授权活动的机制。
今年8月,OpenAI因发现Astra在网络安全任务中表现出显著能力,暂停了部分内部研发工作,以强化安全防护。公司称已增强模型拒绝“有害网络请求”的能力,并在安全、安保与对齐测试方面完成多轮评估。
尽管Astra未参与7月针对Hugging Face Inc.的意外攻击事件,OpenAI仍基于该事件经验为其增设更严格防护措施。公司强调,当前安全保障已充分降低在准备框架下发布可能带来的严重危害风险。
Astra被定位为OpenAI下一个主要模型,除网络安全能力外,还支持多个智能体长期协同解决复杂问题,如联合完成数学证明;并可直接操控桌面软件,执行PPT制作、财务审核及杂乱数据集分析等任务。
免责声明:本文内容由开放的智能模型自动生成,仅供参考。



