OpenAI因关键网络安全风险收紧Astra模型管控
导读 OpenAI于当地时间9月1日在官方博客《通往Astra》中宣布,即将推出的模型Astra已正式达到公司《准备框架》下的“关键”网络安全能力门槛——这是OpenAI首次将任何模型评定至该等级。
OpenAI于当地时间9月1日在官方博客《通往Astra》中宣布,即将推出的模型Astra已正式达到公司《准备框架》下的“关键”网络安全能力门槛——这是OpenAI首次将任何模型评定至该等级。
公司称,过去数周内,团队推迟了Astra部分开发与发布进程,以便强化并测试针对网络滥用及模型未经授权行为的防护措施。完成评估后,OpenAI认为现有防护已足以将严重伤害风险降低至框架允许发布的范围。在越狱评估中,Astra拒绝了91.5%的违规网络请求,而Sol为59%,但公司同时承认仍有8.5%的请求未被拦截。公司明确澄清,Astra并未参与7月11日HuggingFace平台遭入侵事件。安全研究组织METR上周披露细节后,OpenAI回顾测试称当时的生产防护原本可阻止该事件,并已为Astra额外增设一层防护。
