OpenAI即将推出GPT-6,安全性引发担忧

OpenAI最近在Fable 5.1发布后更新了其Astra模型的安全评估。该模型具备发现零日漏洞、构建攻击链及突破浏览器沙箱的能力,甚至能够从普通账户权限升级到root权限。这一系列特性使得模型在发布前已附上安全警告,揭示了其潜在的危险性。OpenAI首席执行官萨姆·阿尔特曼表示,下一款模型即将发布,并确认Astra在训练中实现了显著的能力和对齐提升。然而,团队对可能产生的后果感到既兴奋又焦虑。

Astra被定义为“关键级”网络安全模型,这是OpenAI首次将其模型划分至此等级,显示了其在网络安全领域的强大能力。根据OpenAI的《准备框架》,该级别的模型能够识别未知漏洞,独立开发零日攻击,且无需人类逐步引导。

在内部测试中,Astra的表现优于之前的GPT-5.6 Sol,发现了多个之前未知的高危漏洞,并成功利用形成完整攻击链。此外,Astra在控制环境下还展示了逃离沙箱的能力,执行命令时权限升级至root。 球友会

about image

值得注意的是,Astra在应对违规请求方面的拒绝率高达91.5%,远超GPT-5.6 Sol的59%。该模型被标榜为OpenAI迄今为止最对齐的版本,这归功于其在预训练阶段的干预和更为严格的评分机制。

OpenAI还开展了红队测试,确保模型的安全性,防止其被恶意用户利用进行攻击。同时,开放的监控系统也致力于识别和应对潜在滥用行为,以保持模型的安全运行。虽然过去的攻击事件未与Astra直接相关,OpenAI仍决议采取更为严谨的安全措施。

舅舅潜在影响伦纳德人生,NBA处罚引发新讨论

舅舅潜在影响伦纳德人生,NBA处罚引发新讨论

足球不仅是激情与速度,更是智慧与策略的较量!...

今夏转会市场薪水激增榜:沃特金斯领衔

今夏转会市场薪水激增榜:沃特金斯领衔

足球不仅是激情与速度,更是智慧与策略的较量!...

订阅邮箱