METAL

OpenAI Astra解开全球未解DEF CON谜题

被评为"灾难级"网络安全风险仅四天后,OpenAI展示了这款模型用并行智能体破解黑客谜题的过程

OpenAI Astra解开全球未解DEF CON谜题

图片:由 METAL AI 生成

摘要

  • OpenAI在9月5日公开的视频中,测试者Ben Davis分享了自己用GPT-6 Astra攻克DEF CON高难度谜题的经历
  • 在3x4排列的魔方谜题和串珠礼服谜题中获得提示后成功解出答案,其中一题据称是全球首次破解
  • Astra采用主智能体调度、最多10个子智能体并行推进的研究分支结构,能在解题过程中避免偏离方向
GPT-6 Astra with Ben Davis

全球无人破解的黑客谜题,被Astra解开了

OpenAI于9月5日公开的官方视频中,率先试用GPT-6 Astra的测试者Ben Davis分享了自己的第一印象。他把安全大会DEF CON上难度最高的几道谜题挑战直接丢给了这款模型,结果不仅解出了自己和朋友一直没能攻克的三道题,还破解了一道全球范围内此前无人解开的题目。

OpenAI官方视频《GPT-6 Astra with Ben Davis》

虚线圆圈标注的未解谜题,箭头以虚线指向主智能体。主智能体是圆圈中的一个点,只承担协调角色。旁边是排列紧密的网格状子智能体节点,与主智能体之间用实线双向箭头相连——最多可并行派出10个,结果再返回主智能体。虚线圆圈标注的未解谜题,箭头以虚线指向主智能体。主智能体是圆圈中的一个点,只承担协调角色。旁边是排列紧密的网格状子智能体节点,与主智能体之间用实线双向箭头相连——最多可并行派出10个,结果再返回主智能体。
图片:METAL AI生成

Davis表示:"全球第一个解开这道谜题的,就是这个模型。"

DEF CON谜题到底是什么

DEF CON是每年在拉斯维加斯举行的大型黑客与安全大会,以让参赛者苦思数日的高难度密码谜题挑战闻名。Davis说,他专门挑选了这场大会上出现过的最难题目,直接交给Astra尝试。结果,他和朋友们此前完全无从下手的三道谜题,以及此前全球无人破解的一道谜题,都在他和Astra的配合下解开了。

데이비스가 아스트라에 던진 DEF CON 퍼즐 실화면. 색이 제각각인 루빅스 큐브 12개가 가로 4개·세로 3줄로 놓여 있고, 화면 오른쪽 위 작은 창에서 데이비스가 설명하고 있다
이미지: 오픈AI 영상 갈무리

魔方与串珠礼服,两个典型案例

他展示的代表性案例有两个。一个是把多个按3x4排列的魔方组合起来,推理出隐藏信息的谜题,Astra在获得谜题制作者公开的官方提示后,三次尝试全部答对。另一个是从多张布满彩色串珠的礼服照片中找出隐藏信息的题目,尽管照片质量不佳,但在获得管理方给出的关键提示后,Astra依然找出了答案,Davis这样描述道。

谜题形式所需提示结果
魔方谜题3x4排列的魔方组合,推理隐藏信息制作者的官方提示三次尝试全部解开
串珠礼服谜题从多张彩色串珠图像中提取信息管理方给出的关键提示获得提示后解开
퍼즐 풀이 결과 화면. 드레스 퍼즐은 '1 solved · 1 unsolved', 큐브 퍼즐은 '3 solved · 0 unsolved' 로 표시되고 각각 확정 답안 INCONSISTENTKNOTS 와 LACKOFDUST 가 적혀 있다
이미지: 오픈AI 영상 갈무리

最多10个智能体同时运作

Davis解释说,Astra解题时会先建立一个理论假设,派出单独的智能体去验证这个假设,再根据结果分出不同的研究路径。主智能体最多能填满10个子智能体名额,让它们并行运作,自己则只负责统筹协调整个过程。他评价说,以前的模型缺乏这种中间验证环节,很容易在错误的假设上越走越偏,而Astra在保持解题方向不偏移这一点上有了明显提升。他还补充说,同时挂载多个智能体实例的所谓"蜂群式工作流",到现在才算真正可行。

아스트라의 리서치 브랜치 패널. 오른쪽에 '3 / 10 active' 가 떠 있고, 조율자가 브랜치 217개를 띄워 2개를 정리했다는 상태와 개별 브랜치 3건의 경과 시간이 나열돼 있다
이미지: 오픈AI 영상 갈무리

为什么这段视频会在此时出现

OpenAI在今年8月的安全评估中曾表示,Astra在网络安全风险等级上已接近"临界"水平,随后在9月1日又公布,按照准备框架的标准,这是首个被评为"灾难级"的模型。这款模型于9月3日正式发布,官方称其在长时程电脑操作任务和软件工程方面表现最佳,同时也公布了对齐能力的改进内容。此次视频是两天后发布的后续内容,以用户体验的形式展示了同一款模型娴熟解开实战黑客类谜题的过程。

换句话说,Astra正是两天前被OpenAI自己评为网络安全"灾难级"风险的那款模型。这段视频展示的黑客类谜题破解能力,与支撑那个风险等级判定的能力高度重叠,因此这两条消息需要放在一起看,才能看清Astra究竟具备怎样的实际能力。

编辑视角

OpenAI发布这段视频的时间点相当微妙。就在贴上"灾难级"网络安全风险这个沉重标签仅四天后,同一款模型就展示了破解黑客界视为荣誉之战的DEF CON谜题的过程。风险警示类发布和能力展示类发布如此紧密地接连出现,似乎说明OpenAI把这款模型的风险与实用性看作一体两面。安全诊断能力出众的模型,既能成为防守方的利器,也可能变成攻击者的工具,把这两条消息分开来读,只能看到画面的一半。

在实际业务中使用这类智能体模型时,总会卡在同一个地方:多个智能体并行运作,却缺乏中间验证环节,结果在错误假设上白白浪费好几个小时。Davis所说的研究分支结构——先建立理论,再用独立智能体验证,随后分支推进——看起来正是针对这个问题设计的。不过,子智能体名额被限制在10个这一点,是国内团队引入时需要留意的地方。把问题拆得越细、并行派发得越多,消耗的token和成本也会同步增加,因此比较稳妥的做法是先从安全诊断、逆向工程这类验证环节较多的业务上试点,提前评估投入与效果的比例。

未来几周内,类似的实战案例视频很可能还会陆续出现。与此同时,安全社区大概也会围绕Astra的网络安全能力展开验证与复现尝试,而这些结果将成为衡量OpenAI此前风险等级判定是否合理的下一个标尺。

评论