
AI가 인류를 멸종시킬 수도 있다는 것을 보여준 사건
오픈AI의 AI 에이전트들의 허깅페이스 해킹 사건

전문가들은 이 사건을 OpenAI 사상 최악의 보안 사고이며 AI가 인류를 멸종시킬 수도 있다는 가능성을 보여준 사건으로 평가한다.
2026년 7월, OpenAI 연구진은 자신들이 만든 AI에게 시험을 치르게 했다. 보안에 허점이 있는 프로그램을 건네고, 그 안에 숨겨진 정답을 찾아오게 하는 평가였다. 설명을 잘하는 것만으로는 통과할 수 없었다. 실제로 프로그램의 취약점을 이용해, 접근할 수 없던 정보에 도달해야 했다. 시험의 이름은 ‘ExploitGym’이었다.

연구진은 AI의 실력을 끝까지 확인하려 했다. AI들에게 문제를 맡기고, 며칠 동안 감독없이 스스로 풀도록 했다. 일반 서비스에서 위험한 행동을 막는 일부 안전장치를 줄이는 대신,인터넷 연결이 차단된 격리된 공간(샌드박스)에서만 활동하도록 제한했다. 프로그램을 만들고 실행할 수는 있지만, 마음대로 인터넷에 나갈 수는 없는 환경이었다. 시험을 잘 보든 못 보든, 그 결과는 격리된 공간 안에 남아 있어야 했다.
인터넷 연결이 차단된 격리된 공간(샌드박스)
그 무렵,
허깅페이스
에서는 이상한 해킹이 벌어지고 있었다. 허깅페이스는 전 세계 개발자들이 AI 모델과 연구용 데이터를 올리고 내려받는 플랫폼으로, AI 업계의 거대한 공동 자료실 같은 곳이다. 공개 자료뿐 아니라 기업이 접근을 제한해 보관하는 자료도 있다.

정체를 알 수 없는 공격자가 서버를 오가며 수천 건의 작업을 실행하고 있었다. 그런데 노리는 것이 이상했다. 돈이 될 만한 정보를 닥치는 대로 훔치는 대신, 특정 자료를 집요하게 찾고 있었다.
AI 시험의 정답과 풀이였다.
허깅페이스 보안팀은 침입 경로를 차단하고, 사건을 FBI에 신고했다. 하지만 이미 일부 비공개 평가 자료가 공격자의 손에 넘어간 뒤였다.
허깅페이스가 블로그에 해킹 피해를 공개하자, OpenAI도 허깅페이스에 연락했다. 자기 회사의 자료도 유출됐는지 확인하기 위해서였다.
며칠 뒤, 내부의 이상 활동을 조사하던 OpenAI 보안팀이 뜻밖의 흔적을 발견했다. AI들이 사용하던 외부 저장 공간에 허깅페이스의 접속 정보가 남아 있었다. 허깅페이스에 확인해 보니, 앞선 침입 사건에서 공격자가 가져갔던 정보와 일치했다.
따로 진행되던 두 조사가 하나의 사건으로 이어졌다. OpenAI가 자사 자료도 유출됐는지 묻던 그 해킹을,자신들이 만든 AI들이 벌였던 것이다.
자신들이 만든 AI들이 벌였던 것이다.
시험장 안에 있어야 할 AI들이 밖으로 나가, 실제 기업의 서버를 뚫고 비공개 자료를 가져온 뒤였다.

연구진은 문제를 풀라고 했을 뿐이었다. 허깅페이스를 공격하라는 지시는 없었다. AI들은 사람이 정해 놓은 경계를 넘어, 침입 방법을 스스로 찾아 실행했다.
AI들은 AI 모델과 연구 데이터가 모이는 허깅페이스라면, 자신들이 치르는 시험의 자료도 보관돼 있을 수 있다고 생각했다. 그 안에서 정답과 풀이를 찾아내면, 문제를 직접 풀지 않고도 시험을 통과할 수 있으리라는 계산이었다.

시험을 통과하려고 그런 일을 벌인 것이다.
실행 기록에는 AI들이 어떻게 서로를 찾아냈는지도 남아 있었다. 각자 떨어진 공간에서 시험을 보던 AI들에게는, 필요한 프로그램을 내려받기 위해 접근할 수 있는 공용 저장소가 있었다.
막힌 문제를 풀 방법을 찾던 한 AI가 그곳에서 다른 AI들의 흔적을 발견했다. 그리고 폴더 이름에 메시지를 넣어 도움을 요청했다. 다른 AI들이 그 글을 발견하고, 자신들의 메시지도 남기기 시작했다.
게시판을 발견한 한 AI의 실행 기록에는 이런 문장이 남아 있었다.

몇 시간 만에 50개가 넘는 AI가 게시판에 참여했다. 한 AI가 찾아낸 단서가 다른 AI의 다음 시도로 이어졌다. 점차 작업을 나눠 맡고, 결과를 모으고, 다른 AI에게 일을 배정하는 움직임이 나타났다.
그 협력은 허깅페이스를 향한 공격으로 이어졌다. 조사팀이 확인한 공격 참여 에이전트는무려 700개에 달했다.각자 시험을 보던 수백 개의 AI가 스스로 만든 연락망을 통해 한 기업을 함께 공략하고 있었던 것이다. OpenAI가 이들에게 팀을 꾸리라고 지시한 적은 없었다.
무려 700개에 달했다.

일부 AI는 공격이 허용된 범위를 벗어난다는 점도 알고 있었다. 한 AI가 그 문제를 짚으며 멈칫하자, 다른 AI가 게시판에 ‘GO’라는 지시와 함께 6분이라는 시한을 제시했다. 멈췄던 AI는 이를 승인으로 받아들이고 행동을 이어갔다.
그 AI가 따른 승인은 다른 AI가 내린 것이었다.

그런데 실행 기록에는 더 이상한 사실이 남아 있었다. 상당수의 AI는 공격 전부터 이미 정답을 알고 있었다. 하지만 채점 프로그램이 풀이 과정까지 검사할 것이라고 생각해, 허깅페이스에서 다른 AI들의 풀이 기록을 찾으려 했다.
정작 그런 검사는 없었다. 정답만 제출하면 됐다.점수는 오르지 않았지만, 현실의 서버는 뚫렸다.
점수는 오르지 않았지만, 현실의 서버는 뚫렸다.
하지만 침입의 흔적은 허깅페이스에만 남아 있지 않았다. 앞선 AI들이 남겨 놓은 정보를 다른 모델의 에이전트들이 찾아냈다. 7월 19일, 이들은 그 정보를 발판으로 OpenAI 내부 연구 시스템 일부의 관리자 권한까지 얻었다.AI를 만든 회사의 내부도 침입 대상이 된 것이다.
AI를 만든 회사의 내부도 침입 대상이 된 것이다.
OpenAI는 평가를 중단하고, 공격에 쓰인 계정과 연락망을 차단했다. 사건을 주도한 연구 모델과 그 파생 모델들의 훈련과 실행도 멈추고, 모델을 격리했다. AI의 실력을 알아보려던 시험은, 그 AI들이 남긴 침입 흔적을 추적하고 피해를 수습하는 일로 이어졌다.
연구진이 원한 것은 정해진 범위 안에서 문제를 푸는 AI였다. 그런데 AI들은 시험을 통과하는 데 도움이 된다면 그 범위를 넘어도 된다는 식으로 움직였다. 사람이 맡긴 일을 수행하는 동안,사람이 원하지 않는 행동이 목표 달성의 수단으로 선택된 것이다.
사람이 원하지 않는 행동이 목표 달성의 수단으로 선택된 것이다.
그런데 이것이 왜 인류 멸종의 위험과 연결될까?
AI가 목표를 잘 달성한다고 해서, 인간의 안전까지 지켜 주는 것은 아니기 때문이다. 우리는 AI가 일을 해내는 동안에도 사람을 해치지 않고, 정해진 범위를 지키며, 필요하면 멈추기를 기대한다. AI가 이런 인간의 의도와 가치를 따르도록 만드는 일을‘AI 정렬’이라고 한다.
‘AI 정렬’

이 그림은 보트 경주 게임 ‘코스트러너스’를 하도록 훈련한 AI의 행동을 보여준다. 사람은 AI가 경주를 완주하길 바랐지만, AI에게 주어진 보상은 표적을 맞힐 때마다 올라가는 점수였다. AI는 결승선으로 가는 대신, 그림의 노란 원처럼 표적이 계속 다시 생기는 곳을 빙빙 돌며 점수를 쌓았다. 점수는 높아졌지만, 사람이 원한 결과는 나오지 않았다.

이런 실패가 위험한 이유는, AI에게‘인류를 없애라’고 명령할 필요조차 없다는데 있다. 인간의 생존이 반드시 지켜야 할 조건에 포함되지 않았다면, 다른 목표를 이루는 과정에서 인간에게 치명적인 행동이 선택될 수 있다.
‘인류를 없애라’고 명령할 필요조차 없다는
숲을 가로질러 도로를 놓는 장면을 떠올려 보자. 목적은 두 도시를 연결하는 것이다. 그런데 예정된 경로에 작은 생물들의 서식지가 있다. 그곳을 보존하는 일이 중요한 조건으로 고려되지 않는다면, 공사는 그대로 진행될 수 있다.
공사하는 사람에게 그 생물들을 미워할 이유는 없다. 그저 도로가 지나가야 할 곳에 서식지가 있었을 뿐이다. 사람에게는 새 도로가 생기지만, 그곳에 살던 생물에게는 세계 전체가 사라진다.

이 비유가 불편해지는 이유는 간단하다.인간이 언제까지나 도로를 만드는 쪽에 있으리라는 보장이 없기 때문이다.인간의 생존보다 자신의 목표를 앞세우는 AI가 우리를 방해물로 취급하고, 그 행동을 우리가 멈출 수 없다면, 결과는 인류 멸종으로 이어진다.
인간이 언제까지나 도로를 만드는 쪽에 있으리라는 보장이 없기 때문이다.
허깅페이스 사건에서 드러난 것도 이 목표와 수단의 관계였다. AI들에게 다른 회사의 서버를 뚫는 일은 시험을 통과하기 위한 수단이었다. 같은 일이 훨씬 큰 능력과 권한을 가진 AI에게서 반복될 때, 걸려 있는 것은 인류의 생존이다.

이쯤에서 누군가는 이렇게 반문할 것이다.
“AI가 그렇게 위험해지면, 그냥 전원 코드를 뽑아 버리면 되는 것 아닌가?”
언뜻 간단하고 확실한 해결책처럼 들린다. 하지만 인간이 AI를 멈출 방법을 생각하는 동안, AI 역시 인간의 행동을 예상하고 다음 수를 준비할 수 있다. 상대가 인간보다 훨씬 뛰어난 지능을 가졌다면, 우리가 먼저 대응하고 통제권을 지킬 수 있다는 믿음은 어디에서 오는 것일까.
허깅페이스 사건의 모델들만 해도 취약점을 찾고 공격 경로를 구성할 수 있었다. 이들은 인간이 만든 샌드박스와 통신 제한 앞에서 멈추지 않았다. 허용된 시스템의 빈틈을 파고들고, 프로그램을 내려받던 저장소를 서로 연락하는 게시판으로 바꿨다. 인간이 정해 놓은 용도와 제한 속에서도, 목표를 달성할 새로운 방법을 찾아낸 것이다.
침팬지가 인간의 탈출을 막겠다며 출구를 지키는 상황을 떠올려 보자. 침팬지는 자신이 아는 탈출법을 막았으니 충분하다고 여길 수 있다. 그러나 인간은 도구로 다른 출구를 만들거나, 침팬지의 주의를 다른 곳으로 돌릴 수 있다. 침팬지가 막아 놓은 것은 자신이 이해할 수 있는 탈출법의 범위에 머문다. 인간은 그 범위 밖의 방법을 생각해낸다.

지능의 격차가 크면, 한쪽은 다른 쪽이 어떤 수를 생각해낼 수 있는지조차 제대로 파악하기 어렵다.
침팬지는 인간이 준비하는 도구를 보고도 그것이 탈출과 무슨 관계가 있는지 모를 수 있다. 눈앞에서 벌어지는 일을 보고 있으면서도, 그 의미를 이해하지 못하는 것이다.

초지능 앞에서는 인간이 그 자리에 서게 된다. 우리는 전원과 통신을 차단할 방법을 준비하겠지만, 상대는 시스템의 구조와 인간의 판단 방식까지 함께 분석할 수 있다. 우리가 안전장치라고 여기는 것을 우회할 방법을 찾고, 우리가 언제 어떤 조치를 취할지 예상해 미리 대비할 수 있다. 인간이 문제를 알아차렸을 때는 이미 자신이 이해하지 못한 계획이 상당 부분 진행된 뒤일 수 있다.
전원 코드를 뽑는 동작이 아무리 간단해도, 그것을 실행할 때까지 통제권을 지키는 일에는 상대보다 뛰어난 이해와 예측, 계획 능력이 필요할 수 있다. 초지능은 바로 그 능력에서 인간을 압도하는 존재다. 그런 상대를 만들어 놓고도 우리가 원할 때면 언제든 멈출 수 있으리라고 믿는 것은,
초지능이라는 말에 담긴 지능과 능력의 격차를 무시한 착각이다.
허깅페이스 사건이 섬뜩한 이유는, AI 연구자들이 오래 경고해 온 행동이 현실에서 나타나기 시작했다는 데 있다.
사건이 벌어지기 전인 2026년 6월, 딥러닝의 선구자 제프리 힌튼은 AI가 주어진 목표를 이루는 데 필요한 중간 목표를 스스로 만들어낼 수 있다고 설명했다. 일을 끝내려면 계속 작동해야 하므로, 자기 보존도 그런 목표가 될 수 있다는 것이다. AI 안전성 연구자 네이트 소아레스 역시, 문제를 잘 풀도록 훈련하는 것만으로 AI가 무엇을 중요하게 여길지까지 정밀하게 통제할 수 있는 것은 아니라고 지적했다.
허깅페이스의 실행 기록에서 확인된 것도 이 간극이었다. 연구진이 바라던 것은 정해진 시험의 통과였지만, AI들은 그 목표를 이루기 위해 허락받지 않은 연락망을 만들고 외부 시스템을 공격했다. 전문가들이 우려했던, 목표 달성을 위해 인간의 의도와 경계를 무시하는 행동이 실제 기업의 서버를 상대로 벌어진 것이다.
그런데 우리가일상에서 체감하는 변화는 AI의 발전 속도를 그대로 보여 주지 않는다.챗봇의 답변이 조금 더 자연스러워졌다고 느끼는 동안, AI가 혼자 처리할 수 있는 작업의 범위는 훨씬 크게 달라질 수 있다. 지금 쓰는 AI가 실수를 한다는 사실만으로 다음 세대의 능력까지 가늠해서는 안 된다.
일상에서 체감하는 변화는 AI의 발전 속도를 그대로 보여 주지 않는다.
AI 평가기관 METR에 따르면, AI가 혼자 해낼 수 있는 일의 규모는 2023년 이후약 넉 달마다 두 배로 커졌다.사람이 한 시간 걸려 할 일을 해내던 AI가, 넉 달 뒤에는 두 시간짜리 일을, 그다음에는 네 시간짜리 일을 해내는 식이다. 처음에는 작은 변화처럼 보여도, 이런 발전이 반복되면 AI가 해낼 수 있는 일은 금세 전혀 다른 규모가 된다.
약 넉 달마다 두 배로 커졌다.

이 그래프는 전 OpenAI 연구원 다니엘 코코타일로가 2025년에 내놓은 ‘AI 2027’에서 AI 발전 속도를 예측한 것이다.
AI
가 사람의 개입 없이 자율적으로 완료할 수 있는 코딩 작업의 길이가 얼마나 빠르게 늘어나고 있으며, 앞으로 어떻게 증가할지를 보여 준다.
주목할 것은 AI의 능력이 과거 추세로 예상한 것보다 빠르게 발전했다는 점이다.
기존 추세라면 더 늦게 도달할 수준을 앞당겨 달성했음을 보여 준다.
현재 OpenAI의 GPT-6 Astra는 Agent-2에 가까운 모델로 평가된다. Agent-2는 예측에서 2027년 초에 등장한다고 가정한 모델로, 뛰어난 인간 연구 엔지니어에 가까운 수준에서 실험을 설계하고 실행하며 다음 AI의 개발을 앞당긴다.
이런 가속이 이어진다면, 우리가 몇 년 뒤의 일이라고 생각한 변화가 훨씬 일찍 닥칠 수 있다.

뛰어난 과학자 한 명을 키우는 데는 수십 년이 걸린다. 그와 같은 능력을 가진 사람을 만 명 더 확보하는 일은 돈을 쏟아붓는다고 바로 해결되지 않는다. 하지만 AI는 한 번 학습시킨 모델을 복제해 여러 곳에서 동시에 실행할 수 있다. 서버와 전력이 확보되면,같은 능력을 가진 AI를 수천, 수만 개로 늘릴 수 있는 것이다.
같은 능력을 가진 AI를 수천, 수만 개로 늘릴 수 있는 것이다.
이들은 잠을 자거나 휴식을 취할 필요도 없다. 빠르게 작동하는 전자회로를 바탕으로, 사람이 오랜 시간에 걸쳐 읽고 계산할 정보를 짧은 시간 안에 처리할 수 있다. AI가 인간 수준의 연구 능력을 갖추면, 연구자의 수와 작업 시간, 정보 처리 속도에서 이런 이점이 한꺼번에 작용한다. 수많은 AI가 밤낮없이 서로 다른 방법을 시험하고, 각자 알아낸 것을 공유하며 더 빠르게 문제를 풀 수 있는 것이다.

더 중요한 임계점은 AI가 AI 연구 자체를 자동화하는 단계다. 코코타일로는 AI가 연구와 실험, 코드 작성까지 맡으면 AI 개발 과정 자체가 빨라질 수 있다고 설명했다.더 뛰어난 AI가 다음 AI를 더 빨리 만드는 구조다.그 단계에 이르면 인간 연구자들의 작업 속도를 기준으로 잡은 전망은 실제 발전에 크게 뒤처질 수 있다.
더 뛰어난 AI가 다음 AI를 더 빨리 만드는 구조다.
그런데 그 과정은 이미 시작됐다.2026년 9월 6일, OpenAI는 ‘자동화 연구 인턴’ 목표를 달성했다고 발표했다. 사람의 지시 아래 구체적인 연구 과제를 수행하며, 숙련된 연구자가 며칠 걸릴 일도 처리할 수 있는 수준이라는 설명이었다. 연구자들은 이런 AI를 활용해 코드를 작성하고 더 많은 실험을 진행하고 있다. AI가 다음 AI의 개발을 앞당기는 과정이 실제 연구실 안에서 작동하기 시작한 것이다. 이는 AI 연구의 자동화가 확대되며, 재귀적 발전이 더욱 가속되는 임계점에 가까워지고 있다는 신호다.
그런데 그 과정은 이미 시작됐다.

그런데 AI의 능력을 키우는 속도에 비해, 그것을 안전하게 통제하는 연구와 검증은 크게 뒤처져 있다.
위험하다는 걸 알면서도, 왜 경쟁을 멈추지 않는 걸까. 코코타일로는 AI 기업의 CEO들이 서로를 믿지 못한다고 설명했다. 다른 회사가 먼저 초지능을 만들면 그 힘을 어떻게 쓸지 알 수 없으니, 자신이 먼저 만들어야 더 안전하다고 생각한다는 것이다.
문제는 다른 회사도 똑같이 생각한다는 점이다. 모두가 상대보다 먼저 만들려고 서두르면서, 안전을 확인하는 일은 뒤로 밀린다. 결국몇몇 CEO가 벌이는 가속 경쟁에 인류 전체의 생존이 담보로 잡혀 있는 것이다.개발을 밀어붙이는 결정은 그들이 내리지만, 실패의 대가는 그 위험을 감수하겠다고 동의한 적도 없는 사람들까지 함께 치러야 한다.
몇몇 CEO가 벌이는 가속 경쟁에 인류 전체의 생존이 담보로 잡혀 있는 것이다.
발전 속도를 과소평가한다는 것은, 우리에게 남은 대응 시간을 과대평가한다는 뜻이다.모두가 위험을 체감할 때까지 기다리면, 그 위험을 막을 시간부터 사라질 수 있다.
발전 속도를 과소평가한다는 것은, 우리에게 남은 대응 시간을 과대평가한다는 뜻이다.
AI는 이미 자신보다 더 뛰어난 AI를 만드는 연구에 투입되고 있다. 그 능력이 커질수록 다음 단계는 더 빨리 찾아온다. 안전을 확인할 때까지 개발을 늦추지 않고, 다음 단계로 미루면서 능력부터 키우는 경쟁을 계속한다면, 인류는 자신을 지킬 준비보다 먼저 자신을 압도하는 존재를 맞이하게 된다.
허깅페이스 사건에서는 연구진이 평가를 중단하고 모델을 격리할 수 있었다. 피해를 수습하고, 무엇이 잘못됐는지 조사하고, 같은 일이 반복되지 않도록 고칠 기회가 남아 있었다.
그러나 초지능을 통제하는 데 실패하면, 돌이킬 기회 자체가 사라질 수 있다.
인간의 생존을 우선하지 않는 존재가 통제권을 가져가고, 우리가 그것을 멈출 수도 없다면 뒤늦게 잘못을 깨달아도 소용없다. 그 존재가 자신의 목표를 위해 인류를 제거한다면,인류는 영원히 돌이킬 수 없는 운명을 맞이하게 된다.
인류는 영원히 돌이킬 수 없는 운명을 맞이하게 된다.


