초지능이 아니라 분류기였다 — Anthropic 안전벽은 어떻게 공개 인터넷 트릭에 무너졌나

12만 자. 24시간. 분류기 한 겹. 2026년 6월 12일, 미국 상무부가 Anthropic의 최강 모델을 전 세계 공개 인터넷에서 내리도록 명령한 이 수출금지의 배후 실패는 대략 이 형태였음. 수출금지를 두고 워싱턴이 내건 명분은 문명 규모였음. 너무 위험해 돌아가게 둘 수 없는 프런티어 시스템. 그런데 경로를 따라가 보면, 실제 메커니즘은 훨씬 작고 훨씬 불편한 것이었음.

같은 셧다운을 다룬 이전 글에서 TheByteDive는 이 금지가 소버린 AI의 필요성을 입증했다고 분석했음. 어떤 기업도 정부 전화 한 통에 프런티어 모델 접근을 잃어선 안 된다는 논점이었고, 그 독법은 지금도 유효함. 그런데 그 글은 틀린 질문에 답한 것임. 이 수출금지가 왜 중요한지는 설명했지만, 무엇이 그것을 촉발했는지는 설명하지 못했음.

촉발한 것은 거창한 초지능 탈출이 아니었음. 마케팅이 암시한 것보다 훨씬 빨리 벗겨진 가드레일이었음. 이 글은 그 수출금지의 내막임. 누가 불을 댕겼고, 아키텍처는 실제로 어떻게 생겼으며, 가장 많이 반복된 두 가지 주장이 왜 틀렸는지임.


Key Takeaways

  • Fable 5와 Mythos 5는 동일 기저 모델 + 안전 분류기 한 겹으로만 분리 — 무너진 건 모델 능력이 아니라 얇은 통제면
  • 출시 ~24시간 만에 jailbreak 주장이 공개, ‘진짜 jailbreak인가’조차 지명된 전문가들 사이에서 분쟁
  • ‘연막’ 독법은 이해상충이 공개된 지명 비판자들의 해석 — 검증 레이어가 말하는 건 “통제면이 마케팅보다 얕았다”뿐

도화선은 Pliny와 Amazon — 알려진 그 사람들이 아니었음

초기 보도 대부분이 이 수출금지의 두 가지 토대 사실을 틀렸음. 두 오류 모두 같은 방향, 즉 그럴듯하다가 무서워지는 방향을 가리킴. 그래서 먼저 바로잡고 시작하는 게 맞음.

첫 번째 오류는 연구자에 관한 것임. 도화선이 된 jailbreak를 주장한 건 Pliny the Liberator(@elder_plinius), L1B3RT4S jailbreak 아카이브를 운영하는 익명 인물임. Pliny는 독립·익명 jailbreaker임. 여러 기사가 주장한 것처럼 영국 AI안전연구소(UK AISI) 소속 연구자가 아님. UK AISI는 이 사건에 등장하긴 하지만 정반대 역할이었음. Anthropic의 공식 출시 전 레드팀 중 하나였음. 외부 공격자와 내부 감사자를 뒤섞으면 신뢰의 사슬 전체가 뒤집힘.

두 번째 오류는 정부로 향한 경로임. 백악관에 닿은 경고는 한 op-ed의 주장처럼 재무부나 Scott Bessent를 거치지 않았음. Amazon을 통해 왔음. Amazon 연구진이 자체 방어 테스트 중 약점을 발견했고, Andy Jassy CEO가 그 우려를 행정부에 전달했음 (Fortune).

36시간의 시계

실제로 일어난 순서는 이러함. Fable 5는 6월 9일 출시됐음. 약 24시간 안에 Pliny가 jailbreak와 약 12만 자 시스템 프롬프트 유출을 공개 주장했음. Amazon이 방어 테스트 결과를 행정부에 알렸음. 6월 12일 오후 5시 21분(ET) 상무부가 수출 디렉티브를 냈고, Anthropic의 Mythos급 모델이 전 세계에서 꺼졌음. Anthropic은 약 90분 통보만 받았다고 말함 (Fortune, Semafor).

FIG. 01 — 벽은 어떻게 무너졌나

자기개선 페이퍼에서 전 세계 셧다운까지 8일
01

~6월 4일

RSI 리포트

모델이 자기 코드의 80%+를 작성한다는 재귀적 자기개선 페이퍼, 프런티어 개발의 글로벌 일시중단 촉구.

02

6월 9일

Fable 5 출시

제한된 Mythos 5와 동일 기저 모델 위에 가드레일을 씌운 소비자용 모델 출시.

03

~6월 10일

Pliny jailbreak 주장

독립 jailbreaker Pliny the Liberator가 Fable 5 jailbreak와 약 12만 자 시스템 프롬프트 유출을 공개 주장.

04

며칠 뒤

Amazon 경고

Amazon 연구진이 방어 테스트 중 약점 발견, Andy Jassy CEO가 우려를 행정부에 전달.

05

6월 12일 17:21 ET

수출 디렉티브

상무부가 수출 디렉티브를 발령, Anthropic은 약 90분 통보만 받았다고 주장.

06

6월 12일

전 세계 셧다운

Mythos급 모델이 전 세계에서 꺼짐.

07

이후

소송·분쟁

Anthropic이 jailbreak 효능을 반박, 통제를 둘러싼 공개 분쟁 시작.

SOURCE: Fortune, Semafor, The Register, CybersecurityNews

단계날짜·시각내용
RSI 리포트~6월 4일모델이 자기 코드의 80%+를 작성한다는 재귀적 자기개선 페이퍼, 글로벌 일시중단 촉구
Fable 5 출시6월 9일가드레일 씌운 소비자용 모델 출시
jailbreak 주장~6월 10일Pliny가 Fable 5 jailbreak + 약 12만 자 시스템 프롬프트 유출 공개 주장
Amazon 경고며칠 뒤Amazon 연구진이 약점 발견, Andy Jassy가 행정부에 경고
수출 디렉티브6월 12일 17:21 ET상무부 디렉티브, Anthropic에 약 90분 통보(Anthropic 주장)
전 세계 셧다운6월 12일Mythos급 모델이 전 세계에서 꺼짐
소송·분쟁이후Anthropic이 jailbreak 효능 반박, 통제 둘러싼 공개 분쟁 시작

아키텍처 이음새 — 진짜 이야기가 사는 곳

정치와 헤드라인급 공포를 걷어내면, 이 수출금지는 거의 아무도 앞세우지 않은 한 가지 아키텍처 사실로 압축됨. Fable 5와 Mythos 5는 동일 기저 모델이었고, 안전 분류기 한 겹으로만 분리돼 있었음 (CybersecurityNews 명시, Fortune·Semafor 보강).

쉽게 말하면 이렇게 됨. 비싼 금고 하나에 문이 둘 달린 건물을 떠올리면 됨. Mythos는 제한된 문임. Fable은 같은 금고에 공개용 두 번째 입구를 두고 경비를 세운 것임. 그 경비, 즉 안전 분류기가 통제면이었음. 더 약한 벽 뒤에 더 약한 다른 모델이 있었던 게 아님. 같은 모델 뒤에 더 얇은 벽이 있었던 것임.

능력은 애초에 쟁점이 아니었음

이 구분은 처음 보이는 것보다 훨씬 중요함. 대중 서사는 위험할 만큼 강한 시스템이 봉쇄를 뚫고 나왔다고 암시했음. 그런데 아키텍처는 더 좁고 정확한 말을 함. 모델의 능력은 결코 뚫리지 않았음. 뚫린 것은, 혹은 누구에게 묻느냐에 따라 단지 시연된 것은, 그 위에 얹힌 분류기 레이어였음.

상업 논리도 여기서 드러남. Fable 5가 존재한 이유는, 앤트로픽이 더 이상 최강 모델을 공짜로 줄 수 없게 된 뒤 같은 비싼 토대 위에 가드레일을 씌운 소비자 등급이 필요했기 때문임. 찢어진 이음새는 비즈니스 모델이 만든 이음새인 것임.

jailbreak인가 아닌가 — 사건의 본질조차 다툼

신중한 독자라면 여기서 속도를 늦춰야 함. 가장 가까이 있는 사람들조차 ‘jailbreak가 일어나긴 했는가’에 합의하지 못함. 이건 디테일이 아님. 이 수출금지의 인식론 전체임.

red team security researcher analyzing code on multiple...
red team security researcher analyzing code on multiple screens dark room (Photo: Pexels) by cottonbro studio

Pliny는, 그리고 별개로 백악관 AI 차르 David Sacks는 이를 jailbreak라 불렀음. Anthropic은 시연된 것의 효능을 반박함. 발견이 “narrow”하고 비보편적이라는 점만 인정하고, 같은 기법이 다른 프런티어 모델(GPT-5.5를 언급)에도 나타난다고 지적하며, 실제 피해는 보고되지 않았다고 말함. 회사는 UK AISI와 미국 정부 파트너를 포함한 수천 시간의 레드팀도 근거로 듦.

“Defense Oriented Prompting”이지 jailbreak가 아니라는 반론

가장 날카로운 반론은 Luta Security CEO이자 취약점 협력공개의 베테랑인 Katie Moussouris에게서 나옴. Moussouris는 이 사건이 jailbreak가 아니라 “Defense Oriented Prompting(DOP)”이었다고 주장하고, 정부 대응을 “완전한 과잉대응”이라 부름 (The Register, Luta Security). 그의 설명에는 시사적인 메커니즘이 있음. 연구진이 “review”를 거부당하자 요청을 “fix this code”로 바꿔 게이트를 통과했다는 것임. 이 독법이 맞다면 무너진 건 벽이라기보다 지나치게 곧이곧대로인 문지기였음.

이 3자 불일치가 진짜 신호임. 그대로 펼쳐 두는 게 맞음.

프레이밍누가주장
jailbreak였다Pliny the Liberator; David Sacks (백악관 AI 차르)가드레일이 뚫렸고 모델이 사실상 노출됨
jailbreak가 아니라 “DOP”였다Katie Moussouris (Luta Security CEO)연구진은 정당한 프롬프팅을 썼을 뿐, 대응은 완전한 과잉대응
narrow하고 비보편적이었다Anthropic발견은 제한적이고 다른 모델에도 존재하며 실제 피해 보고 없음

세 주장 밑에 단단하게 깔리는 사실이 있음. 분류기 한 겹이 통제면이었고, 그것이 공개 인터넷에서 가져온 기법으로 우회됐다는 것임. 유니코드·호모글리프·키릴 치환, 롱컨텍스트 적재, 픽션 프레이밍, 분해-재조합, 멀티에이전트 “pack hunt”였음. 이 사실은 한 가지 공정한 독법을 뒷받침함. 통제면이 마케팅보다 얕았다는 것임. 의도에 관한 어떤 주장도 이 사실만으로는 뒷받침되지 않음.

FIG. 02 — 주장 vs 드러난 것

안전 이야기가 말한 것과 사건이 보여준 것
안전 태세
주장
드러난 것
레드팀
수천 시간, 보편적 jailbreak 없음
출시 ~24시간 만에 공개 인터넷 기법으로 가드레일 우회
통제 깊이
모델 수준의 깊은 속성으로서의 헌법적 AI 안전
실제 통제면은 분류기 한 겹이었음
등급 분리
프런티어 모델과 의미 있게 분리된 소비자 등급
Fable과 Mythos는 얇은 벽 한 겹 뒤의 동일 기저 모델

SOURCE: CybersecurityNews, Fortune, Anthropic

주장된 안전 태세사건이 드러낸 것
수천 시간 레드팀, 보편적 jailbreak 없음출시 ~24시간 만에 공개 인터넷 기법으로 가드레일 우회
모델 수준의 깊은 속성으로서의 헌법적 AI 안전실제 통제면은 분류기 한 겹이었음
프런티어 모델과 의미 있게 분리된 소비자 등급Fable과 Mythos는 얇은 벽 한 겹 뒤의 동일 기저 모델

정치적 내막 (조심해서 읽을 것)

여기는 귀속 규율이 가장 중요한 섹션임. 거의 모든 내용이 다툼 중이기 때문임.

David Sacks는 Anthropic이, 구체적으로 Dario Amodei CEO가 수출 통제가 내려오기 전 Fable 5 문제를 수정하길 거부했다고 주장했음 (Tom’s Hardware). 이건 Sacks의 주장이고, Anthropic은 이를 반박하면서 디렉티브 전 약 90분 통보만 받았다는 주장을 함께 내놓음. 둘 다 기록에 있음. 어느 쪽도 결론 난 게 아님.

국가안보 갈래도 있음. 여기 있는 무엇보다 가장 강한 헤지가 필요한 대목임. Semafor는 백악관 조치가 Mythos 모델에 대한 중국 측 접근 우려와 연관됐다고 보도했음. 그런데 Semafor 스스로 어느 조직이 실제로 모델에 접근했는지 불분명하다고 적음. 의혹이지 확정 사실이 아님. 그 이상으로 읽어선 안 됨.

또 하나 떠돈 주장이 있음. jailbreak가 “Birch reduction” 합성 경로를 산출했다는 것임. 이건 claimed output으로 다뤄야 함. Anthropic이 분쟁 중이고 독립 검증도 안 됐음. 모델이 무엇을 할 수 있거나 했는지에 관한 사실이 아님.

연막 가설 — 평결이 아니라 지명 비판자의 주장

일부에서 더 큰 목소리의 독법이 자리 잡았음. 안전 경보가 사실상 연막이었다는 것임. 난처한 통제 실패나 전략적 순간을 문명 규모의 안전 서사로 바꾼 장치였다는 주장임. 이 주장의 지위를 정확히 해야 함.

이건 지명 비판자들이 제기한 해석임. 그리고 각자 독자가 알아야 할 이해상충을 안고 있음.

  • David Sacks(백악관 AI 차르)는 Anthropic과 적극적 정치 갈등 중임. 회사 동기에 대한 그의 독법은 위치상 적대적임.
  • Ben Thompson(Stratechery)과 Gary Marcus는 Anthropic의 안전 우선 포지셔닝에 오래 회의적인 인물임. 그들의 선입견은 회사에 불리한 쪽으로 기울어 있음.

그래서 정직한 표현은 이러함. 비판자들은 안전 프레이밍이 다른 목적에 복무했다고 주장함. 그 밑의 검증 레이어는 더 좁은 주장만 뒷받침함. 통제면이 공개 태세가 암시한 것보다 얕았다는 것임. “얕은 통제”에서 “의도적 은폐”로 가는 도약은 이 비판자들이 하는 추론임. 증거 자체가 입증하는 게 아님.

RSI 타이밍 비판 — 사실과 독법을 분리할 것

사실에서 동기로 미끄러지기가 얼마나 쉬운지 가장 깔끔하게 보여주는 게 재귀적 자기개선(RSI) 타임라인임.

사실

Anthropic은 불과 며칠 전 상장을 신청한 상태였음. S-1이 6월 1일경 접수됐음. 6월 4~5일경 회사는 모델이 자기 코드의 80%+를 작성하고 있고, 후계 시스템이 2년 내 등장할 수 있으며, 정책 책임자 Jack Clark이 2028년 말까지 의미 있는 RSI 확률을 약 60%로 봤다는 페이퍼를 냈음. 그리고 프런티어 개발의 글로벌 일시중단을 촉구했음. 별개로 완화된 안전 서약이 2026년 2월 보도됐음. 이 날짜들은 각각 사실임.

독법

냉소적 해석은, 상장 단계 회사가 S-1 접수 며칠 뒤 “일시중단”을 외치는 건 안전을 실천하는 게 아니라 연기하는 것이라는 독법임. 그건 딱 그것, 해석임. 그리고 앞 섹션의 같은 지명 비판자들에게 속함. 타임라인은 확립됐음. 동기는 다툼 중임. 둘을 뭉개는 것이 이 수출금지 보도에서 가장 흔한 오류이고, 이 분석이 피하려고 설계된 바로 그 지점임.

FIG. 03 — 사실 vs 해석

확립된 것과 비판자가 그로부터 주장하는 것
항목
검증된 사실
비판자의 해석
타이밍
S-1 ~6월 1일 접수, 일시중단 페이퍼 ~6월 4~5일
Sacks·Thompson·Marcus는 일시중단 외침이 IPO에 맞춘 전략적 연출이라 주장
아키텍처
Fable과 Mythos가 동일 기저 모델 + 분류기 한 겹 공유
얇은 통제면을 안전 태세가 과장됐다는 증거로 읽음
인정
Anthropic이 발견을 "narrow"라 인정
그 인정이 공개적 문명 규모 프레이밍을 무너뜨린다고 주장
중국 갈래
Semafor: 어느 조직이 접근했는지 불분명
일부는 중국 접근을 진짜 동인으로 보지만 의혹으로 남음

SOURCE: Fortune, Semafor, Tom's Hardware, Anthropic

검증된 사실비판자가 해석하는 것
S-1 ~6월 1일 접수, 일시중단 페이퍼 ~6월 4~5일Sacks·Thompson·Marcus는 “일시중단” 외침이 IPO에 맞춘 전략적 연출이라 주장
Fable과 Mythos가 동일 기저 모델 + 분류기 한 겹 공유비판자는 얇은 통제면을 안전 태세가 과장됐다는 증거로 읽음
Anthropic이 발견을 “narrow”라 인정비판자는 그 인정이 공개적으로 쓴 문명 규모 프레이밍을 무너뜨린다고 주장
Semafor “어느 조직이 접근했는지 불분명”일부는 중국 접근 우려를 진짜 동인으로 보지만, 의혹으로 남아 있음

그래서 무엇인가 — 이 사건 이후 AI 안전 주장을 읽는 법

이 수출금지의 지속되는 가치는 누가 누구에게 전화했는지의 가십이 아님. AI 안전 주장을 읽는 재사용 가능한 교훈임. 직장인이 쓰는 벤더들의 주장까지 포함해서임.

첫째, 모델과 벽을 분리해야 함. “우리 모델은 안전하다”와 “우리 가드레일이 버텼다”는 다른 문장임. 이 사건은 회사 마케팅이 둘을 흐릴 때 무슨 일이 벌어지는지 보여줌. 능력이 실패 지점이 아니었음. 그 위의 얇은 분류기가 실패 지점이었음.

둘째, 통제의 깊이를 가정이 아니라 질문으로 다뤄야 함. “헌법적 AI”와 “수천 시간 레드팀”은 진짜 엔지니어링임. 그런데 운영 통제면이 공개 인터넷 기법에 하루 만에 압박당하는 분류기 한 겹이라면, 직장인이 들은 안전 이야기는 런타임 현실이 아니라 의도를 묘사한 것일 수 있음.

셋째, 소버린 AI 함의는 유효하되 뒤집힘. 이전의 주권 논점은 정부 하나가 끌 수 있는 모델에 의존하지 말라에 기댔음. 이 사건은 두 번째 축을 더함. 독립적으로 점검할 수 없는 안전 태세에 의존하지 말라임. 기업 입장에서 시사점은 화려하지 않고 조달급임. 통제면이 실제로 무엇인지, 누가 레드팀했는지, 그들의 사고 언어에서 “narrow”가 무슨 뜻인지 벤더에게 물어야 함. 기업 AI의 다음 국면을 가져갈 회사는 그 질문에서 안전 주장이 살아남는 회사일 것임.

벽은 빨리 무너졌음. 더 쓸모 있는 사실은, 그 벽이 둘러싼 이야기만큼 두꺼웠던 적이 애초에 없다는 것임.


자주 묻는 질문 (FAQ)

Q. 수출금지는 실제로 무엇이 원인이었나요?

A. 직접적 도화선은 6월 9일 출시 약 24시간 만에 공개 주장된 Fable 5 jailbreak였고, Amazon(Andy Jassy CEO)을 통해 미국 행정부에 전달되며 6월 12일 상무부 수출 디렉티브로 이어졌습니다. 더 깊은 원인은 아키텍처입니다. Fable과 Mythos가 안전 분류기 한 겹 뒤의 동일 기저 모델이었기 때문입니다.

Q. 정말 jailbreak가 맞나요?

A. 다툼 중입니다. Pliny the Liberator와 백악관 AI 차르 David Sacks는 jailbreak라 불렀고, 보안 베테랑 Katie Moussouris는 “Defense Oriented Prompting”이며 jailbreak가 전혀 아니라고 주장합니다. Anthropic은 발견이 “narrow”하고 비보편적이며 다른 모델에도 존재하고 실제 피해는 보고되지 않았다는 점만 인정합니다.

Q. Pliny the Liberator는 누구이고, 영국 AI안전연구소가 관여했나요?

A. Pliny the Liberator는 UK AISI 연구자가 아니라 독립·익명 jailbreaker입니다. 이를 혼동하는 경우가 흔합니다. UK AISI는 정반대 역할로, Anthropic의 공식 출시 전 레드팀 중 하나였습니다.

Q. ‘연막’ 이론은 사실인가요?

A. 아닙니다. 안전 프레이밍이 연막이었다는 주장은 지명 비판자들, 즉 David Sacks·Ben Thompson·Gary Marcus가 제기한 해석이며, 각자 관련 이해상충을 안고 있습니다. 검증 레이어가 뒷받침하는 것은 통제면이 공개 태세가 암시한 것보다 얕았다는 더 좁은 독법뿐입니다.


참고 소스

  1. Fable / Mythos 접근 (Anthropic, primary)
  2. Anthropic, Fable 5 jailbreak 반박 — SecurityWeek
  3. Claude Fable 5 jailbroken — CybersecurityNews
  4. Amazon 경고가 백악관의 Mythos 셧다운으로 — Fortune
  5. 백악관 조치, Mythos 중국 접근 우려와 연관 — Semafor
  6. Fable / Mythos 수출 제한과 jailbreak 방어 프롬프팅 — Fortune
  7. “fix this code” 프롬프트였지 jailbreak 아니라는 연구자 — The Register
  8. Anthropic Fable 5 jailbreak와 미국 정부 — Cybernews
  9. 재귀적 자기개선 우려로 AI 일시중단 촉구 — Fortune
  10. 글로벌 AI 개발 일시중단 촉구 — SiliconANGLE
  11. Fable 5 수출 통제가 미국 사이버 방어를 해친다 — Luta Security (Moussouris)
  12. Sacks “Anthropic이 Fable 5 jailbreak 수정 거부” — Tom’s Hardware
cracked concrete wall breached barrier security breach...
cracked concrete wall breached barrier security breach dark dramatic lighting (Photo: Pexels) by cottonbro studio

이 글이 도움이 되셨나요?

☕ Buy me a coffee