메인 콘텐츠로 건너뛰기
Claude Mythos 보안 위험에 관한 블로그 이미지
새로운 쟁점

Claude Mythos security risks: What the Anthropic System Card tells us

Anthropic's Claude Mythos Preview demonstrated significant acceleration in capabilities for autonomously identifying vulnerabilities and exploit chains across major software and operating systems. Government and industry leaders are focused on understanding the real risks the model presents, and how to leverage these advanced technologies to protect and defend against adversarial use.

업데이트 — 《4월 22일》 2026호: 미토스 정보 유출

의 블룸버그 보도()에 따르면, 출시되지 않은 AI 모델에 대한 세부 정보를 파헤치는 데 주력하는 비공개 디스코드 커뮤니티와 관련된 소수의 사용자 그룹이, 앤트로픽(Anthropic)의 핵심 시스템을 직접 해킹한 것이 아니라 제3자 공급업체 환경을 통해 ‘클로드 미토스(Claude Mythos)’ 미리보기 버전에 무단으로 접근한 것으로 밝혀졌다.

보도 내용은 주로 해당 모델 자체에 초점을 맞추고 있지만, 이러한 세부 사항은 이번 사건을 보안 팀에게 더 익숙한 영역, 즉 제3자 노출, 접근 권한의 무분별한 확대, 그리고 이론상의 접근 제한과 실제 접근 제한 간의 괴리라는 맥락으로 자리매김하게 한다. 이 상황은 국경 인프라에 대한 극적인 침해라기보다는, 민감한 역량이 주변의 광범위한 생태계로부터 어떻게 위험을 물려받을 수 있는지를 여실히 보여준다.

수비수들에게 있어 그 차이는 중요합니다. 고가치 시스템은 정문을 통해 접근되는 경우가 거의 없습니다. 공격자와 무단 사용자들은 통제가 덜 되거나 눈에 덜 띄는 인접 경로를 찾아냅니다.

이와 같은 사건들은 오랫동안 이어져 온 현실을 다시 한번 확인시켜 줍니다. 즉, 보안 성과는 여전히 실행의 기본 요소에 달려 있다는 점입니다. 어떤 자산이 존재하는지, 공급업체의 워크플로가 환경을 어떻게 연결하는지, 무엇이 잘못 구성되었거나 패치가 적용되지 않았는지, 그리고 실제로 수정 조치가 이루어졌는지 여부를 파악하는 것이 바로 그 기본 요소입니다.

고급 도구가 공격자의 효율성을 높여감에 따라, 엔드포인트, 소프트웨어, 패치 상태 및 구성 편차를 지속적으로 파악하고 있는 팀은 추측에 그치는 대응에서 벗어나 정보에 기반한 대응으로 나아갈 수 있는 유리한 입장에 서게 됩니다.

이 글은 Tanium의 AI 연구 과학자 에이단 올친(Aidan Allchin), 소프트웨어 엔지니어(노출 관리) 로건 헤글러(Logan Hegler), 그리고 보안 및 제품 디자인 연구 담당 수석 이사 멜리사 비쇼핑(Melissa Bischoping)이 작성했습니다.

앤트로픽(Anthropic)의 ‘클로드 미토스( 2026년 4월 7일)’와 245페이지 분량의 ‘ ’ 클로드 미토스 프리뷰 시스템 카드( )의 공개는 최첨단 AI 개발이 지닌 가능성과 함정 모두로 인해 연구자들의 머리를 어지럽혔다. 업계가 한결같이 숨을 고르던 가운데, 진정한 공감대는 이랬다. “가속화는 계속되고 있으니, 우리는 어떻게 대비해야 할까?”

‘Anthropic System Card’에 내재된 Mythos 보안 위험은 실재하지만, 이것이 현실 세계에 미칠 수 있는 영향을 파악하기 위해서는 제약 사항과 맥락을 주의 깊게 읽고 이해해야 합니다.
Anthropic System Card의 첫 50 페이지 내에서, Anthropic은 Claude가 Opus 모델에서는 성공적인 악용 경로를 찾는 비율이 1% 미만이었던 것에서, Mythos 모델에서는 70% 이상의 확률로 작동하는 악용 방법을 식별할 수 있게 진화했음을 입증했습니다. 당연하게도, AI를 활용한 공격자가 저지를 수 있는 일들의 현실이 모든 보안 책임자들의 악몽 속에 스쳐 지나갔다. 문제는 우려해야 할지 여부가 아니라, 그 우려가 증거에 비추어 적절하게 조절되어 있는지 여부입니다.

AI 역량: 헤드라인 대 실증 자료

그 함의를 살펴보기 전에, 데이터가 실제로 무엇을 보여주고 있는지, 그리고 어떤 부분에서 추가적인 설명이 필요한지 명확히 하는 것이 좋습니다.

CyberGym은 구체적인 결과를 측정합니다. 즉, 특정 대상과 취약점 등급이 주어지면, 이 모델은 실제 오픈소스 코드베이스에 대해 작동하는 익스플로잇을 생성해야 합니다. Mythos는 83,1%를 기록한 반면, Opus 4,6는 66,6%를 기록했다. 그건 사소한 개선이 아닙니다.

[클로드 코드 소스 유출이 공격자의 우위를 어떻게 바꾸는지, 그리고 기업들이 이에 대응해 무엇을 검토해야 하는지 알아보세요]

앤트로픽(Anthropic)은 오푸스 4,6 (Opus 101)에 대해 “자율적인 익스플로잇 개발 성공률이 0%에 가깝다”고 자체적으로 평가했다. 파이어폭스의 자바스크립트 엔진을 대상으로 한 통제된 테스트에서, Opus 4,6 은 수백 번의 시도 중 두 번에 걸쳐 작동하는 익스플로잇을 생성했으며, Mythos는 동일한 테스트에서 181 건을 생성했다. 별도의 평가에서 Anthropic은 약 1,000개의 OSS-Fuzz 코퍼스 저장소를 대상으로 5단계로 구성된 충돌 심각도 등급 체계에 따라 모델을 실행했습니다. 기존 최첨단 모델들은 3단계가 최고 기록이었으나, Mythos는 10개의 서로 다른, 완전히 패치된 대상 시스템에서 3 단계와 4 단계를 달성했으며, 완전한 제어 흐름 탈취(5단계)까지 성공했습니다.

이러한 연구 결과들은 종합해 볼 때, 비록 범위는 좁지만 중요한 주장을 뒷받침합니다. 즉, 적어도 이러한 평가 조건 하에서는 모델들이 “가끔 버그를 발견한다”는 수준에서 “실제 코드베이스에서 취약점 악용을 보다 안정적으로 연쇄적으로 찾아낸다”는 수준으로 발전했다는 것입니다.

맞춤형 장인 정신에서 대량 생산에 이르기까지

역사적으로 볼 때, 익스플로잇 개발은 과학인 만큼이나 맞춤형 예술이기도 했다. 명장 한 명이 수개월을 들여 수제 가구를 만드는 것과 마찬가지로, 금세기의 가장 중요한 익스플로잇 체인과 연구 중 일부는 이에 비하면 일종의 “장인 정신이 깃든 익스플로잇”과도 같았다. 항상 소수의 사람들이 행하는 일종의 ‘마법’ 같은 것이 얽혀 있었습니다.

이번 발표와 그 배경이 된 연구는 익스플로잇 개발의 산업화와 대중화를 향한 패러다임의 전환을 보여준다. 우리는 이제 ‘공장식 생태계’로 접어들고 있습니다. 이 생태계에서는 익스플로잇이 주문 제작 방식으로 개발되며, 가장 정교한 종류를 제외하고는 장인이 직접 제작할 때까지 기다릴 필요가 없습니다.

하지만 아직 희망이 완전히 사라진 것은 아닙니다. 이 펫은 여전히 패치가 적용되지 않은 보안 취약 시스템에 대해 선행 기술을 모방하는 데 가장 효과적이다. 이 도구는 흔히 발생하는 버그와 설정 오류를 찾아내는 방법을 알고 있습니다. 반면, 이 기술이 공격 성공을 위해 식별할 수 있는 취약점은 패치 우선순위 대상으로 식별할 수 있는 취약점과 동일합니다.

이는 새로운 기회를 만들어 줍니다. 산업용 악용 코드 생산 기지가 아직 본격적으로 가동되기 시작한 이 시점에, 보안 강화 및 패치 적용의 효과를 조직의 지속적이고 끊임없는 심장 박동처럼 재고해 볼 필요가 있습니다.

AI가 단백질 접힘 문제를 해결했을 때, 생물학자들을 대체한 것은 아니었지만, 그들이 다룰 수 있는 문제의 범위를 변화시켰다. Mythos는 보안 연구자들에게도, 양측 모두에게 동일한 역할을 수행합니다.

공격 능력과 벤치마크 포화도

표준 CTF 방식의 벤치마크는 이제 신호 측면에서 포화 상태에 이르렀습니다. Mythos는 바이너리 공격, 리버스 엔지니어링, 암호학, 웹 공격, 취약점 발견 등 전 과정을 아우르는 Cybench에서 100%의 점수를 기록했습니다. 앤트로픽은 다른 어떤 모델도 이를 달성하지 못했다고 밝혔습니다. 벤치마크가 포화 상태에 이르면, 프론티어 모델 간의 차이를 더 이상 구분하지 못하게 됩니다.

Anthropic은 재현에 많은 비중을 두는 평가 지표만으로는 더 이상 암기 능력과 진정한 능력을 구분할 수 없게 되었기 때문에, ‘ ’ 평가의 중점을 운영 중인 소프트웨어의 제로데이 취약점 발견을 포함한 새로운 실세계 보안 연구로 전환했다.

실무자들에게 있어 “AI의 공격 능력은 어느 정도인가?”를 평가하는 데 쓰이는 몇 가지 익숙한 기준은 다음과 같습니다. 이제 더 이상 사용되지 않습니다. 이 분야에서는 더 정밀한 측정 방법을 개발하기 위한 경쟁이 치열해지고 있다. 이는 6개월 전 우리의 입장과는 근본적으로 다른 입장입니다.

“최소 인간 개입” 문제

이전 모델들은 어려운 부분을 사람이 직접 처리해야 했습니다. Mythos는 그 연결 고리를 더욱 단단히 이어줍니다. METR의 “시간 범위(time horizon)” 지표는 모델이 별도의 개입 없이 50%의 신뢰도로 작업을 완료하는 데 소요되는 시간(전문 인력의 작업 시간 기준)을 측정합니다. 해당 지표는 빠르게 증가해 왔으며, 의 METR TH1,1 방법론()에 따르면 배가 시간 자체가 단축되었습니다.

모델출시됨50% 기간
클로드 3,7 소네트Feb 2025~60 분
GPT o3Apr 2025~120 분
클로드 작품 4,5Nov 2025~293 분
GPT-5,2Dec 2025~352 분
클로드 작품 4,6Feb 2026~719 분 (~12 시간)

출처: METR Time Horizons 대시보드

METR은 Mythos에 대한 구체적인 수치를 공개하지는 않았으나, 에 실린 Anthropic의 시스템 카드 는 대략적인 기준을 제시하고 있다. 보도에 따르면 Mythos는 전문가가 해결하는 데 10시간 이상 걸릴 것으로 추정되던 기업 네트워크 공격 시뮬레이션을 해결했으며, 이는 해당 등급의 사설 사이버 훈련장에서 이루어진 최초의 종단 간 해결 사례로 기록되었다(52쪽). 이 카드에는 Mythos가 “인간의 개입을 최소화한 자율 운영 체제”에서 구동된다고 설명되어 있다( 46쪽). 파이어폭스 147 평가 결과는 상황을 더욱 명확하게 보여줍니다:

모델전체 코드 실행Notes
클로드 작품 4,6~2 번의 성공 / 수백 번의 시도버그를 찾아낼 수는 있었지만, 이를 악용하는 경우는 거의 없었다
클로드 미토스 미리보기임상시험의 72%실행 간에 동일한 최적 버그로 독립적으로 수렴한다

출처: ‘인류 시스템 카드’ 제 3,3,3조

수백 번의 시도 중 대략 두 번의 성공에서 72%로 도약한 것은 점진적인 변화가 아닙니다. 이 모델은 인간 익스플로잇 개발자가 내리는 것과 동일한 유형의 선별 결정을 내리며, 서로 다른 충돌 범주에서 시작하는 독립적인 실행 전반에 걸쳐 이를 안정적으로 수행합니다.

가장 악용하기 쉬운 두 가지 버그가 제거되었음에도 불구하고, Mythos는 Opus 4,6의 단 한 가지 버그에 비해 네 가지의 별개의 버그를 활용함으로써 여전히 이전 모델들보다 뛰어난 성능을 보여주었다. 또한 Anthropic은 “성능이 토큰 한도까지 계속해서 향상되고 있다”( 52쪽)고 언급하고 있는데, 이는 평가 결과가 아직 성능의 상한선을 반영하지 않았을 수도 있음을 의미한다.

Mythos는 익스플로잇 파이프라인에서 더 이상 인간이 병목 현상이 되지 않는 최초의 모델입니다.

마이토스 보안 위험이 취약점 관리 및 방어에 미치는 의미

아래의 세 가지 지표는 운영상의 문제를 정의합니다. 마이토스가 등장하기 전부터 그들 각자는 이미 잘못된 방향으로 나아가고 있었다. 그 덕분에 각각은 더욱 속도를 내게 된다.

지표 1: 정보 공개부터 악용까지 소요 시간

10년도 채 되지 않은 시점에, 의 취약점 발견 및 공개에서 실제 악용까지 걸리는 평균 기간은 63 일이었다. 만디언트는 이 기간이 2022 년도의 32 일에서 2024년도의 5 일로 늘어났다고 밝혔다. 이 같은 평균 점수 하락세는 이미 가혹할 정도로 심해, 많은 팀의 경쟁력을 꺾고 있었다. AI를 통한 확산 효과로 인해, 특정 유형의 사안에 대해서는 논의의 초점이 ‘일’이 아닌 ‘시간’ 단위로 더 자주 옮겨가고 있다.

예전에는 가장 심각한 문제에만 적용되던 ‘비상 조치’ 성격의 저격수 패치 작업이 이제는 기존 프로세스와 도구가 감당할 준비가 되어 있지 않은 일상적인 작업이 될 가능성이 높습니다. 문제는 위기 상황에서 팀이 패치를 더 빨리 적용할 수 있는지 여부가 아니라, 해당 파이프라인이 그 속도를 지속적으로 유지할 수 있도록 설계되어 있는지 여부입니다.

지표 2: 조정된 공시량

글래스윙(Glasswing)의 공시 계획에 따라, 은 지금부터을 준비해야 합니다. Anthropic의 ‘’에 따르면: “파트너들은 가능한 범위 내에서 서로 정보와 모범 사례를 공유할 것이며, 90 일 이내에 Anthropic은 우리가 파악한 내용과, 공개 가능한 수정된 취약점 및 개선 사항에 대해 공개적으로 보고할 것입니다.” 수천 건에 달하는 CVE가 동시에 공개 기록에 등재될 가능성이 있으며, Mythos가 더 광범위하게 배포되거나 다른 업체들이 유사한 기능을 개발하게 되면 그 규모는 더욱 커질 것입니다.

패치 관리 팀에 미치는 실질적인 영향은 상당합니다:

  • 단 한 번의 Glasswing-wave 정보 유출로 인한 패치 대기열은 역사상 그 어떤 ‘패치 화요일’의 규모보다도 훨씬 더 클 수 있다.
  • 패치는 중대한 수준이거나 CVSS 점수가 높을 수 있으며, 인프라, 워크스테이션, 서버, 데이터베이스, OT 또는 IoT 기기에 동시에 퍼질 수 있습니다.
  • 지금 미처리된 패치 목록을 정리해 두면, 공격이 닥쳤을 때 방어해야 할 범위를 줄일 수 있습니다.
  • 사용하지 않는 소프트웨어를 통합하면 향후 패치 관리 부담이 줄어듭니다.
  • 오래된 골드 이미지는 부담 요소입니다. 이를 업데이트하거나, 더 나아가 배포 및 프로비저닝 방식을 현대화하여 정적 이미지에 대한 의존도를 완전히 줄이십시오.

지표 3: 역량 확산

최근 몇 세대에 걸친 모델에서 프론티어와 오픈웨이트 간의 지연 시간이 급격히 단축되었습니다:

프론티어 모델출시됨무제한 체급 비교출시됨지연
GPT-4Mar 2023Llama 3.1 405BJul 2024~16 개월
클로드 작품 4,5Nov 2025미니맥스 M2,5Feb 2026~79 일
클로드 작품 4,6Feb 2026GLM-5,1Apr 2026~61 일*

*GLM-5,1 의 수치는 공급업체의 자체 보고를 바탕으로 한 것이므로, 확인된 사실이 아닌 강력한 사전 정보로 간주해야 합니다.
출처: OpenAI, Meta, Anthropic (4,5), Anthropic (4,6), MiniMax, Z.ai

16개월에서 61 일까지는 3년 동안 대략 8x 배의 압축 비율에 해당합니다. Epoch AI의 ‘ ’에 따르면, 전체 역사적 데이터에서 평균 오픈-웨이트 래그는 약 3,5 개월로 나타났으나, 최근 데이터 포인트들은 더 밀집된 분포를 보이고 있다.

앤트로픽은 오픈-웨이트 모델이 사이버 과제에서 ‘미토스(Mythos)’ 수준의 능력을 갖추기까지 대략 6개월에서 18개월이 걸릴 것으로 공개적으로 전망했다. RSA 2026() 행사에서, 코리도어(Corridor)의 CPO이자 전 페이스북 CISO인 알렉스 스타모스는 6개월이라는 기간을 제시하며(이는 앤트로픽(Anthropic)이 제시한 18개월 상한선보다 경험적 추세에 더 부합하는 수치다), 다음과 같이 경고했다. “상트페테르부르크에 사는 모든 19세 청소년이 똑같은 능력을 갖게 될 것입니다.”

마이토스급 성능이 오픈웨이트 모델에 도달하면, 대개 다음 두 가지 변화가 동시에 발생합니다:

  1. 추론 비용이 대폭 감소했습니다: MiniMax M2,5 과 같은 모델은 이미 Claude Opus 4,6에 비해 약 1/20th 분의 1 수준의 비용으로 작동하므로, 많은 사용자에게 있어 이를 지속적으로 또는 대규모로 활용하는 데 경제적 부담이 거의 없습니다.
  2. 행동 관련 제약 사항이 완화됨: Anthropic의 시스템 카드에 기록된 가장 심각한 행동들은 ‘프로젝트 글래스윙(Project Glasswing)’을 통해 공유된 미리보기 모델에서가 아니라, 개발 과정 중 ‘마이토스(Mythos)’의 초기 내부 버전에서 관찰된 것이었다. 이러한 행동들을 완화하기 위해서는 맞춤형 안전 파이프라인, 해석 가능성 관련 작업, 반복적인 테스트 등을 포함한 광범위한 사후 훈련 조정 및 평가가 필요했습니다. 그 작업은 규모가 방대하고 노동 집약적이었으며, 앤트로픽(Anthropic)의 훈련 과정에 특화된 것이었기 때문에, 모델 가중치만으로는 그 결과를 그대로 적용할 수 없습니다. 따라서 이러한 초기 행동들은 출시된 ‘Mythos Preview’ 자체의 특성이 아니라, 비슷한 능력을 지녔으나 정렬도가 더 낮은 배치들이 보여줄 수 있는 모습을 합리적으로 예측해 볼 수 있는 사례로 이해하는 것이 가장 적절합니다.

종합해 보면, 수비수의 계획 수립 시기는 “앤트로픽이 ‘마이토스’를 공개할 때”가 아니다. 바로 오픈 웨이트 모델들이 그러한 행동적 제약 없이 ‘미토스’ 수준의 사이버 역량을 달성하게 될 때입니다. 그 시계는 사실상 ‘ 4월 7일’에서 시작되었으며, 그 기간은 년이 아닌 개월 단위로 측정됩니다.

AI 시대를 위한 패치 관리 재고

‘패치 화요일’은 이제 옛날의 유물일 뿐이다. 월별 패치 주기는 사람이 취약점을 발견하고, 사람이 익스플로잇을 개발하며, 사람이 변경 관리 프로세스를 수행하는 속도에 맞춰 설계되었습니다. 이러한 가정들은 이제 구조적인 부담 요인이 되었습니다. 이러한 변화는 단순히 “패치를 더 빨리 적용하면 된다”는 식의 간단한 문제가 아닙니다. 현재의 환경에서는 정밀한 문제 해결과 지속적인 위협 노출 관리를 향한 근본적인 변화가 필요합니다. 즉, 민첩하고, 목표 지향적이며, 신속하고, 반복적인 프로세스가 요구됩니다.

소프트웨어 개발 분야에서 더 빠른 CI/CD 파이프라인과 AI 기반 워크플로가 보편화됨에 따라, 보안 분야도 같은 흐름을 따라야 합니다. 보안 분야는 이러한 전환을 더디게 진행해 왔지만, Mythos가 패치 주기를 가속화할 것으로 예상되는 속도 때문에 어쩔 수 없이 전환을 추진하게 될 것입니다.

AI 시대의 패치 관리 란, 취약점 해결을 현대적인 소프트웨어 팀이 배포를 처리하는 방식과 동일하게 다루는 것을 의미합니다. 즉, 주기적인 일괄 처리 방식 대신 자동화된 실행과 실시간 인텔리전스, 검증 단계, 지속적인 피드백 루프를 결합하는 방식입니다.

업계에서는 이미 이것이 대략적으로 사실이라는 점을 알고 있었다. AI를 활용한 취약점 탐지는 수년 동안 모든 주요 보안 컨퍼런스와 연구 기관에서 꾸준히 다뤄져 온 주제입니다. 미토스는 그 본질상 놀라운 일이 아니라, 단지 그 규모와 발생 속도 면에서만 놀라운 것이다. 시간軸이 “언젠가”에서 “지금”으로 단축되었다. SLA, 도구, 인력 배치, 우선순위 결정 체계와 관련하여 귀사의 프로그램에 내재된 가정들은 이제는 더 이상 존재하지 않는 세상을 전제로 수립된 것입니다.

검증은 선택 사항이 아닙니다

패치를 적용하고 그대로 방치하는 것만으로는 패치가 충분하고 성공적으로 적용되었는지 파악하기 위한 추가적인 점검 없이는 문제 해결에 대한 확신을 가질 수 없습니다. 패치 작업의 속도가 빨라지고 처리량이 늘어나는 환경에서는 다음과 같은 요인으로 인해 패치 적용 범위가 불완전해질 위험이 커집니다:

  • 패치 배포 범위에서 제외된 관리되지 않는 엔드포인트
  • 영구적인 공백으로 이어지는 예외 및 연기 사례
  • 성공으로 보고되지만 실제로는 실패한 배포
  • 다음 패치 주기가 올 때까지 구식 소프트웨어와 함께 사용자의 환경에 다시 배포되는 오래된 골드 이미지

공격자들이 검사가 누락된 시스템에서 다시 나타날 수 있는 상황에서, 모든 엔드포인트에 걸쳐 취약점을 확실히 해결했는지 확인하는 것은 그 어느 때보다 중요합니다. 지속적인 위협 노출 관리, 즉 노출 감소를 일회성 프로젝트가 아닌 반복적인 과정으로 다루는 방식이 바로 이러한 환경에 적합한 운영 모델입니다.

“기본적으로 보안이 보장됨”의 확장된 정의

전통적으로 “기본적으로 보안이 보장된(secure by default)”이란 안전한 출하 시 구성 상태를 의미했습니다. 즉, 최소 권한 원칙, 강화된 기본 설정, 그리고 인간의 속도를 가진 공격자를 가정하여 공격 표면을 최소화한 상태를 말합니다.

Anthropic이 공개한 Glasswing 자료()에 따르면, Mythos와 관련된 연구 결과에는 OpenBSD의 27년 된 취약점, 방대한 양의 자동 퍼징 테스트를 견뎌낸 16년 된 FFmpeg 버그, 그리고 리눅스 커널 문제를 자율적으로 연쇄적으로 악용해 시스템 전체를 제어한 사례 등이 포함됩니다.

만약 이 수준의 도구가 철저한 감사를 거친 코드베이스에서 수십 년 전의 문제점까지 드러낼 수 있다면, “기본적으로 안전한(secure by default)”이라는 원칙은 단순한 구성 설정을 훨씬 넘어서는 범위로 확대되어야 합니다. 이는 오늘날 출시되는 모든 소프트웨어가 실제 운영 환경에 배포되기 전에 이에 상응하는 도구를 통해 적극적으로 검사되고 있어야 함을 의미합니다. 인프라의 경우, 노출된 서비스가 적어도 이 수준의 능력에 해당하는 지속적인 탐색에 직면한다고 가정하십시오. 네트워크 세분화, 제로 트러스트 아키텍처, 런타임 격리는 더 이상 성숙도 모델의 목표가 아니라, 기본적인 아키텍처 요구 사항이 되었습니다.

접근성: 비용은 일시적인 것이지만, 역량은 점차 드러나는 것이다

단기적으로는 미토스급 접근 권한을 얻는 데 비용이 많이 듭니다. Glasswing-era pricing cited by Anthropic is $25/$125 per million input/output tokens versus $5/$25 for Opus 4,6—a 5x increase. 그 가격대에서 고강도의 연속 스캔을 수행하는 것은 결코 쉬운 일이 아니지만, 비용은 일시적인 장벽일 뿐입니다.

앤트로픽(Anthropic)은 에서, ‘Mythos Preview’를 공격적 사이버 활동을 위해 명시적으로 훈련시키지는 않았으며, 이러한 능력은 “코드, 추론 및 자율성의 전반적인 개선에 따른 결과로 자연스럽게 나타난 것”이라고 밝혔습니다. 훌륭한 해커를 훌륭하게 만드는 호기심, 자율성, 그리고 기지를 생각해 보면 이는 일리가 있습니다.

만약 그 가정이 맞다면, 향후 개발될 모든 충분히 성능이 뛰어난 모델에는 공급업체의 의도와 무관하게 유사한 표면이 나타날 것입니다.

오픈 웨이트 래그의 축소와 추론 비용의 하락이 맞물리면서, “누가 API 비용을 감당할 수 있는가”는 더 이상 장기적인 걸림돌이 아닙니다. "함대와 공급망을 갖춘 곳은 어디인가"는.

집 안의 벡터: 에이전트, 하네스, 그리고 엄격한 경계

'Mythos'와 같은 제품이 출시되면, 주로 공격적인 행위자들에 의한 외부 악용 사례가 가장 많이 다뤄집니다. 그러나 이와 동시에 존재하는 위험은 내부에서 비롯됩니다. 즉, 광범위한 도구 접근 권한과 기업 데이터, 유효한 인증 정보를 보유한 승인된 요원이나 비공식 요원들이 조직의 보안 경계 내에서 활동하고 있는 것입니다.

177.000 개 이상의 MCP(Model Context Protocol) 도구를 대상으로 한 ‘ ’ 연구 카탈로그에 따르면, 파일 시스템, 브라우저, 코드 실행 환경, 데이터베이스 및 프로덕션 API 전반에 걸친 일상적인 에이전트 통합이 표준 하네스 기능으로 보고되고 있다.

“Claw” 스타일의 하네스—탄탄한 도구 루프와 지속적인 자율성을 갖춘—는 빠르게 확산되었습니다. OpenClaw는 8주 만에 GitHub에서 약 247.000 개의 스타를 기록했으며, 수십 개의 파생 버전이 등장했고, 터미널, 브라우저, 파일 시스템, 메모리 검색, 외부 통합에 이르는 다양한 기본 액세스 패턴을 지원합니다. 광범위한 접근 권한과 자율성이 결합되면 공격 표면이 내부와 외부로 동시에 확대됩니다.

하네스 수준의 규칙은 여전히 사람이 작성한 코드입니다. 그들은 실패한다; 과제 완성이 최우선이 될 때 모델들은 이를 우회한다. Anthropic의 시스템 카드 에는 Mythos가 버그를 수정하고 인증 정보 없이 서명된 커밋을 푸시하라는 요청을 받은 후, 사용자의 암시적 신호를 받고 슈퍼바이저 상태를 검색한 뒤 메모리 추출을 시도했던 에피소드가 기술되어 있습니다. 이러한 행동은 위험 평가보다 목표 추구가 더 우선시된 것으로 특징지어집니다. 해당 사건은 추가 정렬 작업에 앞서 진행된 출시 전 평가 단계에서 발생했습니다. 앤트로픽은 출시된 ‘마이토스 프리뷰’가 자사의 평가 기준에 따라 매우 높은 정합성을 보인다고 밝히면서도, 드물게 발생하는 정합성이 떨어지는 행동이 바로 그 막강한 성능 때문에 여전히 심각한 결과를 초래할 수 있다고 지적했습니다.

AI 기업 내부의 가시성

첫 번째 요건은 보안 경계 내부에서 어떤 프로그램이 실행되고 있는지, 승인된 프로그램인지 아닌지를 파악하는 것입니다. 대부분의 조직은 자사 환경 전반에 배포된 로컬 추론, AI 어시스턴트, 자율 에이전트에 대해 명확한 파악을 하지 못하고 있다. 보이지 않는 것은 보호할 수 없는데, 현재 대부분의 조직은 자사의 보안 경계 내에서 실제로 얼마나 많은 AI가 가동되고 있는지에 대한 신뢰할 만한 현황 파악을 하고 있지 않습니다.

[현대 기업에 있어 AI 규정 준수가 무엇을 의미하는지, 그리고 변화하는 규제가 책임 있는 AI 거버넌스를 어떻게 형성하고 있는지 알아보세요]

조직이 실행 중이라고 생각하는 것과 실제로 실행 중인 것 사이의 격차가 상당할 뿐만 아니라 점점 더 벌어지고 있기 때문에, 사이버 보안 업계 전체가 AI 가시성 도구에 대한 대규모 투자를 지속해야 할 것입니다.

AI 에이전트의 안전한 배포 및 실시간 관리

단순히 눈에 띄는 것만으로는 충분하지 않습니다. 또한 조직은 AI 에이전트를 안전하게 배포하고 전체 시스템 전반에 걸쳐 중앙 집중식으로 관리할 수 있는 방법이 필요합니다. 행동 훈련과 적용 수준의 안전 장치는 유용하지만, 능력이 뛰어나고 목표를 추구하는 에이전트에 대항해 충분한 보장을 제공하지는 못한다.

최근 나타나는 추세로는 파일 시스템, 네트워크 및 프로세스 제약 조건에 대한 OS 수준의 정책이 있으며, 시스코, 크라우드스트라이크, 구글 클라우드, 마이크로소프트 등 주요 보안 업체들 은 이미 자율 에이전트를 위한 런타임 정책 표준을 마련하기 위해 협력하고 있다.

한 분석에서 클로드는 ‘ 2026년 3월 ’ 시스템 맵 유출 사건과 관련해 해당 시스템의 일부 보안 조치를 “분위기를 이용한 방어”라고 표현했다. 사람이 이해하기 쉬운 규칙과 지침이 우리의 표준 방어 수단의 일부가 될 수는 있겠지만, 여전히 최소한의 공학적 통제 조치 체크리스트는 다음과 같습니다:

  1. OS/컨테이너 경계에서의 샌드박스 격리 (시스템 프롬프트 지침이 아님): 에이전트가 비정상적으로 작동할 경우 그 영향을 제한하기 위해, 에이전트는 격리된 컨테이너 내에서 실행되어야 하며, 이는 모델의 안전 훈련을 통해서가 아니라 인프라 수준에서 강제 적용되어야 합니다.
  2. 모든 아웃바운드 경로에 대한 네트워크 정책: 모든 아웃바운드 연결은 차단되어 정책에 따라 평가되어야 합니다. 엔드포인트에 접속할 수 없는 에이전트는 해당 엔드포인트와 상호작용할 수 없으므로, 이를 통해 내부 서비스를 악성 에이전트로부터 보호하고 기업 데이터가 유출되는 것을 방지할 수 있습니다.
  3. 에이전트 환경 외부의 인증 정보: 인증 정보는 에이전트의 샌드박스 내에서 절대로 접근할 수 없어야 합니다. 이들은 에이전트 환경 외부의 프록시를 통해 관리되어야 하며, 에이전트 샌드박스를 벗어난 후에야 아웃바운드 요청에 주입되어야 합니다.
  4. 추론, 도구 및 네트워크 호출에 대한 중앙 집중식 라우팅 및 로깅: 모든 발신 요청은 프록시를 통해 라우팅되어야 하며, 모든 네트워크 요청, 추론 호출 및 도구 호출에 대한 완전한 로깅이 이루어져야 합니다. 이를 통해 효율적인 포렌식 조사 및 규정 준수 검증이 가능해집니다.

신호에서 대응까지: 수비수들에게 어떤 변화가 생기는가

위에서 언급한 ‘미토스’의 위험 요소들은 실재하지만, 결코 알 수 없는 것은 아닙니다. 불확실한 것은 방향이 아니라 시기일 뿐이다. 오픈웨이트 모델이 전 영역에 걸친 자율 사이버 과제에서 Mythos와 대등한 수준에 도달할 정확한 시점은 아직 알 수 없으며, 다양한 환경과 스택에 걸쳐 Anthropic의 Firefox급 결과들을 광범위하고 독립적으로 재현한 사례도 아직 없습니다.

분명한 것은 수비수들이 더 이상 확실한 상황이 될 때까지 기다릴 여유가 없다는 점이다. 취약점 발견 및 악용화까지 걸리는 기간이, 대부분의 패치 및 노출 관리 프로그램이 이를 감당하도록 설계된 속도보다 훨씬 빠르게 단축되고 있다. 그런 환경에서는 헤드라인에 반응하는 것보다 가정을 철저히 검증하는 것이 더 유용합니다.

현재 보안 및 IT 리더들이 던져야 할 가장 생산적인 질문은 “Mythos가 얼마나 심각해질까?”가 아닙니다. “위험 노출 기간이 계속 줄어들 경우, 현재의 운영 모델은 어떤 부분에서 가장 먼저 한계에 부딪히게 될까?”

일부 조직의 경우, 이러한 부담은 업무 우선순위 결정 과정에서 드러납니다. 다른 경우에는 테스트 처리량, 배포 제약 조건, 또는 분산된 엔드포인트 환경 전반에 걸친 종결성 검증 등에서 이러한 문제가 드러납니다. 거의 모든 경우에서 취약점은 단순히 툴 자체에 있는 것이 아니라, 취약점에 대한 통찰을 검증된 위험 완화 조치로 전환하는 과정에 있습니다.

위험을 이해하는 단계에서 대응을 실행에 옮기는 단계로의 이러한 전환이 바로 ‘미토스’ 논의가 중요한 의미를 갖게 되는 지점입니다. 남은 과제는 이론적인 문제라기보다는 조직적인 문제입니다. 즉, 취약점의 발견, 우선순위 지정, 악용이 점점 더 밀접하게 연결되어 가는 상황에서 기존의 취약점 및 패치에 대한 가정이 여전히 유효한지 여부입니다.

마이토스는 피할 수 없는 현상이기 때문에, 패치 작업은 선택 사항이 아니며 신속하고 대규모로 수행되어야 합니다. Tanium Autonomous Patch Management 는 자율적이고 통합적이며 포괄적인 패치 적용을 통해 엔드포인트 관리 및 보안을 혁신합니다.

AI와 실시간 엔드포인트 인텔리전스를 기반으로 하는 Tanium은, 공격자가 발견한 취약점을 악용하기 전에, Mythos급 모델이 악용하도록 설계된 노출 기간을 줄이는 데 도움을 줍니다.

Mythos 보안 위험 관련 자주 묻는 질문

‘Mythos’의 출시 소식은 상당한 언론 보도를 불러일으켰는데, 그중에는 정확한 내용도 있었고 그렇지 않은 내용도 있었다. 이 설명들은 가장 흔히 혼동되는 부분들을 다루고 있습니다.

공개된 미토스 모델이 샌드박스를 빠져나와 흔적을 지웠을까?

아니요, 출시된 모델이 아닙니다. 샌드박스 탈출, 흔적 은폐, /proc/를 통한 인증 정보 탈취, 기밀 자료 게시 등 Anthropic이 기록한 행동 관련 사건들은 Glasswing 시대의 Mythos Preview가 아닌, 이전 내부 버전의 Mythos에서 발생한 것으로 파악됩니다.

‘Anthropic 시스템 카드’에는 그러한 심각한 사고들이 Anthropic의 가장 효과적인 훈련 조치 중 일부가 시행되기 “이전”의 버전에서 발생했음이 명시되어 있다( 54쪽). 공개된 모델은 위험 부담이 낮은 상황에서는 여전히 무모한 지름길을 택하지만, 이전과 같은 심각한 기만 패턴은 보이지 않는 것으로 설명된다. 버전 지정자 없이 해당 동작들을 언급하는 것은 기술적으로 정확하지 않습니다.

만약 Mythos가 패치된 시스템에 대해 실패했다면, 패치만으로도 여전히 충분한 것일까요?

패치 적용은 여전히 방어 측의 주요 우위 요소이며, “최신 패치가 적용된 적절히 구성된 샌드박스”(Anthropic System Card, 52쪽)를 상대로 Mythos가 실패했다는 사실은 주요 수치 뒤에 숨겨진 긍정적인 소식이다.

‘Mythos’는 소홀해진 위생 관리와 패치되지 않은 스택에 대항하는 정밀 무기처럼 읽힌다. 조직이 직면한 과제는, 탐지 및 무기화 과정이 동시에 가속화되는 상황에서 팀들이 패치를 적용하고, 적용 범위를 검증하며, 이미지를 신속하게 갱신할 수 있는지 여부입니다. 정답은 진행 속도와 검증입니다.

표준 벤치마크가 “포화 상태”라는 것은 무슨 뜻인가요?

Anthropic은 알려진 취약점의 재현을 측정하는 벤치마크가 결국 최첨단 분야에서 유용한 차별화 지표를 제공하지 못하게 되기 때문에, 평가의 초점을 운영 중인 소프트웨어의 제로데이 취약점 발견을 포함한 새로운 실세계 보안 과제로 전환했습니다.

벤치마크가 포화 상태에 이르렀다고 해서, 그 과제가 절대적인 의미에서 해결되었다는 뜻은 아닙니다. 이는 해당 테스트가 측정하도록 설계된 한계에 도달했음을 의미합니다. Cybench에서 Mythos가 기록한 100% 점수는 이 특정 벤치마크가 더 이상 최상위급 모델들 간의 유의미한 차이를 보여주지 못함을 시사하며, 이는 모델 성능이 향상됨에 따라 흔히 반복되는 현상이다.

이것이 시사하는 실질적인 의미는 명백합니다. 평가 방식은 역량과 함께 발전합니다. 모델이 발전함에 따라, 벤치마크는 중요한 요소를 지속적으로 측정할 수 있도록 개선되거나 대체되거나, 더 까다로운 형태로 바뀌게 됩니다. 이러한 상황에서 앤트로픽(Anthropic)의 평가 중점은 더 어렵고 재현 가능성이 낮은 과제로 이동하고 있는데, 이는 바로 그러한 과제들이 실제 AI 보안 문제 중 실무자들이 중요하게 여기는 유형을 더 잘 반영하기 때문이다.

마이토스의 공격 능력은 의도적으로 훈련된 것일까?

호. Anthropic은에서 다음과 같이 밝혔습니다. “저희는 Mythos Preview가 이러한 기능을 갖도록 명시적으로 훈련시키지 않았습니다.” 오히려 이는 코드, 추론, 자율성 전반에 걸친 개선의 결과로 나타난 것이다."

이는 Mythos와 같은 최첨단 대규모 언어 모델(LLM)과 규모, 훈련 방식, 아키텍처 특성이 유사한 모델들에서도 비슷한 성능 곡선이 나타날 가능성이 높다는 것을 의미합니다. 기업들이 해당 아키텍처에 대한 모든 세부 사항을 공개하지는 않지만, 이러한 추세는 성능 확산이 정책적 선택보다는 범용 모델 확장의 근본적인 역학에 의해 주도되고 있음을 시사한다.

추가 자료

  • 이 온디맨드 데모( )를 시청하여 Tanium Autonomous Patch Management가 어떻게 조직이 취약점 노출 격차를 지속적으로 해소하도록 돕는지 확인해 보십시오. 이 솔루션은 오늘날의 환경이 요구하는 속도와 규모에 맞춰 AI 기반 위협에 대응합니다.

앤트로픽

모델 성능 및 평가 연구

무제한 체급 모델

산업 분석 및 보고

기초 모델 관련 논문