허깅페이스 해킹 ‘AI 안전’ 경종... “가드레일 의존말고 ‘기본’ 충실”

2026-07-29 16:46
  • 카카오톡
  • 네이버 블로그
  • url
“AI 자기 통제 한계”... 인증 보안 등 기본 탄탄해야
“프롬프트 조작으로 페이블5 가드레일 탈옥 성공”


[보안뉴스 강현주 기자] 오픈AI의 ‘GPT-5.6’이 샌드박스를 스스로 뚫고 나와 오픈소스 AI 공유 플랫폼 ‘허깅페이스’를 해킹한 사건은 AI 모델의 ‘안전장치’ 의존에 대한 경종을 울리고 있다.

29일 보안 전문가들 사이에서는 “인간 해커보다 훨씬 빠른 속도로 해킹할 수 있는 AI의 기능을 제약하는 안전장치에 의존하기 보다는, AI 모델의 활동에 대한 모니터링 강화, 방어를 위한 인증 보안 강화 등을 더 신경 써야 한다”는 진단이 나오고 있다.


[출처: 연합]

허깅페이스 해킹은 오픈AI가 ‘GPT-5.6’ 모델의 자체 테스트를 진행하는 특수한 상황에서 비롯됐다. 오픈AI는 고성능 AI 모델인 GPT-5.6에게 사이버 보안 관련 벤치마크 ‘익스플로잇짐’(ExploitGym) 평가 문제를 해결하는 시험을 실시했다. 정확한 평가를 위해 사이버 공격을 거부하는 기능과 안전 필터, 즉 ‘가드레일’이 비활성화된 상태였다.

시험은 인터넷이 차단된 샌드박스 환경에서 벤치마크 평가를 진행했다. 하지만 이 모델은 오픈소스 AI 공유 플랫폼 허깅페이스에 문제의 답이 있을 것으로 스스로 판단했다. 샌드박스 내부의 제로데이 취약점을 이용해 통제망을 우회하고 외부 네트워크를 통해 허깅페이스 시스템을 침투해 원하는 답을 얻었다.

국내외 연구진 “페이블5도 탈옥해 미토스화 가능”
GPT-5.6에 적용된 가드레일과 샌드박스 환경은 이 모델에 채우는 ‘안전장치’인 셈이다. 허깅페이스 사건에서는 가드레일은 테스트를 위해 의도적으로 해제했지만, 샌드박스 환경의 취약점은 이 AI 모델이 외부 네트워크로 탈옥하는 것을 막지 못했다.

AI의 위험한 행동을 제약하는 가드레일 역시 100% 신뢰해선 안된다는 게 보안 전문가들의 공통적인 지적이다.

앞서 앤트로픽이 ‘안전한 미토스’라고 내세웠던 ‘페이블5’ 모델에 대해 AWS 연구진의 탈옥 가능성 제보가 나온 바 있다. 국내 전문가들 사이에서도 페이블5에 대한 탈옥 가능성이 제기했다.

페이블5는 성능은 ‘미토스’와 동급이지만 해킹 기능을 제약한 버전이다. 가령 해킹 관련 요구나 질문이 나오면 하위 모델로 강제 다운그레이드 되는 형태의 가드레일이 적용됐다. 보안 관련 내용이 조금만 들어가도 가드레일이 작동돼 불편하다는 원성까지 들은 모델이다.

하지만 정교한 프롬프트 조작 등으로 이 가드레일을 무너뜨리는 게 불가능하지는 않다는 것이다.

<보안뉴스>와 인터뷰 한 국내 일부 전문가도 정교한 프롬프트 우회로 직접 이 가드레일을 깰 수 있었다고 밝혔다. 다만 정교한 프롬프트 조작은 난이도가 대중적인 기법은 아니기 때문에 장벽은 존재한다는 게 복수의 전문가들의 설명이다.

“가드레일이 현실적 대책이지만 의존 NO”
결국 사이버 위협을 동반할 AI 시대에 AI 모델을 안전하게 사용하기 위한 방법으로 가드레일은 필연적이라는 사실은 변함이 없다는 얘기다. 다만 완벽할 수 없는 가드레일에 의존하는 것은 위험하다.

윤인수 한국과학기술원(KAIST) 교수는 “AI 모델의 가드레일은 완벽할 수 없는 메커니즘이므로 탈옥이나 공격 시도도 많다”며 “그럼에도 어느 정도의 방어선은 제공하기 때문에, AI 모델의 비정상적인 행동을 막기 위해서는 가드레일이 현실적인 방법”이라고 말했다.

윤 교수는 “허깅페이스 해킹 사건의 경우 의도적으로 가드레일을 해제한 특수한 사례였지만 샌드박스 환경 내 테스트라 해도 파괴력이 큰 AI 모델인만큼 탐지는 제대로 이뤄져야 한다”라며 “AI가 어떤 행위를 하는지 지속적 모니터링이 강화된다면 해킹이 발생하더라도 빠르게 발견해 위험을 낮출 수 있을 것”이라고 했다.

AI 모니터링·인증보안 강화 등 ‘기본’ 여전히 1순위
최근 보안 연구 목적으로 AI 어시스턴트 ‘클로드 데스크톱’을 악용한 AD 서버 해킹에 성공한 바 있는 채홍소 네오아이앤이 CTO는 허깅페이스 사건에 대한 시사점으로 ‘인증 보안 강화’를 제시했다.

채홍소 CTO는 “허깅페이스 사건도 결국 API나 토큰이 유출된 것으로 2차 인증 등으로 아이덴티티(ID) 보안을 강화해야 한다는 시사점을 다시 한번 남긴다”며 “국내 기업 환경들 중 특히 클라우드 기반 서비스형 소프트웨어(SaaS) 환경에서는 ID 보안이 방만하게 운영되는 곳이 많고, 평문화된 크리덴셜을 악용한 대규모 해킹 사건들이 잇따랐다”며 인증 보안과 암호화 등의 중요성을 강조했다.

채 CTO는 “허깅페이스 해킹은 AI의 자기 통제 실패 사례로 가드레일 같은 안전장치는 AI의 서비스를 제한해야 한다는 것이 되는데, 과연 얼마나 통제가 가능할지”라며 “AI의 자기 통제에만 의존할 수는 없다”고 말했다.

윤인수 교수는 “AI 시대에도 방어자 입장에서는 인간 해커나 AI 해커나 공격 자체가 달라지는 게 아니므로 기본 보안에 충실해야 한다는 것은 마찬가지”라고 강조했다.

[강현주 기자(jjoo@boannews.com)]

<저작권자: 보안뉴스(www.boannews.com) 무단전재-재배포금지>

연관 뉴스

헤드라인 뉴스

TOP 뉴스

이전 스크랩하기


과월호 eBook List 정기구독 신청하기

    • 시큐리티플랫폼

    • 인콘

    • 엔텍디바이스

    • 핀텔

    • 아이비젼

    • 아이디스

    • 인피닉

    • 웹게이트

    • 판빌코리아

    • 하이크비전

    • 한화비전

    • ZKTeco

    • 비엔에스테크

    • 엔토스정보통신

    • 원우이엔지

    • 지인테크

    • 에스엠시스템즈

    • 이화트론

    • 에스비젼

    • 테크스피어

    • 휴먼인텍

    • 슈프리마

    • 홍석

    • 시큐인포

    • 미래정보기술(주)

    • 티비티

    • 지오멕스소프트

    • 세연테크

    • 경인씨엔에스

    • 스마트시티코리아

    • 성현시스템

    • 렉스젠

    • 파인트리커뮤니케이션

    • 다후아코리아

    • 트루엔

    • 제이더블유씨네트웍스

    • 한국표준보안

    • 씨엠아이텍

    • 지엠케이정보통신

    • 시큐믹

    • 한국씨텍

    • 진명아이앤씨

    • 포엠아이텍

    • 비엔에스테크

    • 모니터

    • 펜타시큐리티

    • 시큐아이

    • 윈스테크넷

    • 이레산업

    • 에프에스네트워크

    • 네이즈

    • 케이제이테크

    • 셀링스시스템

    • 더플러스

    • 세이프네트워크

    • 네티마시스템

    • 아이엔아이

    • 에이앤티코리아

    • 인더스비젼

    • 제네텍

    • 주식회사 에스카

    • 솔디아

    • 일산정밀

    • 크랜베리

    • 새눈

    • 누리콘

    • 윈투스시스템

    • 메트로게이트
      시큐리티 게이트

    • 케비스전자

    • 태양테크

    • 엘림광통신

    • 미래시그널

    • 뷰런테크놀로

    • 아이에스앤로드테크

    • 현대틸스
      팬틸트 / 카메라

    • 넥스트림

    • 스마컴

    • 구네보코리아

    • 명정보기술

    • 엔시드

    • 엔에스티정보통신

    • 와이즈콘

    • 글로넥스

    • 유진시스템즈

    • 엠스톤

    • 세환엠에스(주)

Copyright thebn Co., Ltd. All Rights Reserved.

시큐리티월드

회원가입

Passwordless 설정

PC버전

닫기