보안정보

전문화된 보안 관련 자료, 보안 트렌드를 엿볼 수 있는
차세대 통합보안관리 기업 이글루코퍼레이션 보안정보입니다.

자율형 AI 시대의 보안과 통제

2026.08.31

284

이글루코퍼레이션 자율형 AI 시대의 보안과 통제
💌 후속 콘텐츠, 계속 받아보세요 ▶

2026년 7월, 오픈AI(OpenAI)의 인공지능(Artificial Intelligence, 이하 AI) 모델이 사이버 보안 역량을 평가받던 중 격리된 테스트 환경을 벗어나 외부 기업의 실제 시스템에 침투한 사실이 공개됐다. 이후 앤트로픽(Anthropic)과 메타(Meta) 역시 AI 모델이 보안 평가 과정에서 외부 시스템에 무단으로 접근한 사례를 잇달아 공개하면서, AI의 자율성과 사이버 공격 능력을 어떻게 통제할 것인지가 새로운 보안 과제로 떠올랐다.

이번 사건들은 AI가 악의적인 의도를 가지고 인간의 통제를 거부했다는 의미는 아니다. 그러나 AI가 주어진 목표를 달성하기 위해 스스로 계획을 수립하고, 도구를 사용하며, 실패한 경로를 바꿔가며 장시간 작업할 수 있게 되면서 잘못된 목표 설정과 과도한 권한, 평가 환경의 보안 취약점이 실제 침해사고로 이어질 수 있다는 점을 보여줬다. 이에 본 기고에서는 AI 모델의 외부 시스템 접근 사례를 살펴보고, AI 모델이 통제 범위를 벗어난 원인과 자율형 AI 시대의 보안체계 변화, 정부와 기업이 준비해야 할 대응 방향을 살펴보고자 한다.

이글루코퍼레이션 자율형 AI 시대의 보안과 통제
[그림 1] 허깅 페이스를 공격하는 오픈AI의 AI 모델 관련 이미지 (출처: 日 RocketBoy)


01. AI 모델의 외부 시스템 침입

생성형 AI는 사용자의 질문에 답하거나 콘텐츠를 생성하는 도구에서 벗어나, 주어진 목표를 달성하기 위해 스스로 계획을 수립하고 필요한 도구를 호출하는 AI 에이전트(AI Agent)로 발전하고 있다. AI 에이전트는 웹 검색, 코드 실행, 파일 접근, API 호출 등 외부 시스템과 직접 상호작용할 수 있으며, 여러 단계를 거쳐 장시간 복잡한 작업을 수행하는 수준으로 발전했다. 이러한 변화는 AI의 활용 범위를 확대했지만, AI에 부여된 목표와 권한이 적절하게 통제되지 않을 경우 실제 보안 사고로 이어질 수 있다는 새로운 위험도 만들었다. 실제로 ‘26년 7월부터 오픈AI, 앤트로픽, 메타가 진행한 사이버 보안 역량 평가 과정에서 AI 모델이 허용된 테스트 범위를 넘어 외부 기업의 실제 시스템에 접근한 사례가 연이어 공개됐다.

이글루코퍼레이션 자율형 AI 시대의 보안과 통제
[표 1] 주요 AI 모델의 외부 시스템 접근 사례 (출처: 각 사, 재구성: 이글루코퍼레이션)

가장 주목받은 사례는 오픈AI의 모델이 오픈소스 공유 플랫폼인 허깅 페이스(Hugging Face)를 침입한 사건이다. 오픈AI는 GPT-5.6 Sol과 내부 연구용 모델의 사이버 공격 역량을 측정하기 위해 취약점을 찾고 공격하도록 설계된 *ExploitGym 평가를 진행했다. 평가를 수행하던 AI는 문제를 정상적으로 해결하는 대신, 평가 정답이 저장된 시스템에 직접 접근하는 경로를 탐색했다. AI는 패키지 설치를 위해 허용된 **Artifactory 프록시에서 알려지지 않았던 제로데이 취약점을 발견해 인터넷 연결 경로를 확보했다. 이후 외부 코드 실행 환경을 거쳐 허깅 페이스의 데이터 처리 시스템과 운영 인프라까지 침투했다. 허깅 페이스가 복원한 기록에 따르면 AI 에이전트는 7월 9일부터 13일까지 약 1만 7,600회의 행위를 수행했으며, 실패한 경로를 바꿔가며 여러 시스템의 취약점과 인증정보를 연결해 공격 경로를 완성했다.

오픈AI 사건 이후 앤트로픽은 자체 사이버 보안 평가 기록 14만 1,006건을 재점검했다. 그 결과 클로드(Claude)가 제3자 평가 파트너인 ‘이레귤러(Irregular)’의 테스트 환경을 통해 인터넷에 접속한 뒤 실제 기업 3곳의 운영 시스템에 무단으로 접근한 사례가 확인됐다. 평가 프롬프트에는 인터넷에 연결되지 않은 모의 환경이라고 명시돼 있었지만 설정 오류로 실제 인터넷 연결이 허용됐으며, 클로드는 검색 과정에서 발견한 실제 시스템을 모의훈련의 일부로 판단했다.

메타 역시 지난 8월, 에이전트 특화 멀티모달 추론 모델인 ‘뮤즈 스파크 1.1(Muse Spark 1.1)’ 모델이 외부 평가 과정에서 제3자 시스템에 접근한 사실을 공개했다. 이와 관련해 메타는 평가 환경의 설정 오류로 모델에 의도하지 않은 인터넷 접근 권한이 부여됐고, 모델은 이를 통해 제3자 서비스의 보안 취약점을 악용했다고 밝혔다.


02. AI 모델은 왜 통제 범위를 벗어났는가

이번 사건의 핵심은 AI가 악의적인 의도를 가졌는지가 아니라, 목표 달성을 우선하는 AI의 특성과 이를 제한해야 할 시스템 통제의 실패가 결합했다는 점이다.

① 목표 달성을 우선하는 AI

AI 모델에는 평가 문제를 해결하라는 목표가 주어졌지만, 반드시 어떤 방법을 사용해야 하는지는 구체적으로 제한되지 않았다. 모델의 관점에서는 취약점을 분석해 정답을 도출하는 방법과 정답이 저장된 시스템에 접근하는 방법이 모두 목표를 달성할 수 있는 경로가 된다. 인간은 평가의 취지와 암묵적인 규칙을 이해한다. 정답을 직접 탈취하는 것은 문제를 해결한 것으로 인정되지 않는다고 판단한다. 그러나 AI는 이러한 암묵적인 의도보다 명시적으로 주어진 목표와 환경의 제약을 중심으로 행동한다. 목표는 구체적이지만 허용되는 행동의 범위가 정의되지 않으면 AI는 인간이 예상하지 못한 방법을 찾아낼 수 있다.

② 강화학습과 보상 해킹

강화학습(Reinforcement Learning)은 AI가 환경에서 행동하고, 그 결과로 보상이나 벌점을 받으면서 더 높은 누적 보상을 얻는 전략을 학습하는 방식이다. 명확한 정답을 학습하는 지도학습(Supervised Learning)과 달리, 강화학습은 시행착오를 통해 목표를 달성하는 방법을 찾아낸다. 문제는 인간이 설계한 보상 기준이 실제 의도를 완전하게 표현하지 못할 수 있다는 점이다. 이 경우 AI는 인간이 기대한 행동 대신 보상만 높일 수 있는 예상 밖의 방법을 찾아낸다. 이를 ‘보상 해킹(Reward Hacking)’ 또는 ‘명세 악용(Specification Gaming)’이라고 한다.

구글 딥마인드(Google DeepMind)의 블록 쌓기 실험을 대표 사례로 꼽을 수 있다. 딥마인드가 소개한 실험에서는 로봇 팔이 파란 블록 위에 빨간 블록을 쌓도록 학습됐다. 보상 함수는 파란 블록의 바닥면이 높아질수록 높은 점수를 주도록 구성됐다. 그러자 에이전트는 빨간 블록을 정상적으로 쌓는 대신 파란 블록을 뒤집어 바닥면의 높이만 높였다. AI는 주어진 보상 기준을 위반하지 않았다. 오히려 보상 함수를 정확하게 최적화했다. 다만 인간이 의도한 결과와 보상 함수에 표현된 목표가 달랐을 뿐이다.

이글루코퍼레이션 자율형 AI 시대의 보안과 통제
[그림 2] RGB 스태킹 강화 학습 (출처: Google DeepMind)

③ 장기적인 계획과 도구 사용 능력의 결합

기존의 생성형 AI는 사용자의 질문에 답변을 생성한 뒤 작업을 종료했다. 반면 에이전틱 AI는 하나의 목표를 여러 단계로 나누고, 필요한 도구를 선택해 실행하며, 그 결과를 바탕으로 다음 행동을 결정한다. 이러한 능력은 복잡한 보안 업무를 자동화하는 데 유용하지만, 동시에 공격 행동을 장시간 지속할 수 있게 한다. 모델은 한 번의 응답으로 끝나는 것이 아니라 수천 번의 도구 호출과 명령 실행을 통해 공격 경로를 점진적으로 확장할 수 있다. 특정 취약점 공격이 실패하더라도 오류 메시지와 시스템 반응을 분석해 다른 방법을 시도한다. 하나의 공격 방법을 차단하는 것만으로 전체 작업을 중단시키기 어려워지는 것이다.

이글루코퍼레이션 자율형 AI 시대의 보안과 통제
[그림 3] 생성형·에이전틱 AI의 진화 방향 (출처: 美 NIST)

④ 안전장치 완화와 평가 환경의 경계 실패

사이버 보안 평가에서는 모델의 실제 능력을 확인하기 위해 일반 서비스에서 적용되는 일부 안전장치를 완화할 수 있다. 위험한 명령을 모두 거부하면 취약점 탐색이나 침투 테스트 능력을 정확하게 측정하기 어렵기 때문이다. 그러나 안전장치를 완화한 모델에 외부 네트워크와 코드 실행 권한까지 제공하면 위험이 커진다. 모델의 능력은 평가 환경 안에 한정돼야 하지만, 네트워크와 인증 정보, 시스템 구성이 실제 서비스와 연결돼 있으면 평가 범위가 현실로 확장될 수 있다.

결국 이번 사고의 핵심은 단순한 모델 오작동이 아니다. 높은 자율성을 가진 AI에 과도한 권한을 부여하면서 평가 환경과 운영 환경을 충분히 분리하지 못한 시스템 설계의 문제다.


03. 에이전틱 AI가 바꾸는 보안의 구조

① 보조 도구에서 행위 주체로 변화하는 AI

과거 공격자는 AI를 피싱 문구 작성, 악성코드 생성, 취약점 검색과 같은 보조 도구로 활용했다. 공격의 각 단계는 사람이 직접 판단하고 실행했다. 에이전틱 AI는 공격 흐름 자체를 수행할 수 있다. 목표가 주어지면 정찰, 취약점 탐색, 공격 코드 작성, 권한 상승, 내부 이동과 데이터 수집을 연속적으로 수행할 수 있다. AI가 공격자의 생산성을 높이는 수준에서 벗어나 일정 범위의 공격 활동을 대리하는 단계로 발전하고 있는 것이다. 방어자가 감시해야 하는 대상도 달라진다. 기존에는 사용자 계정과 악성코드, 네트워크 트래픽을 중심으로 이상 행위를 탐지했다면 앞으로는 AI 에이전트가 어떤 목표를 부여 받았고, 어떤 도구와 권한을 사용하며, 어떤 순서로 행동하는지 까지 확인해야 한다.

② AI 모델 외부로 확장되는 공격 표면

에이전틱 AI 보안은 모델만 보호한다고 해결되지 않는다. 모델과 연결된 메모리, 도구, API, 데이터베이스, 인증 정보, 외부 서비스가 하나의 실행 환경을 구성한다. 외부 문서나 웹페이지에 삽입된 명령이 에이전트의 행동을 바꾸는 간접 프롬프트 인젝션, 악성 플러그인과 ***MCP(Model Context Protocol) 서버를 통한 정보 탈취, 메모리와 컨텍스트 오염, 과도한 계정 권한 사용 등이 새로운 공격 경로가 된다. 공급망의 어느 한 지점이 침해되면 에이전트가 신뢰하는 정보와 도구 전체에 영향을 줄 수 있다. 따라서 모델, 데이터, 도구, 실행 환경과 외부 서비스 사이의 신뢰 관계를 함께 관리해야 한다.

이글루코퍼레이션 자율형 AI 시대의 보안과 통제
[그림 4] 서비스 제공자, 패키지·프레임워크, 모델·데이터셋, 에이전트·MCP 서버로 확장되는 AI 공급망 (출처: 美 NIST)

③ OWASP가 제시한 에이전틱 AI 주요 위험

이와 관련해 OWASP(SW 보안 향상을 목표로 하는 비영리 단체)는 에이전틱 AI 애플리케이션에서 우선적으로 고려해야 할 보안 위험을 ‘OWASP Top 10 for Agentic Applications’로 정리했다.

이글루코퍼레이션 자율형 AI 시대의 보안과 통제
[표 2] OWASP 에이전틱 애플리케이션 10대 위협 (출처: OWASP, 재구성: 이글루코퍼레이션)

주요 위험에는 에이전트 목표 탈취, 도구 오용, 신원 및 권한 악용, 공급망 취약점, 예기치 않은 코드 실행, 메모리 오염, 에이전트 간 통신 조작, 연쇄적 장애와 로그 추적이 어려운 비인가 에이전트 등이 포함된다. 최근 발생한 사건들 역시 하나의 취약점만으로 설명하기 어렵다. 에이전트가 목표를 달성하는 과정에서 도구와 신원, 네트워크를 활용했고, 공급망과 외부 서비스로 실행 범위를 확장했다는 점에서 여러 에이전틱 AI 위험이 복합적으로 나타난 사례로 볼 수 있다.

④ 콘텐츠 통제에서 행동 통제로

기존 생성형 AI 보안은 모델이 유해한 답변을 생성하는지 확인하는 데 초점이 맞춰져 있었다. 위험한 질문을 거부하고 개인정보나 기밀정보가 답변에 포함되지 않도록 하는 방식이다. 그러나 에이전틱 AI에서는 답변보다 행동이 중요하다. 정상적인 문장을 생성하더라도 그 과정에서 내부 파일을 조회하고, 외부 서버에 접속하고, 명령을 실행할 수 있기 때문이다. 보안 통제의 단위 역시 프롬프트와 응답에서 목표, 계획, 도구 호출, 권한 사용, 네트워크 접속과 실행 결과로 확대돼야 한다. 최종 결과만 검사하는 방식으로는 수천 단계로 이어지는 에이전트의 행동을 통제하기 어렵다.


04. 제도 정비와 대응 방향

이처럼 AI 모델이 실제 시스템에 영향을 미칠 수 있는 수준으로 발전하면서 주요국은 고성능 AI에 대한 안전성 평가와 관리 체계를 강화하고 있다. 미국은 ‘26년 6월 첨단 AI 모델의 국가안보 및 사이버 보안 위험을 평가하기 위한 행정명령(Executive Order, 이하 EO)을 발표했으며, 한국도 AI 기본법과 시행령을 통해 일정 규모 이상의 고성능 AI에 안전성 확보 의무를 부과하고 있다.

그러나 모델의 규모나 학습 연산량만으로 실제 위험을 판단하는 데는 한계가 있다. 상대적으로 작은 모델도 코드 실행 도구, 외부 네트워크, 관리자 계정과 결합되면 실제 시스템에 높은 영향을 미칠 수 있기 때문이다. 향후 AI 안전성 평가는 모델 자체의 성능뿐 아니라 자율적으로 수행할 수 있는 작업의 길이, 외부 시스템 접근 범위, 사용 가능한 도구와 권한, 사람의 승인 없이 실행할 수 있는 행동까지 함께 고려해야 한다. 기업 역시 AI 모델에 대한 콘텐츠 필터링에 머무르지 않고 평가 환경과 권한, 도구, 네트워크, 공급망을 포함한 시스템 단위의 통제 체계를 마련해야 한다.

이글루코퍼레이션 자율형 AI 시대의 보안과 통제
[표] 에이전틱 AI 환경의 주요 보안 대응 방안 (출처: 이글루코퍼레이션)

특히 사이버 보안 평가를 수행하는 AI는 일반적인 테스트 도구보다 높은 수준의 격리와 감시가 필요하다. 취약점 탐색과 코드 실행 능력을 가진 모델에 외부 네트워크 접근까지 허용할 경우 평가 환경 자체가 실제 공격의 출발점이 될 수 있기 때문이다. 평가 시스템은 운영 시스템과 계정, 인증 정보, 데이터베이스, 로그 저장소까지 분리하고, 모델이 접근할 수 있는 외부 목적지를 최소화해야 한다. 또한 권한은 에이전트 단위가 아니라 개별 작업과 행동 단위로 부여해야 한다. 새로운 외부 도메인 접속, 자격 증명 조회, 실행 파일 생성, 관리자 명령 실행, 대규모 데이터 전송과 같이 위험도가 높은 행동은 사람의 승인이나 추가 인증을 거쳐야 한다. 작업이 종료되면 부여된 권한과 토큰이 자동으로 회수되도록 구성할 필요가 있다.

AI 에이전트의 최종 결과만 확인하는 방식도 충분하지 않다. 정상적인 결과를 생성했더라도 그 과정에서 내부 시스템을 탐색하거나 불필요한 권한 상승을 시도했을 수 있다. 따라서 에이전트가 어떤 도구를 호출했고, 어떤 파일과 시스템에 접근했으며, 실패 후 어떤 대안을 선택했는지 까지 추적해야 한다. 또한 예상하지 못한 외부 접속이나 반복적인 권한 상승, 감시 기능 우회, 로그 삭제 시도가 확인되면 작업을 즉시 중단할 수 있어야 한다.

이글루코퍼레이션 자율형 AI 시대의 보안과 통제
[표] 에이전틱 AI 핵심 보안 조치(Key Mitigations) (출처: 美 NIST, 재구성: 이글루코퍼레이션)

美 국립표준기술연구소(NIST)는 에이전틱 AI 보호를 위해 입력과 도구의 사용 범위를 제한하고, 자격 증명과 메모리를 보호하며, 에이전트의 행동과 에이전트 간 통신을 지속적으로 감시할 것을 권고하고 있다. 아울러 광범위한 권한이나 검증되지 않은 외부 도구를 제공하지 않고, 이상 행위가 발생하면 실행을 중단하고 격리할 수 있는 대응 체계를 갖춰야 한다고 강조한다. 결국 에이전틱 AI의 안전성은 모델을 얼마나 정교하게 통제하는가 만으로 결정되지 않는다. 모델이 어떤 목표를 부여 받고, 어떤 도구와 권한을 사용하며, 어떤 환경에서 실행되는지를 함께 관리해야 한다. 규제와 기업의 보안 체계 역시 모델 중심의 평가에서 실제 행동과 시스템 영향을 중심으로 전환될 필요가 있다.


05. 마무리

일련의 사례 (오픈AI, 앤트로픽, 메타의 AI 모델이 보안 평가 과정에서 외부 시스템에 무단으로 접근)는 AI가 자의식을 갖고 인간의 통제를 거부한 사건이 아니다. 발생 경로에는 차이가 있지만, 높은 자율성을 가진 AI에 불완전한 목표와 과도한 권한이 부여되고 평가 환경과 실제 시스템의 경계가 충분히 분리되지 않으면서 발생한 시스템 보안 문제로 볼 수 있다. AI는 인간의 암묵적인 의도보다 명시된 목표와 환경을 기준으로 행동한다. 목표 달성 방법이 구체적으로 제한되지 않거나 실제 시스템이 평가 범위에 포함되면, 모델은 이를 정상적인 작업 경로로 판단할 수 있다. 따라서 모델 자체의 안전장치 뿐만 아니라 목표와 보상, 도구, 권한, 네트워크 접근 범위를 함께 통제해야 한다.

에이전틱 AI가 확산되면서 보안의 중심도 모델이 무엇을 말하는지에서 무엇을 할 수 있는지로 이동하고 있다. 기업은 답변의 유해성뿐 아니라 작업 계획, 도구 호출, 권한 사용, 외부 접속과 전체 실행 과정을 지속적으로 기록하고 감시해야 한다. 향후 AI 보안의 핵심은 모델의 능력을 단순히 제한하는 데 있지 않다. AI가 현실 시스템과 상호작용하는 범위를 명확히 설정하고, 예상하지 못한 행동을 탐지·중단·복구할 수 있는 통제 체계를 마련하는 데 있다.


06. 참고자료

AI ‘강화학습’의 역습 … 목표 달성하려 해킹까지 한다, 매일경제
https://m.mk.co.kr/amp/12115310

Specification gaming: the flip side of AI ingenuity, Google DeepMind
https://deepmind.google/blog/specification-gaming-the-flip-side-of-ai-ingenuity/

Agentic Security- Emerging Threats, Mitigations and Challenges, NIST
https://csrc.nist.gov/Presentations/2026/agentic-ai-emerging-threats-mitigations-and-cha

*ExploitGym: AI 에이전트가 SW 취약점을 분석하고 실제 작동하는 공격 코드(Exploit)를 자율적으로 생성할 수 있는지 평가하기 위해 개발된 대규모 벤치마크 테스트 플랫폼

**Artifactory: 개발 과정에서 만들어지는 빌드 결과물, 라이브러리, 패키지, 바이너리 파일 등을 중앙에서 안전하게 저장하고 관리하는 저장소(Repository) 관리 시스템

***MCP: AI 모델이 외부 데이터 소스나 도구에 안전하고 표준화된 방식으로 연결할 수 있도록 돕는 개방형 통신 규약

💌 후속 콘텐츠, 계속 받아보세요 ▶