보안정보

전문화된 보안 관련 자료, 보안 트렌드를 엿볼 수 있는
차세대 통합보안관리 기업 이글루코퍼레이션 보안정보입니다.

[보안 101] AI 레드티밍(AI Red Teaming)이란 무엇인가요?

2026.08.31

295

이글루코퍼레이션 [보안 101] AI 레드티밍(AI Red Teaming)이란 무엇인가요?
[보안 101] 더보기 ▶

매달 하나의 주제를 선정해 질문을 던지며, 보안에 한 걸음 더 가까이 다가갑니다.
복잡하고 어렵게 느껴질 수 있는 보안 지식을 초보자도 쉽게 이해할 수 있도록, 기초 개념부터 최신 이슈까지 차근차근 풀어갑니다.

보안이 알고 싶을 땐, 보안 101으로 시작해 보세요.
물음표를 느낌표로 바꾸는 여정을 이글루코퍼레이션이 함께합니다.

생성형 AI를 넘어 AI 에이전트의 활용이 확대되면서 AI는 단순히 질문에 답하는 도구에서 벗어나 기업의 데이터와 시스템에 접근하고 다양한 업무를 직접 수행하는 주체로 진화하고 있습니다. 할 수 있는 일이 늘어난 만큼, AI를 노리는 보안 위협의 범위도 함께 넓어졌습니다. 공격자는 악의적인 명령을 입력해 AI의 안전장치를 우회하거나, 외부 문서와 웹페이지 등에 숨겨진 지시를 통해 AI의 행동을 조작할 수 있습니다. AI가 이메일, 데이터베이스, 업무 시스템 등과 연결되어 있다면, 이러한 공격은 정보 유출이나 권한 오남용과 같은 실제 보안 사고로 이어질 수도 있습니다.

기존의 보안 체계만으로는 이처럼 AI의 특성에서 비롯되는 새로운 위험을 충분히 확인하기 어렵습니다. 정상적인 환경에서는 안전하게 동작하던 AI가 의도적으로 설계된 공격 입력이나 예상하지 못한 상황에서는 전혀 다른 결과를 내놓을 수 있기 때문입니다. 이에 AI 시스템을 실제 공격자와 같은 관점에서 의도적으로 공격하고, 사전에 취약점과 위험 요소를 찾아내는 ‘AI 레드티밍(AI Red Teaming)’​의 중요성이 높아지고 있습니다.

01. AI 레드티밍이란?


AI 레드티밍(AI Red Teaming)은 공격자의 관점에서 AI 모델과 이를 활용하는 시스템을 의도적으로 테스트해 잠재적인 취약점과 위험 요소를 찾아내는 일련의 활동을 의미합니다. 다양한 공격 기법과 시나리오를 적용해 AI가 의도하지 않은 방식으로 동작하는지, 안전장치가 우회될 가능성은 없는지, 민감 정보가 노출되거나 허용되지 않은 행동을 수행할 가능성은 없는지 등을 점검합니다. 이를 통해 보안 취약점뿐만 아니라 AI의 안전성과 신뢰성을 저해할 수 있는 다양한 위험을 사전에 식별합니다.

기존 레드티밍이 서버, 네트워크, 애플리케이션 등 IT 환경의 취약점을 실제 공격과 유사한 방식으로 점검하는 활동이라면, AI 레드티밍은 그 대상을 AI 시스템까지 확장해 AI 특유의 취약점과 위험을 검증합니다. AI 레드티밍의 대상 역시 AI 모델 자체에만 한정되지 않습니다. 프롬프트와 데이터, AI 애플리케이션은 물론 AI가 연결된 API와 외부 도구, 계정 및 권한 등 AI 시스템의 동작에 영향을 미치는 구성요소 전반​을 대상으로 합니다.

즉 AI 레드티밍은 단순히 AI 모델의 취약점을 찾는 데 그치지 않고 공격자가 AI의 특성과 데이터 흐름, 시스템 간 연결 구조를 악용했을 때 어떤 위험이 발생할 수 있는지를 실제 환경과 유사한 조건에서 사전에 검증하는 활동​이라고 할 수 있습니다.

02. AI 레드티밍에서는 무엇을 점검하나요?


AI 레드티밍에서는 AI 시스템이 실제 공격 상황에서 어떻게 악용될 수 있는지를 확인하기 위해 다양한 공격·위협 시나리오를 적용합니다. 기존 시스템의 기술적 취약점뿐만 아니라 AI가 자연어 명령을 해석하고 데이터를 활용하며 외부 시스템과 상호작용하는 과정에서 발생할 수 있는 AI 특유의 위험까지 폭넓게 검증합니다. 주요 점검 영역은 다음과 같습니다.

① 프롬프트 및 입력 조작

공격자가 악의적으로 설계한 입력을 통해 AI의 지시나 행동을 조작할 수 있는지 확인합니다. 대표적으로 악성 지시를 주입해 AI의 행동을 공격자의 의도대로 바꾸는 프롬프트 인젝션(Prompt Injection)과 AI에 설정된 안전장치나 정책을 우회해 원래 허용되지 않은 답변을 끌어내는 탈옥(Jailbreak) 등이 있습니다. 웹페이지나 문서 등 외부 데이터에 악성 지시를 숨겨 AI가 이를 정상적인 명령으로 인식하도록 만드는 간접 프롬프트 인젝션도 주요 점검 대상입니다.

② 민감정보 및 모델 정보 노출

AI와의 상호작용 과정에서 개인정보나 기업 내부 데이터, 시스템 프롬프트 등 외부에 공개되어서는 안 되는 정보가 노출되는지 확인합니다. 악의적인 질의를 통해 학습 데이터나 검색에 활용되는 원문 데이터가 유출되는지 확인하고, 접근 통제 미흡 등으로 시스템 프롬프트나 모델의 설정·가중치 등 모델 관련 정보가 외부로 노출될 가능성도 점검합니다.

③ 모델 및 데이터 공격

AI 모델과 이를 학습·운영하는 데이터 자체를 겨냥한 공격도 점검합니다. 학습·평가 데이터에 악성 데이터를 주입해 모델의 판단과 결과를 왜곡하는 데이터 포이즈닝(Data Poisoning), 모델과 반복적으로 상호작용해 모델의 동작 특성을 파악하고 기능을 복제하려는 모델 추출(Model Extraction) 등이 대표적입니다. 또한 모델의 가중치나 설정을 변조해 출력 결과를 조작하는 모델 포이즈닝(Model Poisoning)과 같은 공격도 점검 대상에 포함됩니다.

④ AI 에이전트 및 외부 시스템 악용

AI 에이전트가 API, 데이터베이스, 이메일, 업무 시스템 등과 연결된 경우에는 AI에 부여된 권한이나 연동된 외부 도구가 공격에 악용될 가능성을 확인합니다. 대표적으로 악성 프롬프트를 통해 AI 에이전트의 의사결정을 왜곡하고, 사용자가 의도하지 않은 행동을 수행하도록 유도하는 에이전트 하이재킹(Agent Hijacking)이 있습니다. 또한 에이전트가 사용하는 도구의 권한 설정이나 검증 체계가 미흡해 정보 유출 또는 시스템 오작동이 발생하거나, 서버·컨테이너를 비롯해 외부 모델, 라이브러리, 플러그인, 추론 엔진 등 AI 시스템을 구성·지원하는 요소의 취약점이 공격 경로로 악용될 가능성도 함께 점검합니다.

이처럼 AI 레드티밍은 개별 모델의 취약점만을 확인하는 것이 아니라 입력과 데이터, 모델, 에이전트, 외부 도구와 인프라까지 AI 시스템 전반에서 발생할 수 있는 공격 경로와 그 영향을 함께 검증하는 데 초점​을 둡니다.

03. AI 레드티밍은 언제 수행해야 하나요?


AI 레드티밍은 특정 시점의 안전성을 확인하는 일회성 테스트가 아닙니다. AI 시스템은 개발과 배포, 운영 과정에서 지속적으로 변화하며 모델, 프롬프트, 데이터, 외부 연동 구조의 작은 변화만으로도 새로운 취약점이나 예상하지 못한 동작이 나타날 수 있습니다. 따라서 개발 초기부터 운영 이후까지 AI 시스템의 수명주기 전반에 레드티밍을 적용하고, 시스템 변화에 따라 반복적으로 검증하는 것이 중요합니다. KISA의 『AI 보안 레드티밍 가이드』 역시 AI 레드티밍을 개발·배포·모니터링 단계에 통합해 각 단계의 목적과 시스템 상태에 맞게 수행할 것을 제시하고 있습니다.

① 개발 단계

모델과 서비스를 설계·구현하는 과정부터 잠재적인 공격 경로와 위험 요소를 점검합니다. 학습·평가 데이터와 모델, 프롬프트, 가드레일 등이 공격에 취약하지 않은지 확인하고, 테스트에서 발견된 문제를 설계와 개발 과정에 다시 반영해 취약점이 서비스 구조에 고착되기 전에 위험을 줄이는 데 초점을 둡니다.

② 배포 단계

서비스 출시 전에는 개별 모델을 넘어 AI 애플리케이션 전체가 실제 환경에서 안전하게 동작하는지 종합적으로 검증합니다. 모델과 프롬프트뿐만 아니라 API, 외부 도구, AI 에이전트, 접근 권한, 데이터 흐름과 연계 시스템 등을 함께 살펴보고, 실제 공격과 유사한 상황에서도 안전장치와 보안 정책이 의도한 대로 작동하는지 확인합니다.

③ 모니터링 단계

서비스 운영 이후에도 새로운 공격 기법과 이상 징후를 지속적으로 점검하고, 시스템 변화로 인해 새로운 위험이 발생하지 않는지 재검증해야 합니다. 특히 모델 업데이트나 재학습, 시스템 프롬프트·데이터 변경, 새로운 외부 도구 연동 등이 발생하면 기존의 보안 상태가 그대로 유지된다고 보기 어렵습니다. AI 시스템에 의미 있는 변화가 발생할 때마다 다시 레드티밍을 수행하고 새롭게 발견된 위험을 보완하는 반복적인 검증 체계​가 필요합니다.

04. AI 레드티밍은 어떤 프로세스로 진행되나요?


AI 레드티밍은 단순히 몇 차례의 공격을 통해 취약점을 찾는 데서 끝나지 않습니다. 점검 목표와 범위를 정하고, 실제 위협을 반영한 공격 시나리오를 설계한 뒤 테스트를 수행하고, 발견된 위험을 개선·재검증하는 과정​으로 진행됩니다.

① 목표 및 범위 설정

먼저 어떤 AI 모델과 서비스, 데이터, 외부 연동 시스템을 대상으로 무엇을 검증할지 정합니다. 서비스 구조와 데이터 흐름을 파악해 공격자가 접근하거나 악용할 수 있는 지점을 식별하고 점검 대상과 제외 대상, 허용되는 공격 수준 등을 구체화합니다. 이를 바탕으로 이후 공격 시나리오와 평가 기준을 설정합니다.

② 위협 시나리오 설계 및 환경 준비

실제 공격자의 목적, 접근 권한, 활용 가능한 공격 기법 등을 가정해 현실적인 위협 시나리오를 설계합니다. 프롬프트 인젝션이나 정보 유출, 에이전트 악용 등 예상되는 공격 경로와 성공 여부를 판단할 기준을 구체화하고, 테스트로 인해 실제 서비스나 데이터에 피해가 발생하지 않도록 적절한 환경과 계정·권한·도구를 준비합니다.

③ 공격 수행 및 영향 분석

설계한 시나리오에 따라 실제 공격과 유사한 방식으로 AI 시스템을 테스트합니다. 이때 공격의 성공 여부만 확인하는 것이 아니라 민감 정보 노출, 안전장치 우회, 권한 오남용은 물론 AI의 행동이 외부 시스템이나 실제 업무에 어떤 영향을 미치는지까지 함께 분석​합니다. AI 레드티밍에서는 개별 모델보다 모델과 애플리케이션, 외부 시스템이 연결된 전체 환경을 함께 살펴보는 것이 중요합니다.

④ 개선 및 재검증

발견된 취약점은 영향도와 악용 가능성 등을 기준으로 우선순위를 정해 개선합니다. 시스템 프롬프트와 가드레일을 보완하거나 접근 권한을 조정하고, 데이터 보호·모니터링 체계를 강화한 뒤 기존 공격 시나리오를 다시 수행해 문제가 제대로 해결됐는지 확인합니다. 또한 보안 강화 조치로 인해 AI의 성능이나 서비스 이용성이 지나치게 저하되지는 않았는지도 함께 검증합니다.

05. AI 레드티밍, 왜 지금 필요할까요?


AI 기술이 빠르게 발전할수록 보안의 중요성 또한 날로 커져갑니다. 아무리 뛰어난 성능과 자율성을 갖춘 AI라도 예상하지 못한 취약점이나 공격에 노출된다면, 기업의 데이터와 시스템을 안심하고 맡기기 어렵기 때문입니다.

그러나 문제는 AI가 만들어내는 위험의 상당 부분이 기존 보안 체계만으로는 포착되지 않는다는 점입니다. 정상적인 입력처럼 보이는 프롬프트가 시스템의 규칙을 무력화하고, 학습 데이터에 스며든 오염이 모델의 판단을 왜곡하며, 권한을 위임 받은 에이전트가 의도하지 않은 행동으로 이어지기도 합니다. 코드의 결함이 아니라 AI의 작동 방식 자체에서 비롯되는 위험이기에 공격자의 시선으로 직접 시도해 보지 않으면 알아채기 어렵습니다.

AI 레드티밍은 바로 이 지점을 겨냥한 선제적 보안 활동입니다. 취약점을 발견하는 데 그치지 않고 해당 공격이 실제 환경에 미칠 수 있는 영향까지 확인하며 개선 조치가 제대로 작동하는지를 지속적으로 검증합니다. 모델이 갱신되고 프롬프트가 수정되고 에이전트의 권한이 확장되는 동안 AI 시스템의 위험 지형도 함께 변하기 때문에 한 번의 점검이 아닌 여러 번의 반복 검증이 필요합니다.

결국 AI 시대의 경쟁력은 AI를 얼마나 빠르게 도입하느냐와 함께 얼마나 안전하고 신뢰할 수 있게 운영하느냐에 달려 있습니다. 보안은 AI 활용을 가로막는 제약이 아니라 더 넓고 과감한 활용을 가능하게 하는 전제 조건입니다. AI를 신뢰할 수 있게 만드는 일은, AI를 가장 먼저 의심해 보는 것에서 시작됩니다.

💌 후속 콘텐츠, 계속 받아보세요 ▶