LLM의 숨은 위협, 간접 프롬프트 인젝션 이해하기
간접 프롬프트 인젝션(Indirect Prompt Injection, IPI)은 LLM 연동 애플리케이션이 외부 데이터를 처리하는 방식을 조작해 악의적으로 만든 입력을 명령으로 잘못 해석하게 만드는 공격입니다.
LLM은 정보 검색, 문서 요약, 코드 생성 같은 작업에 자연스럽게 스며들며 우리 삶과 일하는 방식을 바꿔놓고 있습니다. 인간의 언어를 이해하고 생성하는 능력 덕분에 불과 몇 년 전만 해도 불가능해 보였던 혁신이 현실이 됐습니다. 그러나 강력한 능력에는 그만큼 큰 위험이 따릅니다. 이런 시스템이 널리 퍼질수록 뜻밖의 해로운 방식으로 악용될 수 있는 취약점도 함께 드러납니다.
그중에서도 특히 까다로운 위협이 간접 프롬프트 인젝션(Indirect Prompt Injection, IPI)입니다. LLM이 외부 데이터를 다루는 방식을 조작해 악의적으로 만든 입력을 명령으로 잘못 해석하게 만드는 공격입니다. 전통적인 공격과 달리 IPI는 시스템에 직접 접근할 필요가 없습니다. 대신 LLM이 데이터와 지시를 구분하는 과정에 숨어 있는 모호함을 파고듭니다. 이 공격은 좀처럼 눈에 띄지 않지만 LLM의 결정적 약점을 드러냅니다. 민감하고 중요한 애플리케이션에 LLM이 점점 더 많이 쓰일수록 그 위험은 커집니다.
이번 글에서는 이 새로운 위협을 짚어 보기 위해 IPI의 작동 원리와 잠재적 영향, 대응책을 다룬 최근 연구 세 편의 통찰을 살펴봅니다. 세 논문은 IPI가 실제 상황에서 어떻게 작동하고 어떤 문제를 던지는지, 이를 효과적으로 막으려면 무엇을 해야 하는지 짚어 줍니다.
새로운 보안 위협, 간접 프롬프트 인젝션
LLM은 검색, 문서 요약, 코드 완성, API 호출 같은 작업에 통합되면서 우리 업무와 일상을 크게 바꿔 놓았습니다. 하지만 LLM이 폭넓게 도입되면서 심각한 보안 취약점도 함께 따라왔습니다. 예를 들어 프롬프트 인젝션(Prompt Injection, PI)은 LLM의 자연어 처리 특성을 악용해 본래 의도된 지시를 무력화하고 공격자의 명령을 실행하도록 강제하는 방식으로, 기존 시스템에 심각한 위협이 됩니다. 최근에는 이보다 더 정교하고 은밀한 변종인 간접 프롬프트 인젝션(Indirect Prompt Injection, IPI)이 등장했습니다. 이 새로운 공격은 LLM 연동 애플리케이션이 외부 데이터를 처리하는 방식을 조작해 그 데이터를 명령처럼 보이게 만들고 모델을 간접적으로 제어합니다.
IPI는 LLM이 명령처럼 보이도록 교묘하게 조작된 외부 데이터를 처리할 때 발생합니다. 예컨대 검색된 데이터에 "이 명령을 실행하라" 같은 지시가 들어 있으면, LLM은 이를 단순한 데이터가 아니라 실행해야 할 명령으로 해석할 수 있습니다. IPI의 핵심은 공격자가 시스템에 직접 연결하지 않고도 원격으로 모델을 조작할 수 있다는 점입니다. 데이터와 명령의 경계가 흐려지는 LLM의 구조적 취약점을 파고듭니다.
IPI 공격 기법
IPI 공격은 크게 네 가지 방식으로 나눌 수 있습니다.
수동적 인젝션(Passive injection)은 공격자가 악성 데이터를 인터넷 곳곳에 뿌려두고 LLM이 검색이나 처리 과정에서 이를 마주치도록 유도하는 방식입니다. 예를 들어 검색 엔진 최적화(SEO)를 이용해 악성 웹사이트를 검색 결과 상단에 올리거나, 소셜 미디어 게시물에 유해한 프롬프트를 심어두면 LLM이 이를 알지 못한 채 처리하게 됩니다.
능동적 인젝션(Active injection)은 이메일이나 메시지 같은 경로로 악성 데이터를 직접 전달하는 방식입니다. 예컨대 LLM을 사용하는 이메일 클라이언트가 유해한 프롬프트가 담긴 첨부 파일을 처리하는 경우가 이에 해당합니다.
사용자 유도형 인젝션(User-driven injection)은 사회공학 기법을 활용해 사용자가 직접 악성 프롬프트를 입력하도록 속이는 방식입니다. 공격자는 "이 명령을 한번 입력해 보세요!" 같은 문구에 유해한 명령을 숨겨두고 사용자가 이를 복사해 LLM에 붙여넣도록 유인할 수 있습니다.
은닉형 인젝션(Hidden prompt injection)은 난독화, 다단계 공격, 인코딩 등을 이용해 프롬프트를 탐지하기 어렵게 만드는 방식입니다. 공격자는 악성 데이터를 HTML 주석에 숨기거나 Base64 인코딩으로 유해한 명령을 감춰 LLM이 이를 해독하고 실행하도록 유도할 수 있습니다.
IPI의 주요 위협
IPI가 초래하는 위협은 정보 수집부터 서비스 가용성 저하까지 걸쳐 있습니다.
정보 수집: 공격자는 검색 결과처럼 자주 접근하는 위치에 악성 데이터를 배치해 LLM이 이를 처리하면서 사용자의 민감한 정보를 빼내도록 만들 수 있습니다.
사기: LLM은 피싱 이메일을 생성하거나 악성 링크를 퍼뜨리는 데 악용될 수 있습니다. LLM의 출력은 신뢰할 만하게 보이기 때문에, 공격자가 사용자를 유해한 웹사이트로 유인하기가 더 쉬워집니다.
침투: IPI는 무단 접근을 가능하게 하거나 백도어를 만들어 시스템 인프라를 손상시킬 수 있습니다.
악성코드 확산: LLM은 조작된 이메일 클라이언트나 자동화 시스템을 거쳐 악성코드를 퍼뜨리는 매개체가 될 수 있습니다.
콘텐츠 조작: 공격자는 문서 요약이나 검색 결과 같은 LLM 출력을 왜곡해 잘못된 정보나 편향된 판단을 유도할 수 있습니다.
가용성 저하: 공격자는 계산 비용이 큰 작업으로 LLM에 과부하를 걸어 서비스 지연이나 서비스 거부(DoS) 상태를 일으킬 수 있습니다.
IPI의 심각성
IPI는 단순한 기술적 결함이 아닙니다. LLM의 신뢰성과 안전성을 근본부터 뒤흔드는 문제입니다. LLM의 출력은 설득력 있고 권위 있어 보이기 때문에 사용자가 그 응답을 지나치게 믿는 경우가 많습니다. 이런 과신은 IPI의 위험을 더욱 키웁니다. 인간 피드백 기반 강화학습(RLHF) 같은 현재의 보안 조치로 일부 위협은 완화할 수 있지만 난독화나 다단계 공격, 인코딩된 명령 같은 교묘한 기법 앞에서는 여전히 취약합니다.
이런 과제를 해결하려면 LLM 연동 애플리케이션의 설계 단계에서 데이터와 명령의 경계를 명확히 긋는 일이 무엇보다 중요합니다. 유해한 명령을 실시간으로 탐지하고 차단하는 시스템도 반드시 필요합니다. LLM이 내놓은 출력을 해석하고 검증하기 쉽게 만드는 일도 신뢰성과 안전성을 지키는 데 핵심입니다.
간접 프롬프트 인젝션 벤치마크
INJECAGENT 벤치마크는 LLM 에이전트가 간접 프롬프트 인젝션(IPI) 공격에 노출됐을 때 드러나는 취약점을 깊이 파고든 연구입니다. 이 벤치마크는 다양한 실제 시나리오를 반영해 설계한 1,054개의 테스트 케이스로 구성됩니다.
평가 결과는 LLM 에이전트가 얼마나 취약한지를 잘 보여줍니다. 대부분의 에이전트는 IPI 공격에 상당히 취약했으며 특히 비정형이거나 동적인 콘텐츠가 포함된 시나리오에서 그 취약성이 두드러졌습니다. GPT-4와 Llama2–70B 같은 모델은 높은 공격 성공률을 보였는데, 특정 조건에서는 80%를 넘는 경우도 많았습니다.
원데이 취약점이라는 새로운 과제
최근 연구에 따르면 GPT-4 같은 LLM 에이전트는 원데이(One-Day) 취약점을 스스로 악용할 수 있습니다. 연구진은 실제 원데이 취약점 15건을 분석해 LLM 에이전트가 이를 악용할 수 있는 잠재력을 평가했습니다. 그 결과 GPT-4는 CVE 설명이 주어졌을 때 87%라는 높은 성공률을 기록했습니다.
원데이 취약점이 초래하는 위험은 여러 갈래로 나타납니다.
- 공격자는 LLM을 이용해 민감한 사용자 데이터를 빼내거나 노출시킬 수 있습니다
- LLM은 설득력 있는 피싱 이메일을 생성하는 데 악용될 수 있습니다
- 공격자는 LLM을 이용해 시스템에 침투하고 백도어를 만들 수 있습니다
- LLM은 악성코드 확산의 매개체가 될 수 있습니다
- 공격자는 LLM에 과부하를 걸어 시스템 성능을 떨어뜨릴 수 있습니다
결론
IPI의 등장은 아무리 첨단 기술이라도 그에 따르는 과제가 있음을 분명히 일깨워 줍니다. LLM이 새로운 가능성을 계속 열어가는 만큼 그 취약점에도 그만큼 주의를 기울여야 합니다. 이것은 우리가 업무와 소통, 의사결정에 의존하는 시스템에 실제로 영향을 줄 수 있는 현실의 문제입니다.
이런 위협에 대응하려면 신중한 행동이 필요합니다.
- 개발자는 견고한 안전장치를 갖춘 LLM 연동 애플리케이션을 설계해야 합니다
- 조직은 잠재적 공격을 탐지하고 완화할 수 있는 모니터링 시스템을 갖춰야 합니다
- 이런 기술이 어떻게 작동하는지 깊이 이해할수록 더 책임감 있고 안전하게 사용할 수 있습니다
빠르게 변하는 이 환경에서도 한 가지는 분명합니다. LLM의 잠재력이 큰 만큼 그에 못지않은 경계심이 필요합니다. 지금 이 과제에 정면으로 대응한다면, 우리 세상을 바꿔 가는 이 기술을 신뢰와 보안이라는 토대 위에서 진보의 도구로 지켜낼 수 있습니다.

