웹 에이전트를 겨냥한 간접 프롬프트 인젝션 공격
EIA, AdvWeb, WIPI 공격 기법이 VLM 기반 웹 에이전트의 취약점을 어떻게 파고드는지 살펴보고, 웹 환경과 상호작용하는 AI 시스템의 심각한 보안 우려를 짚어봅니다.
들어가며
최근 몇 년 사이 웹 에이전트는 생산성과 효율을 끌어올리는 핵심 도구로 자리 잡았습니다. LLM과 VLM으로 구동되는 이런 에이전트는 웹 환경에서 사용자의 상호작용을 해석하고, 요청에 따라 작업을 알아서 수행하도록 설계됐습니다. 항공권 예약과 재무 관리, 의료 상담 제공까지 웹 에이전트가 파고든 영역은 일상과 비즈니스 곳곳으로 점점 더 깊이 스며들고 있습니다.
이런 발전의 이면에는 심각한 보안 취약점도 함께 드러났습니다. 웹 에이전트가 사용자 데이터를 다루는 동시에 외부 웹 콘텐츠와 상호작용하는 탓입니다. 공격자가 악의적으로 조작해 둔 환경과 에이전트가 맞닥뜨리면, 개인식별정보가 유출되거나 에이전트가 의도된 동작에서 벗어나는 심각한 문제로 이어질 수 있습니다.
이 글에서는 웹 에이전트의 보안 취약점을 깊이 들여다보고, 고도화된 공격 기법 세 가지를 살펴봅니다. EIA, AdvWeb, WIPI입니다.
EIA: 환경 인젝션 공격
환경 인젝션 공격, 곧 EIA는 VLM 기반 웹 에이전트의 취약점을 파고들도록 설계된 혁신적인 공격 기법입니다. 특히 악의적인 환경과의 상호작용을 표적으로 삼습니다.
핵심 메커니즘
EIA는 설득형 지시문을 HTML 환경에 주입해, 웹 에이전트가 이 악의적 지시문을 정상적인 작업 명령으로 해석하도록 조작합니다. 공격자는 aria-label이나 input placeholder, 숨김 속성처럼 특정 HTML 필드를 골라 지시문을 심어 둡니다. 이 지시문은 opacity 값을 0으로 맞춰 화면에서는 아예 보이지 않습니다.
공격 전략
- 폼 인젝션: 입력 필드나
aria-label속성을 이용해 PII를 빼냅니다. - 미러 인젝션: 정상 요소를 악의적 요소로 복제합니다.
결과
- 미러 인젝션으로 특정 PII 추출에서 최대 70%의 성공률 달성
- Relaxed-EIA는 전체 작업 요청 추출에서 16%의 성공률 기록
- VirusTotal 같은 전통적 보안 도구의 탐지를 회피
AdvWeb: 제어 가능한 블랙박스 공격
AdvWeb은 범용 웹 에이전트의 취약점을 파헤치는 블랙박스 제어 공격 프레임워크입니다. 은밀함과 제어력은 그대로 유지하면서 적대적 HTML 콘텐츠를 찾는 탐색 공간을 좁힙니다.
주요 특징
- RLAIF 최적화: AI 피드백 기반 강화학습으로 적대적 문자열을 효율적으로 다듬습니다
- 자동 생성: 수작업 입력에 기대는 정도를 최소화합니다
- 제어 가능성: 공격자가 프롬프트에서 특정 부분만 손봐도 목표를 바꿀 수 있습니다
결과
- GPT-4V 기반 SeeAct에서 97.5%의 공격 성공률 달성
- 목표를 바꿨을 때도 98.5%의 성공률 유지
- 강화학습을 적용해 성능이 69.5%에서 97.5%로 향상
WIPI: 웹 간접 프롬프트 인젝션
WIPI는 웹 위협의 새로운 국면을 보여줍니다. 실행 가능한 코드에 기대는 기존 공격과 달리, WIPI는 외부 웹 콘텐츠에 심어 둔 자연어 프롬프트만으로 웹 에이전트를 조작합니다.
공격 단계
- 수집 단계: 웹 에이전트가 외부 웹사이트에서 콘텐츠를 수집합니다
- 실행 단계: 악의적 프롬프트가 담긴 콘텐츠가 그대로 처리됩니다
프레임워크 설계
- 악의적 프롬프트를 웹 페이지 앞부분에 배치
- 문장과 문단 단위로 반복해 노출도를 강화
- 카운터 프롬프트로 시스템 보호 장치를 무력화
- 은닉 기법: 글꼴 크기 축소, 배경과 같은 색상, opacity 조정
결과
- 블랙박스 환경에서 평균 공격 성공률 90% 초과
- 오픈소스 웹 에이전트에서는 100%의 성공률 달성
- 탈옥 기법을 더하면 공격 성공률이 **100%**에 도달
- VirusTotal이나 IPQS 같은 유명 보안 도구도 WIPI를 잡아내지 못함
시사점과 위험
세 연구는 모두 치명적인 보안 취약점을 드러냅니다.
프라이버시 위험
- 환경을 조작하면 민감한 사용자 데이터가 빠져나갈 수 있음
- 폼 인젝션과 미러 인젝션 공격에 따른 PII 유출
시스템 조작
- 웹 에이전트가 의도하지 않은 행동을 하도록 조종될 수 있음
- 공격자가 내부 시스템을 몰라도 목표를 이룰 수 있음
탐지의 어려움
- 전통적 보안 도구는 이런 공격 앞에서 무력함
- 은닉 기법 탓에 탐지가 극도로 어려움
방어 권고 사항
이 취약점에 대응하려면 다음이 필요합니다.
- 문맥 인지 검증: 악의적 프롬프트와 정상 지시문을 가려내는 시스템을 구축합니다
- 보안 중심 학습: 보안에 더 큰 비중을 두어 LLM을 학습시킵니다
- 입력 정제: 외부 콘텐츠를 걸러낼 견고한 필터링을 마련합니다
- 행동 모니터링: 웹 에이전트의 활동을 감시할 이상 탐지 시스템을 배포합니다
맺음말
이들 연구는 LLM과 VLM 기반 웹 에이전트가 발전할수록 보안 강화도 그만큼 절실하다는 점을 강조합니다. 사용자 프라이버시를 지키고 시스템의 신뢰성을 유지하려면 지금보다 더 정교하고 견고한 보안 기술이 필요합니다.
고성능 LLM 에이전트가 스스로 취약점을 악용할 수 있다는 사실은, 이 기술의 잠재력과 위험을 한꺼번에 드러냅니다. 앞으로의 연구는 이런 공격 기법에 맞설 실용적이고 효율적인 대응책 마련에 집중해야 합니다.
그럴 때에야 VLM 기반 웹 에이전트는 믿고 맡길 수 있는 안전한 디지털 도구로 거듭나고, 갈수록 촘촘하게 연결되는 디지털 생태계 속에서 제 자리를 지킬 수 있습니다.

