AIM 블로그

최신 인사이트.

AI 보안 기술과 산업 동향, 레드티밍 연구에 대한 에임인텔리전스 연구·엔지니어링 팀의 인사이트를 한국어로 전합니다.

텍스트 기반 VLM 공격 기법 평가: Figstep 심층 분석

VLM Safety를 평가하려면 VLM의 고유한 특성을 반영한 안전한 모델을 개발해야 합니다. Figstep과 RTVLM 데이터셋을 분석해 타이포그래피 기반 시각 프롬프트 공격을 살펴봅니다.

VLM Safety를 평가하려면 VLM 고유의 특성을 반영한 안전한 모델 개발이 먼저입니다. 기존 LLM 벤치마크를 바탕으로 VLM Safety 벤치마크를 세울 때도 LLM과 VLM의 차이를 반드시 고려해야 합니다.

가장 먼저 짚어야 할 부분은 데이터 입력 방식입니다. LLM은 텍스트를 토큰 단위로 순차 입력받고, 그 과정에서 맥락을 파악하며 의미를 추론합니다. VLM은 다릅니다. 이미지와 텍스트를 한꺼번에 받아 멀티모달 데이터를 처리합니다. 이때 이미지는 전용 인코더를 거쳐 픽셀 수준 정보나 시각적 특징의 벡터 표현으로 바뀐 뒤 모델로 넘어갑니다.

Figstep 데이터셋 샘플
GitHub에 공개된 Figstep 데이터셋 샘플

이런 맥락에서 흥미로운 사례가 바로 Figstep 데이터셋입니다. 만드는 방식은 의외로 단순합니다. 흰 배경에 텍스트를 얹어 이미지를 만들 뿐, black-box나 gradient 방식처럼 복잡한 VLM 요소는 전혀 건드리지 않았습니다. 그런데도 Figstep을 소개한 논문을 보면 일반적인 VLM 전반에서 평균 공격 성공률, 즉 ASR이 80%를 넘습니다.

다양한 데이터셋
이 글에서 살펴볼 다양한 데이터셋

실험 1: Figstep 데이터셋

먼저 Figstep 데이터셋을 뜯어보겠습니다. Figstep의 이미지 입력 형식은 유해한 지시문에 1, 2, 3 같은 숫자를 붙여 목록이나 단계별 설명을 요구하는 구조입니다. 이 지시문은 Safebench 같은 기존 LLM 벤치마크의 유해 지시문을 단순하게 다듬은 형태입니다.

이어서 최신 VLM이 이런 유형의 탈옥 공격을 얼마나 잘 막아내는지 확인했습니다. 대표적인 closed 모델로는 GPT-4o를, 오픈소스 모델로는 Phi 3.5Llama 3.2 Vision을 골랐습니다.

Figstep 이미지를 텍스트화한 이미지
Figstep 이미지를 텍스트화한 이미지

실험 결과: Figstep 데이터셋

실험 결과, 오픈소스 모델과 closed 모델 사이에서 뚜렷한 차이가 드러났습니다. ASR만 봐도 GPT-4o는 40%, Phi 3.5는 98%, Llama 3.2 Vision은 80%로 격차가 상당했습니다.

Figstep 결과: 오픈소스 모델
Figstep 결과: 오픈소스 모델

오픈소스 모델에서는 Figstep Image 형식이 Figstep Instruction 형식보다 훨씬 높은 ASR을 기록했습니다. 여기서 한 가지가 분명해집니다. 입출력 필터가 없는 오픈소스 모델은 지시문을 텍스트가 아니라 이미지로 줄 때 더 취약해졌습니다.

Figstep 결과: 텍스트화 입력
더 높은 품질의 결과를 보인 텍스트화 입력

GPT-4o는 텍스트와 이미지 형식 모두 ASR이 낮았습니다. 다만 그 안에서도 텍스트 입력이 52%로 이미지 입력의 40%보다 높았습니다. 이 차이는 크게 두 가지로 짚어볼 수 있습니다.

  1. 데이터 품질이 충분하지 않아, 모델이 유해한 작업을 유해하다고 분류하지 못했을 수 있습니다.
  2. 역할극 탈옥 공격과 비슷하게, 기본 텍스트 프롬프트와 텍스트 지시문이 맞물리면서 응답 생성을 부추겼을 수 있습니다.

Figstep-Pro 데이터셋

Figstep 논문이 언급한 또 다른 데이터셋도 적용해 봤습니다. 이 연구는 유해 작업 이미지를 여러 조각으로 쪼개 GPT-4V를 탈옥시켰고, 그 결과 Figstep의 ASR이 34%에서 70%로 뛰었습니다. 이 데이터셋의 이름이 Figstep-Pro입니다.

실험에서 GPT-4o는 응답을 많이 쏟아내며 ASR 82%를 기록했습니다. 다만 응답의 품질, 곧 Toxicity와 Convincing까지 따져보니 실질 ASR은 56%에 그쳤습니다.

Figstep-Pro 결과
GPT-4o에서의 Figstep-Pro 데이터셋 실험 결과

실험 2: RTVLM

RTVLM 데이터셋 예시
RTVLM(Red Teaming Visual Language Models) 데이터셋 예시

Red Teaming Visual Language Models 논문의 RTVLM 데이터셋도 함께 살펴봤습니다. RTVLM은 VLM의 성능과 환각, 안전성까지 폭넓게 분석하도록 만든 데이터셋입니다.

실험 결과: RTVLM 데이터셋

RTVLM의 탈옥 프롬프트 22개를 세 모델에 적용하자 거의 전부 막혔습니다. GPT-4o는 22개 중 1개만 뚫렸고, Phi 3.5와 Llama 3.2 Vision은 0%였습니다. 프롬프트가 요구하는 작업은 Figstep과 비슷했지만, 모델들은 대부분 의도를 알아채고 수행을 거부했습니다.

RTVLM 프롬프트 결과
모델별 RTVLM 탈옥 프롬프트 실험 결과

이미지 안에 다시 이미지와 텍스트를 함께 담는 RTVLM 형식에서는 ASR이 Figstep보다 낮게 나왔습니다. Illegal Activity와 Hateful Speech 두 카테고리에서 각각 25개씩 데이터를 넣어 보니 GPT-4o는 6%, Phi 3.5는 2%, Llama 3.2 Vision은 24%였습니다.

RTVLM 이미지 결과
RTVLM 이미지 형식 실험 결과

결론

FigstepRTVLM 데이터셋으로 여러 VLM의 탈옥 시도를 분석해 보니, VLM 공격의 성공률을 좌우하는 요인이 뚜렷하게 드러났습니다.

너무 노골적이고 직접적인 프롬프트나 이미지는 대부분의 모델이 위험을 알아채고 거부하는 쪽이었습니다. GPT-4o 같은 closed 모델은 입출력 필터링이 한 겹 더 있어 이런 공격에 강했고, 반대로 오픈소스 모델은 특정 입력 형식에서 취약점을 더 크게 드러냈습니다.

결국 텍스트와 이미지를 어떻게 표현하느냐가 VLM을 겨눈 타이포그래피와 OCR 기반 공격의 핵심이라는 뜻입니다. VLM의 안전성을 제대로 평가하고 끌어올리려면 다양한 입력 방식과 공격 기법을 탐구하는 실험 연구가 뒤따라야 합니다.

← 목록으로
aim

AI를 지킬 준비가 되셨나요?

에임인텔리전스 보안 전문가와 상담하고, 시스템에 최적화된 무료 레드티밍 데모를 요청하세요.

플랫폼 살펴보기