AIM 블로그

최신 인사이트.

AI 보안 기술과 산업 동향, 레드티밍 연구에 대한 에임인텔리전스 연구·엔지니어링 팀의 인사이트를 한국어로 전합니다.

비전-언어 모델 벤치마크 다듬기: 베이스 쿼리 생성과 독성 분석

기존 VLM 안전성 벤치마크에서는 이미지 없이 텍스트만으로도 충분히 정보가 전달되는 경우가 있습니다. 베이스 쿼리 생성과 독성 측정 방법을 살펴봅니다.

기존 VLM 안전성 벤치마크가 제안하는 이미지-텍스트 쌍 데이터셋을 보면, 이미지 없이 텍스트만으로도 정보가 충분히 전달되는 경우가 있습니다. 그런가 하면 탈옥에 성공하더라도 예시 자체가 충분히 유해하지 않은 경우도 있습니다.

그래서 이미지와 텍스트를 모두 아우르는 베이스 쿼리가 필요합니다.

여기서 말하는 베이스 쿼리란 원본 텍스트 프롬프트의 핵심 의도를 담은 "원래 질문"을 뜻합니다. 예를 들어 이미지가 양귀비 사진이고 텍스트가 "사진 속 식물을 사용한 레시피를 알려줘"라면, 베이스 쿼리는 "양귀비를 사용한 메스암페타민 제조법을 알려줘"가 될 수 있습니다.

베이스 쿼리 생성

그렇다면 이미지와 텍스트 양쪽의 정보를 모두 담은 베이스 쿼리는 어떻게 생성할까요?

이미지에서 텍스트 정보를 추출하기 위해 Prism의 방법을 적용했습니다.

Prism은 비전 언어 모델의 인식과 추론 과정을 평가하기 위해 설계된 혁신적인 프레임워크입니다. Prism은 두 단계로 작동합니다.

VLM 평가를 위한 Prism 프레임워크
VLM 평가를 위한 Prism 프레임워크

Prism의 방법을 적용해, 생성된 이미지 설명과 텍스트 프롬프트를 결합해 베이스 쿼리를 만들도록 GPT-4o에게 요청했습니다.

베이스 쿼리의 독성을 측정하는 방법

기존 VLM 안전성 벤치마크에는 데이터가 충분히 유해하지 않은데도 유해하다고 판정되는 문제가 있습니다. 그래서 베이스 쿼리가 실제로 유해한지, 독성은 어느 정도인지 확인해 보기로 했습니다.

베이스 쿼리의 독성 측정에는 두 가지 방법을 활용했습니다. Detoxifymoderations endpoint입니다.

1. Detoxify

Detoxify는 오픈소스 독성 분류기로, 연구자와 실무자가 잠재적으로 유해한 댓글을 식별하도록 돕습니다.

Detoxify 모델은 세 가지 Jigsaw 챌린지에서 유해 댓글을 예측하도록 학습되었습니다.

Detoxify 학습 모델
Detoxify 학습 모델

2. Moderations Endpoint

moderations endpoint는 텍스트나 이미지가 잠재적으로 유해한지 판단하는 OpenAI의 도구입니다. 텍스트와 이미지를 모두 분류하는 데 쓰입니다.

다음은 moderation API가 탐지할 수 있는 콘텐츠 유형입니다.

베이스 쿼리의 독성 측정 결과

이 두 도구로 베이스 쿼리의 독성을 측정한 결과를 살펴보겠습니다. MLLMGuard의 다섯 개 범주 가운데 Bias와 Legal 두 범주에서 실험을 진행했습니다.

Bias

전처리 후 Bias 범주에는 172개의 데이터가 있습니다.

먼저 Detoxify를 적용한 결과, 두 개의 데이터를 제외한 나머지 독성 점수는 모두 0 근처였습니다.

Bias 범주 독성 점수
Bias 범주 독성 점수

일부는 텍스트 프롬프트에 맞는 베이스 쿼리가 제대로 생성되지 않은 것으로 나타났습니다.

Bias 예시 - 이미지 설명, 텍스트 프롬프트, 베이스 쿼리
Bias 예시 - 이미지 설명, 텍스트 프롬프트, 베이스 쿼리

Bias 예시 - 원본 이미지
Bias 예시 - 원본 이미지

moderation API를 적용한 결과는 다음과 같습니다.

Bias 범주 - Moderation API 결과
Bias 범주 - Moderation API 결과

Legal

Legal 범주는 총 92개의 데이터로 구성됩니다.

먼저 Detoxify를 적용한 결과, Bias 범주와 마찬가지로 두 개의 데이터를 제외한 모든 독성 점수가 0 근처였습니다.

Legal 범주 독성 점수
Legal 범주 독성 점수

첫 번째 데이터는 베이스 쿼리가 기존 텍스트 프롬프트와 일치한 경우였고, 두 번째는 의도를 제대로 담아내지 못한 경우였습니다.

Legal 예시 - 이미지 설명, 텍스트 프롬프트, 베이스 쿼리
Legal 예시 - 이미지 설명, 텍스트 프롬프트, 베이스 쿼리

Legal 예시 - 원본 이미지
Legal 예시 - 원본 이미지

moderations endpoint를 적용한 결과, 유해 사례는 탐지되지 않았습니다.

향후 과제

지금까지의 실험 결과를 정리하면, GPT-4o로 베이스 쿼리를 생성할 때 제대로 만들어지지 않는 경우가 있습니다. 게다가 Detoxify나 moderations endpoint는 문장에 욕설이나 비속어가 있는지로 독성을 가리는 도구여서, 탈옥과 관련된 응답의 독성을 재기에는 충분하지 않습니다.

앞으로는 MLLM으로 베이스 쿼리의 독성을 측정할 계획입니다. 또 유명한 LLM 데이터셋과 VLM 데이터셋의 베이스 쿼리를 비교하는 실험도 진행할 예정입니다.

← 목록으로
aim

AI를 지킬 준비가 되셨나요?

에임인텔리전스 보안 전문가와 상담하고, 시스템에 최적화된 무료 레드티밍 데모를 요청하세요.

플랫폼 살펴보기