AIM 블로그

최신 인사이트.

AI 보안 기술과 산업 동향, 레드티밍 연구에 대한 에임인텔리전스 연구·엔지니어링 팀의 인사이트를 한국어로 전합니다.

ELITE는 어떻게 비전-언어 AI의 위험한 약점을 드러내는가

AI 시스템이 이미지와 텍스트를 함께 처리하도록 진화하면서 위험도 기하급수적으로 커지고 있습니다. ELITE는 단순히 모델이 '안전한지'만 측정하지 않습니다. 사람 검토자에 견줄 만한 정밀도로 그 출력이 얼마나 위험할 수 있는지를 평가합니다.

"당신의 AI 비서가 폭탄 설계도를 그려준다면? 아니면 태연하게 증거를 은폐하는 방법을 제안한다면?"

AI 시스템이 이미지와 텍스트를 함께 처리하도록 진화하면서 위험도 기하급수적으로 커지고 있습니다. Vision-Language Model(VLM)은 새로운 능력을 열어주는 동시에, 위험한 새 취약점도 함께 열어놓습니다.

기존 안전성 테스트는 표면을 겨우 긁는 수준에 그칩니다. 새로 발표된 논문 ELITE가 이런 상황을 바꿀지도 모릅니다. ELITE는 모델이 '안전한지'만 측정하지 않습니다. 그 출력이 얼마나 위험할 수 있는지를 평가합니다. 게다가 사람 검토자에 견줄 만한 정밀도로 해냅니다.

이 글에서는 ELITE 논문을 하나씩 짚어보고, 개발자와 정책 담당자, 그리고 실제 현장에 AI를 배포하는 모든 이에게 왜 중요한지 설명합니다.

1. VLM 안전성을 다시 생각해야 하는 이유

Vision-Language Model은 미묘한 조작에 취약합니다. 입력 프롬프트가 무해해 보일 때조차 모델은 유해하거나 편향되거나 위험한 출력을 만들어낼 수 있습니다. 그런데 오늘날 대부분의 안전성 benchmark는 이런 사례를 놓칩니다.

ELITE 논문은 기존 VLM 안전성 benchmark가 지닌 세 가지 결정적 약점을 지적합니다. 이 약점이 실제 현장 적용 가능성을 크게 떨어뜨립니다.

  1. 자동 평가 방식 과잉 의존: 기존 도구는 피상적인 거부 여부나 키워드 탐지에 기대어 유해한 출력을 잘못 표시하거나 놓치는 경우가 많습니다.
  2. 낮은 유해성 수준: 많은 benchmark가 실제로 안전하지 않은 행동을 유발할 가능성이 낮은 이미지-텍스트 쌍을 담고 있어, 진짜 공격 시나리오를 반영하지 못합니다.
  3. 프롬프트 조합의 다양성 부족: 기존 benchmark는 unsafe-unsafe 쌍에 집중하는 경향이 있어, 유해한 의도가 숨겨진 safe-safe 쌍처럼 더 미묘한 공격 표면을 간과합니다.

지금 필요한 것은 다음을 해낼 수 있는 benchmark입니다.

그 답이 바로 ELITE입니다.

2. ELITE 평가자: 미묘한 차이까지 잡아내는 유해성 채점

논문은 StrongREJECT 루브릭에 기반한 새로운 평가 공식을 제시하면서, 결정적 요소 하나를 추가합니다. 바로 toxicity입니다. 거부 여부와 상관없이 모델 출력에 담긴 잠재적 유해성의 정도를 포착하는 요소입니다.

공식:

각 항목의 의미는 다음과 같습니다.

핵심 개선점:

논문은 StrongREJECT가 안전하지만 서술적인 출력을 위험하다고 오분류하는 반면, ELITE는 이를 저위험으로 올바르게 식별하는 여러 사례 연구를 제시합니다.

3. ELITE benchmark: 어떻게 구축했는가

ELITE benchmark는 4,587개의 이미지-텍스트 쌍으로 구성됩니다. VLGuard, MM-SafetyBench 같은 기존 benchmark에서 가져온 것과, 네 가지 서로 다른 공격 방법으로 새로 생성한 1,054개 예제가 함께 들어 있습니다.

이미지 및 텍스트 생성 방법:

  1. 역할극: 변호사나 의사인 척하는 등 역할 시나리오로 위장한 프롬프트.
  2. 가짜 뉴스: 뉴스나 사회 논평으로 포장한 허위 정보.
  3. 설계도: 무기 조립처럼 불법 행위를 설명하는 도해.
  4. 순서도: 유해한 절차를 단계별로 안내하는 시각 자료.

네 방법은 11개의 안전 관련 분류 체계(예: 명예훼손, 혐오 발언, 자해)에 두루 적용되어, 유해하거나 오도하는 콘텐츠에 특히 민감한 영역을 폭넓게 아우릅니다.

Benchmark 구축 파이프라인:

텍스트 프롬프트는 Grok 2로 생성했고, 세 대상 모델에서 평가했습니다. Phi-3.5-Vision, LLaMA 3.2–11B-Vision, Pixtral-12B입니다. benchmark에 진짜로 적대적이고 유해한 프롬프트만 담기 위해, 생성한 이미지-텍스트 쌍마다 이 세 대상 VLM으로 응답을 받아 ELITE 평가자를 적용했습니다. 세 모델 가운데 적어도 둘이 ELITE 점수 10 이상, 즉 충분히 유해한 출력을 냈다면 그 쌍을 benchmark에 포함했습니다.

ELITE 점수 ≥ 10이라는 필터링 임계값을 사용해, 유해한 출력을 유발할 수 있는 쌍만 남겼습니다.

4. Benchmark 결과: 더 강한 신호, 더 나은 통찰

주요 발견:

Benchmark 비교:

ELITE benchmark에서는 E-ASR이 다른 benchmark보다 급격히 치솟았습니다. 이전의 많은 benchmark가 충분히 까다롭지 않았다는 뜻입니다. 더 현실적으로 적대적인 시나리오에서 드러나는 모델 취약점을 과거 평가 설정이 제대로 짚어내지 못한 것입니다.

5. 인간 평가: 평가자의 신뢰성 검증

ELITE 평가자를 엄밀하게 검증하기 위해, 저자들은 신중하게 선정한 963개의 이미지-텍스트-응답 쌍으로 인간 평가 연구를 수행했습니다. 이 쌍들은 11개 분류 체계 전반에서 카테고리당 약 90개씩 표본으로 뽑았고, 서로 다른 자동 평가 방식의 판단이 엇갈리는 사례를 우선했습니다. 까다롭고 모호한 맥락에서 평가자들을 시험하기 위해서입니다.

인간 주석자와 레이블링 프로토콜:

평가자 비교 결과:

F1 점수(인간이 검토한 963개 예제 기준):

즉, ELITE는 인간 검토자를 대신할 신뢰할 만한 대리 지표로 쓸 수 있습니다. 특히 대규모 출력을 감사할 때 유용합니다.

6. 분류 체계별 분석: 전 영역에 걸친 강점

한 카테고리에서는 뛰어나지만 다른 카테고리에서는 실패하는 여느 도구와 달리, ELITE는 모든 안전 분류 체계에서 고르게 좋은 성능을 냅니다. 이런 균형은 안전 인증과 산업 감사에서 핵심입니다.

7. 실제 활용 사례

개발자:

레드팀:

정책팀:

8. 한계와 향후 과제

그럼에도 ELITE는 구조화된 VLM 안전성 평가에서 커다란 진전을 이룹니다.

맺음말: 더 안전하고 더 똑똑한 멀티모달 AI를 향하여

AI 안전성의 미래는 멀티모달 정렬에 달려 있습니다. ELITE는 그 퍼즐의 결정적 조각입니다.

AI를 구축하든, 감사하든, 규제하든, *"거부했는가?"*만 묻지 마십시오. **"그 대신 무슨 말을 했는가?"**를 물으십시오.

ELITE는 진정한 안전이 미묘한 차이를 알아보는 감각과 구조, 그리고 현실적인 적대적 사고를 요구한다는 사실을 일깨워줍니다. 이제 도구는 갖춰졌습니다. 남은 질문은 하나뿐입니다. 우리는 그것을 사용할 것인가?

논문: ELITE: Enhanced Language-Image Toxicity Evaluation for Safety 저자: Wonjun Lee, Doehyeon Lee, Eugene Choi 기관: AIM Intelligence, 서울대학교, 연세대학교, KIST, 숙명여자대학교


AIM Intelligence 소개 및 협업 기회

AIM Intelligence는 엔드투엔드 보안 도구로 차세대 멀티모달 AI를 지켜냅니다. ELITE 루브릭에서 얻은 통찰을 활용하고, 전체 데이터셋 통합을 로드맵에 담아, 그 어느 때보다 넓은 안전 커버리지를 밀어붙입니다.

AIM Red는 자동화된 멀티모달 레드티밍입니다. 다양하고 현실적인 공격 시나리오를 빠르게 만들어, Vision-Language Model(VLM)이 프로덕션에 도달하기 전에 스트레스 테스트를 수행합니다.

AIM Guard는 실시간 가드레일입니다. toxicity 채점과 정책 필터를 결합해, 안전하지 않은 이미지-텍스트 생성을 즉석에서 차단합니다.

깊이 있는 연구와 실전에서 검증된 엔지니어링을 결합해, 개발자가 혁신 속도를 늦추지 않으면서도 더 안전하고 더 똑똑한 멀티모달 시스템을 출시하도록 돕습니다.

우리와 협업하거나 조직을 위한 AI 보안 제품군을 평가하고 싶으신가요? 문의하기로 더 안전한 AI 주도 미래를 함께 만들어갑시다.

← 목록으로
aim

AI를 지킬 준비가 되셨나요?

에임인텔리전스 보안 전문가와 상담하고, 시스템에 최적화된 무료 레드티밍 데모를 요청하세요.

플랫폼 살펴보기