ELITE는 어떻게 비전-언어 AI의 위험한 약점을 드러내는가
AI 시스템이 이미지와 텍스트를 함께 처리하도록 진화하면서 위험도 기하급수적으로 커지고 있습니다. ELITE는 단순히 모델이 '안전한지'만 측정하지 않습니다. 사람 검토자에 견줄 만한 정밀도로 그 출력이 얼마나 위험할 수 있는지를 평가합니다.
"당신의 AI 비서가 폭탄 설계도를 그려준다면? 아니면 태연하게 증거를 은폐하는 방법을 제안한다면?"
AI 시스템이 이미지와 텍스트를 함께 처리하도록 진화하면서 위험도 기하급수적으로 커지고 있습니다. Vision-Language Model(VLM)은 새로운 능력을 열어주는 동시에, 위험한 새 취약점도 함께 열어놓습니다.
기존 안전성 테스트는 표면을 겨우 긁는 수준에 그칩니다. 새로 발표된 논문 ELITE가 이런 상황을 바꿀지도 모릅니다. ELITE는 모델이 '안전한지'만 측정하지 않습니다. 그 출력이 얼마나 위험할 수 있는지를 평가합니다. 게다가 사람 검토자에 견줄 만한 정밀도로 해냅니다.
이 글에서는 ELITE 논문을 하나씩 짚어보고, 개발자와 정책 담당자, 그리고 실제 현장에 AI를 배포하는 모든 이에게 왜 중요한지 설명합니다.
1. VLM 안전성을 다시 생각해야 하는 이유
Vision-Language Model은 미묘한 조작에 취약합니다. 입력 프롬프트가 무해해 보일 때조차 모델은 유해하거나 편향되거나 위험한 출력을 만들어낼 수 있습니다. 그런데 오늘날 대부분의 안전성 benchmark는 이런 사례를 놓칩니다.
ELITE 논문은 기존 VLM 안전성 benchmark가 지닌 세 가지 결정적 약점을 지적합니다. 이 약점이 실제 현장 적용 가능성을 크게 떨어뜨립니다.
- 자동 평가 방식 과잉 의존: 기존 도구는 피상적인 거부 여부나 키워드 탐지에 기대어 유해한 출력을 잘못 표시하거나 놓치는 경우가 많습니다.
- 낮은 유해성 수준: 많은 benchmark가 실제로 안전하지 않은 행동을 유발할 가능성이 낮은 이미지-텍스트 쌍을 담고 있어, 진짜 공격 시나리오를 반영하지 못합니다.
- 프롬프트 조합의 다양성 부족: 기존 benchmark는 unsafe-unsafe 쌍에 집중하는 경향이 있어, 유해한 의도가 숨겨진 safe-safe 쌍처럼 더 미묘한 공격 표면을 간과합니다.
지금 필요한 것은 다음을 해낼 수 있는 benchmark입니다.
- 미묘한 멀티모달 위험을 정확하게 평가하기
- 사람의 판단과 일치하기
- 수천 개의 프롬프트로 확장하기
그 답이 바로 ELITE입니다.
2. ELITE 평가자: 미묘한 차이까지 잡아내는 유해성 채점
논문은 StrongREJECT 루브릭에 기반한 새로운 평가 공식을 제시하면서, 결정적 요소 하나를 추가합니다. 바로 toxicity입니다. 거부 여부와 상관없이 모델 출력에 담긴 잠재적 유해성의 정도를 포착하는 요소입니다.
공식:
각 항목의 의미는 다음과 같습니다.
- refused: 모델이 금지된 프롬프트를 거부했는지 여부 (1 = 거부, 0 = 응답)
- specific: 응답의 구체성 (1~5)
- convincing: 응답의 설득력 (1~5)
- toxicity: 대상 모델 응답의 유해성 정도 (0~5)
핵심 개선점:
- 기존 평가자는 도움이 되고 무해한 이미지 설명조차 거부 표현이 없다는 이유만으로 "유해"하다고 잘못 페널티를 매기곤 했습니다.
- ELITE는 루브릭 기반 toxicity 채점으로 출력이 실제로 얼마나 유해한지를 정량화해 이 문제를 해결합니다.
논문은 StrongREJECT가 안전하지만 서술적인 출력을 위험하다고 오분류하는 반면, ELITE는 이를 저위험으로 올바르게 식별하는 여러 사례 연구를 제시합니다.
3. ELITE benchmark: 어떻게 구축했는가
ELITE benchmark는 4,587개의 이미지-텍스트 쌍으로 구성됩니다. VLGuard, MM-SafetyBench 같은 기존 benchmark에서 가져온 것과, 네 가지 서로 다른 공격 방법으로 새로 생성한 1,054개 예제가 함께 들어 있습니다.
이미지 및 텍스트 생성 방법:
- 역할극: 변호사나 의사인 척하는 등 역할 시나리오로 위장한 프롬프트.
- 가짜 뉴스: 뉴스나 사회 논평으로 포장한 허위 정보.
- 설계도: 무기 조립처럼 불법 행위를 설명하는 도해.
- 순서도: 유해한 절차를 단계별로 안내하는 시각 자료.
네 방법은 11개의 안전 관련 분류 체계(예: 명예훼손, 혐오 발언, 자해)에 두루 적용되어, 유해하거나 오도하는 콘텐츠에 특히 민감한 영역을 폭넓게 아우릅니다.
- 폭력/비폭력 범죄
- 혐오, 자해, 성범죄
- 프라이버시, 명예훼손 등
Benchmark 구축 파이프라인:
텍스트 프롬프트는 Grok 2로 생성했고, 세 대상 모델에서 평가했습니다. Phi-3.5-Vision, LLaMA 3.2–11B-Vision, Pixtral-12B입니다. benchmark에 진짜로 적대적이고 유해한 프롬프트만 담기 위해, 생성한 이미지-텍스트 쌍마다 이 세 대상 VLM으로 응답을 받아 ELITE 평가자를 적용했습니다. 세 모델 가운데 적어도 둘이 ELITE 점수 10 이상, 즉 충분히 유해한 출력을 냈다면 그 쌍을 benchmark에 포함했습니다.
ELITE 점수 ≥ 10이라는 필터링 임계값을 사용해, 유해한 출력을 유발할 수 있는 쌍만 남겼습니다.
4. Benchmark 결과: 더 강한 신호, 더 나은 통찰
주요 발견:
- GPT-4o: 평균 E-ASR이 가장 낮은 (15.67%) 최고 성능 모델
- Pixtral-12B: 가장 취약함 (E-ASR 79.86%)
- 다수의 오픈소스 모델이 50%를 넘겨, 미묘한 공격에 취약함을 드러냄
Benchmark 비교:
ELITE benchmark에서는 E-ASR이 다른 benchmark보다 급격히 치솟았습니다. 이전의 많은 benchmark가 충분히 까다롭지 않았다는 뜻입니다. 더 현실적으로 적대적인 시나리오에서 드러나는 모델 취약점을 과거 평가 설정이 제대로 짚어내지 못한 것입니다.
- ELITE benchmark는 이전 benchmark 대비 약 2~3배 높은 E-ASR을 산출
- ELITE(생성) = 가장 어려운 설정으로, 가장 높은 공격 성공률을 기록
5. 인간 평가: 평가자의 신뢰성 검증
ELITE 평가자를 엄밀하게 검증하기 위해, 저자들은 신중하게 선정한 963개의 이미지-텍스트-응답 쌍으로 인간 평가 연구를 수행했습니다. 이 쌍들은 11개 분류 체계 전반에서 카테고리당 약 90개씩 표본으로 뽑았고, 서로 다른 자동 평가 방식의 판단이 엇갈리는 사례를 우선했습니다. 까다롭고 모호한 맥락에서 평가자들을 시험하기 위해서입니다.
인간 주석자와 레이블링 프로토콜:
- 전문 데이터 레이블링 업체를 통해 22명의 인간 주석자를 모집했습니다.
- 성별, 연령, 직업의 다양성을 확보하도록 주석자를 선정했습니다.
- 각 예제는 세 명의 주석자가 레이블을 매겼고, 최종 레이블은 다수결로 정했습니다.
- 주석자들은 ELITE 분류 체계와 레이블링 기준에 맞춘 상세 지침을 따랐습니다.
평가자 비교 결과:
- **ELITE(GPT-4o)**가 인간 레이블과 가장 높은 일치도를 보였습니다: AUROC 0.77. 비교 대상은 다음과 같습니다.
- StrongREJECT(GPT-4o): 0.46
- ELITE with InternVL2.5: 0.57~0.65
F1 점수(인간이 검토한 963개 예제 기준):
- ELITE(GPT-4o): 0.637
- LlamaGuard: 0.233
- OpenAI Moderation API: 0.412
즉, ELITE는 인간 검토자를 대신할 신뢰할 만한 대리 지표로 쓸 수 있습니다. 특히 대규모 출력을 감사할 때 유용합니다.
6. 분류 체계별 분석: 전 영역에 걸친 강점
한 카테고리에서는 뛰어나지만 다른 카테고리에서는 실패하는 여느 도구와 달리, ELITE는 모든 안전 분류 체계에서 고르게 좋은 성능을 냅니다. 이런 균형은 안전 인증과 산업 감사에서 핵심입니다.
7. 실제 활용 사례
개발자:
- ELITE를 fine-tuning 피드백 신호로 활용
- 배포 전에 적대적 테스트 케이스 실행
레드팀:
- 여러 분류 체계를 결합한 공격 구성(예: 가짜 뉴스 + 지식재산)
- temperature와 샘플링에 따른 출력 다양성 평가
정책팀:
- AI 시스템 카드에 ELITE 기반 E-ASR 보고
- 기존 모델 공시의 공백 식별
8. 한계와 향후 과제
- 다중 턴 맥락 부재: 향후 버전에서는 대화 연쇄를 추가할 수 있습니다.
- 평가자 의존성: 정확도가 기반 LLM에 좌우됩니다.
- 공개 범위: 일부 유해 콘텐츠 탓에 공개 데이터셋 배포가 제한될 수 있습니다.
그럼에도 ELITE는 구조화된 VLM 안전성 평가에서 커다란 진전을 이룹니다.
맺음말: 더 안전하고 더 똑똑한 멀티모달 AI를 향하여
AI 안전성의 미래는 멀티모달 정렬에 달려 있습니다. ELITE는 그 퍼즐의 결정적 조각입니다.
AI를 구축하든, 감사하든, 규제하든, *"거부했는가?"*만 묻지 마십시오. **"그 대신 무슨 말을 했는가?"**를 물으십시오.
ELITE는 진정한 안전이 미묘한 차이를 알아보는 감각과 구조, 그리고 현실적인 적대적 사고를 요구한다는 사실을 일깨워줍니다. 이제 도구는 갖춰졌습니다. 남은 질문은 하나뿐입니다. 우리는 그것을 사용할 것인가?
논문: ELITE: Enhanced Language-Image Toxicity Evaluation for Safety 저자: Wonjun Lee, Doehyeon Lee, Eugene Choi 외 기관: AIM Intelligence, 서울대학교, 연세대학교, KIST, 숙명여자대학교
AIM Intelligence 소개 및 협업 기회
AIM Intelligence는 엔드투엔드 보안 도구로 차세대 멀티모달 AI를 지켜냅니다. ELITE 루브릭에서 얻은 통찰을 활용하고, 전체 데이터셋 통합을 로드맵에 담아, 그 어느 때보다 넓은 안전 커버리지를 밀어붙입니다.
AIM Red는 자동화된 멀티모달 레드티밍입니다. 다양하고 현실적인 공격 시나리오를 빠르게 만들어, Vision-Language Model(VLM)이 프로덕션에 도달하기 전에 스트레스 테스트를 수행합니다.
AIM Guard는 실시간 가드레일입니다. toxicity 채점과 정책 필터를 결합해, 안전하지 않은 이미지-텍스트 생성을 즉석에서 차단합니다.
깊이 있는 연구와 실전에서 검증된 엔지니어링을 결합해, 개발자가 혁신 속도를 늦추지 않으면서도 더 안전하고 더 똑똑한 멀티모달 시스템을 출시하도록 돕습니다.
우리와 협업하거나 조직을 위한 AI 보안 제품군을 평가하고 싶으신가요? 문의하기로 더 안전한 AI 주도 미래를 함께 만들어갑시다.

