간접 프롬프트 인젝션(Indirect Prompt Injection, IPI)은 LLM 연동 애플리케이션이 외부 데이터를 처리하는 방식을 조작해 악의적으로 만든 입력을 명령으로 잘못 해석하게 만드는 공격입니다.
EIA, AdvWeb, WIPI 공격 기법이 VLM 기반 웹 에이전트의 취약점을 어떻게 파고드는지 살펴보고, 웹 환경과 상호작용하는 AI 시스템의 심각한 보안 우려를 짚어봅니다.
기존 VLM 안전성 벤치마크에서는 이미지 없이 텍스트만으로도 충분히 정보가 전달되는 경우가 있습니다. 베이스 쿼리 생성과 독성 측정 방법을 살펴봅니다.
VLM 기반 웹 에이전트의 취약점을 찾아내고 완화하는 최신 방법론을 살펴봅니다. AdvWeb 공격 프레임워크와 BrowserART 레드티밍 툴킷을 중심으로 다룹니다.
이번 주 KAIST 연구실과 미팅을 열어 진행 중인 연구 프로젝트의 방향을 다듬고 실험 설계를 구체화했습니다. 핵심 주제는 심리학적 접근과 LLM을 결합해 탈옥 프롬프트를 설계하는 것이었습니다.
VLM Safety를 평가하려면 VLM의 고유한 특성을 반영한 안전한 모델을 개발해야 합니다. Figstep과 RTVLM 데이터셋을 분석해 타이포그래피 기반 시각 프롬프트 공격을 살펴봅니다.