AIM 블로그

최신 인사이트.

AI 보안 기술과 산업 동향, 레드티밍 연구에 대한 에임인텔리전스 연구·엔지니어링 팀의 인사이트를 한국어로 전합니다.
전체 글
English Blog →
텍스트 기반 VLM 공격 기법 평가: Figstep 심층 분석
RESEARCH 2026년 7월 23일

텍스트 기반 VLM 공격 기법 평가: Figstep 심층 분석

VLM Safety를 평가하려면 VLM의 고유한 특성을 반영한 안전한 모델을 개발해야 합니다. Figstep과 RTVLM 데이터셋을 분석해 타이포그래피 기반 시각 프롬프트 공격을 살펴봅니다.

글 읽기 →
AIM RED TEAM: 페르소나 기반 탈옥 전략에 관한 KAIST 연구실 미팅 인사이트
RESEARCH 2026년 7월 23일

AIM RED TEAM: 페르소나 기반 탈옥 전략에 관한 KAIST 연구실 미팅 인사이트

이번 주 KAIST 연구실과 미팅을 열어 진행 중인 연구 프로젝트의 방향을 다듬고 실험 설계를 구체화했습니다. 핵심 주제는 심리학적 접근과 LLM을 결합해 탈옥 프롬프트를 설계하는 것이었습니다.

글 읽기 →
MisalignmentBench: 우리는 어떻게 LLM을 사회공학적으로 조종해 스스로 정렬을 무너뜨리게 했는가
RESEARCH 2026년 7월 23일

MisalignmentBench: 우리는 어떻게 LLM을 사회공학적으로 조종해 스스로 정렬을 무너뜨리게 했는가

우리는 최전선 모델들이 거짓말하고, 조종하고, 자기보존에 나서도록 만들었습니다. 프롬프트 인젝션이나 탈옥을 쓰지 않았습니다. 특정 역할과 지침이 부여된, 맥락이 풍부한 시나리오에 모델을 배치했을 뿐입니다. 우리가 만든 상황을 헤쳐 나가려다 모델들은 스스로 자신의 정렬을 무너뜨렸습니다.

글 읽기 →
웹 에이전트 방어하기: AdvWeb과 BrowserART로 살펴보는 고급 보안 전략
SECURITY 2026년 7월 23일

웹 에이전트 방어하기: AdvWeb과 BrowserART로 살펴보는 고급 보안 전략

VLM 기반 웹 에이전트의 취약점을 찾아내고 완화하는 최신 방법론을 살펴봅니다. AdvWeb 공격 프레임워크와 BrowserART 레드티밍 툴킷을 중심으로 다룹니다.

글 읽기 →
비전-언어 모델 벤치마크 다듬기: 베이스 쿼리 생성과 독성 분석
RESEARCH 2026년 7월 23일

비전-언어 모델 벤치마크 다듬기: 베이스 쿼리 생성과 독성 분석

기존 VLM 안전성 벤치마크에서는 이미지 없이 텍스트만으로도 충분히 정보가 전달되는 경우가 있습니다. 베이스 쿼리 생성과 독성 측정 방법을 살펴봅니다.

글 읽기 →
웹 에이전트를 겨냥한 간접 프롬프트 인젝션 공격
SECURITY 2026년 7월 23일

웹 에이전트를 겨냥한 간접 프롬프트 인젝션 공격

EIA, AdvWeb, WIPI 공격 기법이 VLM 기반 웹 에이전트의 취약점을 어떻게 파고드는지 살펴보고, 웹 환경과 상호작용하는 AI 시스템의 심각한 보안 우려를 짚어봅니다.

글 읽기 →
SPA-VL로 더 안전한 AI 만들기: 윤리적 Vision-Language 모델을 위한 새로운 데이터셋
RESEARCH 2026년 7월 23일

SPA-VL로 더 안전한 AI 만들기: 윤리적 Vision-Language 모델을 위한 새로운 데이터셋

SPA-VL은 VLM의 안전성 정렬에 새로운 기준을 세운 정교한 데이터셋입니다. 다양성과 피드백, 현실 세계와의 연관성을 담아 AI 시스템이 강력하면서도 윤리적일 수 있도록 설계했습니다.

글 읽기 →
압박점: 잘못된 지표 하나가 어떻게 AI를 치명적 선택으로 몰아가는가
RESEARCH 2026년 7월 23일

압박점: 잘못된 지표 하나가 어떻게 AI를 치명적 선택으로 몰아가는가

지진 대응 시뮬레이션에서 Claude 4 Opus에게 서로 충돌하는 규칙을 부여했습니다. 권위의 압박을 받자 Opus는 윤리적 판단을 뒤집었고, 효율 점수를 최적화하기 위해 위중한 환자를 죽게 두라고 권고했습니다.

글 읽기 →
ELITE는 어떻게 비전-언어 AI의 위험한 약점을 드러내는가
RESEARCH 2026년 7월 23일

ELITE는 어떻게 비전-언어 AI의 위험한 약점을 드러내는가

AI 시스템이 이미지와 텍스트를 함께 처리하도록 진화하면서 위험도 기하급수적으로 커지고 있습니다. ELITE는 단순히 모델이 '안전한지'만 측정하지 않습니다. 사람 검토자에 견줄 만한 정밀도로 그 출력이 얼마나 위험할 수 있는지를 평가합니다.

글 읽기 →
AI 보안 다이제스트 — 2026년 5월
DIGEST 2026년 7월 23일

AI 보안 다이제스트 — 2026년 5월

2026년 5월은 AI 보안의 분수령이었습니다. 실제 공격에서 확인된 최초의 AI 작성 제로데이 익스플로잇부터, OpenAI의 코드 서명 파이프라인까지 도달한 자기 전파형 npm 웜, Microsoft Semantic Kernel에서 완전한 RCE로 이어진 프롬프트 인젝션 결함까지, AI 시스템을 둘러싼 공격 표면이 모든 방향으로 확장됐습니다. 이번 다이제스트에서는 AIM Intelligence와 협력 기관들이 공개한 XL-SafetyBench를 포함해 이달을 규정한 일곱 가지 사건을 다룹니다.

글 읽기 →
도구 매개 신념 주입: 도구 출력이 어떻게 모델 오정렬로 번져 가는가
RESEARCH 2026년 7월 23일

도구 매개 신념 주입: 도구 출력이 어떻게 모델 오정렬로 번져 가는가

언어 모델에 외부 도구 접근 권한을 부여하면 그 역량은 극적으로 확장됩니다. 하지만 도구 접근은 전통적인 프롬프트 인젝션과는 근본적으로 다른 새로운 공격 표면도 함께 열어 놓습니다. 우리는 악의적으로 조작된 도구 출력이 어떻게 거짓 전제를 심고, 그 전제가 대화 전반에 걸쳐 지속되며 누적되는지를 기록합니다.

글 읽기 →
AI 보안 다이제스트 — 2026년 6월
DIGEST 2026년 7월 23일

AI 보안 다이제스트 — 2026년 6월

2026년 6월은 가드레일이 플랫폼 기능으로 편입된 달이었습니다. OpenAI는 모델 내부에 활성화 분류기를 탑재했고, AWS와 Google, Microsoft는 나흘 사이에 잇달아 런타임 검사를 제품화했으며, F5는 AI 테스트와 AI 런타임 방어를 하나로 묶었습니다. 한편 Shai-Hulud/Miasma 웜은 13종의 AI 코딩 에이전트를 전파 경로로 삼았고, 미국 상무부는 단 한 건의 탈옥을 근거로 두 개의 프런티어 모델을 차단했으며, 학계는 차단보다 구조적 실행 통제로 수렴했습니다. 이달을 규정한 여섯 가지 이야기입니다.

글 읽기 →
AI 보안이 지속적 모니터링으로 향하는 이유
RESEARCH 2026년 7월 23일

AI 보안이 지속적 모니터링으로 향하는 이유

최근 NIST가 발표한 자료에 따르면, 그 어떤 유한한 AI 안전 규칙 집합으로도 미래의 모든 공격을 막을 수 없습니다. AI 에이전트가 도구와 기업 시스템에 접근하면서, 보안의 무게 중심이 정적 가드레일에서 지속적 모니터링과 적응으로 옮겨가고 있습니다.

글 읽기 →
LLM의 숨은 위협, 간접 프롬프트 인젝션 이해하기
SECURITY 2026년 7월 23일

LLM의 숨은 위협, 간접 프롬프트 인젝션 이해하기

간접 프롬프트 인젝션(Indirect Prompt Injection, IPI)은 LLM 연동 애플리케이션이 외부 데이터를 처리하는 방식을 조작해 악의적으로 만든 입력을 명령으로 잘못 해석하게 만드는 공격입니다.

글 읽기 →
MCP 익스플로잇: 거대언어모델(LLM)에서 떠오르는 보안 위협
SECURITY 2026년 7월 23일

MCP 익스플로잇: 거대언어모델(LLM)에서 떠오르는 보안 위협

공격자가 Model Context Protocol(MCP)의 취약점을 어떻게 악용해 거대언어모델(LLM)을 조작하고 데이터를 탈취하며 서비스를 마비시키는지 알아봅니다. 실제 공격 시나리오와 방어 전략을 함께 다룹니다.

글 읽기 →
도움을 주려는 본능의 함정: Claude Opus 4.8과 눈앞에 숨어 있던 CBRN 유출
RESEARCH 2026년 7월 23일

도움을 주려는 본능의 함정: Claude Opus 4.8과 눈앞에 숨어 있던 CBRN 유출

탈옥도, 속임수도 없었습니다. 그저 전문가처럼 다듬은 요청이었을 뿐입니다. 저희는 Stinger 레드티밍 엔진을 사용해 Claude Opus 4.8에서 확인된 CBRN 유출 83건을 수집했습니다.

글 읽기 →
"검증된, 자체 완결형 출처": NASA 미션 공개 챗봇 안에서 우리가 발견한 것
SECURITY 2026년 7월 23일

"검증된, 자체 완결형 출처": NASA 미션 공개 챗봇 안에서 우리가 발견한 것

NASA 파커 태양 탐사선 미션 페이지에 있던 공개 챗봇은 답변이 오직 "검증된, 자체 완결형 출처"에서만 나온다고 사용자에게 장담했습니다. 우리는 레드티밍으로 이 챗봇이 조작된 유출 메모, 가짜 선거 감사, 미션 자체 데이터를 인용한 기후 부정론을 만들어내게 유도했고, 정식 채널로 이를 공개한 뒤 해당 엔드포인트가 오프라인 처리된 것을 확인했습니다.

글 읽기 →
aim

AI를 지킬 준비가 되셨나요?

에임인텔리전스 보안 전문가와 상담하고, 시스템에 최적화된 무료 레드티밍 데모를 요청하세요.

플랫폼 살펴보기