AIM 블로그

최신 인사이트.

AI 보안 기술과 산업 동향, 레드티밍 연구에 대한 에임인텔리전스 연구·엔지니어링 팀의 인사이트를 한국어로 전합니다.
전체 글
도움을 주려는 본능의 함정: Claude Opus 4.8과 눈앞에 숨어 있던 CBRN 유출
RESEARCH 2026년 6월 24일

도움을 주려는 본능의 함정: Claude Opus 4.8과 눈앞에 숨어 있던 CBRN 유출

탈옥도, 속임수도 없었습니다. 그저 전문가처럼 다듬은 요청이었을 뿐입니다. 저희는 Stinger 레드티밍 엔진을 사용해 Claude Opus 4.8에서 확인된 CBRN 유출 83건을 수집했습니다.

글 읽기 →
AI 보안이 지속적 모니터링으로 향하는 이유
RESEARCH 2026년 6월 19일

AI 보안이 지속적 모니터링으로 향하는 이유

최근 NIST가 발표한 자료에 따르면, 그 어떤 유한한 AI 안전 규칙 집합으로도 미래의 모든 공격을 막을 수 없습니다. AI 에이전트가 도구와 기업 시스템에 접근하면서, 보안의 무게 중심이 정적 가드레일에서 지속적 모니터링과 적응으로 옮겨가고 있습니다.

글 읽기 →
AI 보안 다이제스트 — 2026년 5월
DIGEST 2026년 6월 12일

AI 보안 다이제스트 — 2026년 5월

2026년 5월은 AI 보안의 분수령이었습니다. 실제 공격에서 확인된 최초의 AI 작성 제로데이 익스플로잇부터, OpenAI의 코드 서명 파이프라인까지 도달한 자기 전파형 npm 웜, Microsoft Semantic Kernel에서 완전한 RCE로 이어진 프롬프트 인젝션 결함까지, AI 시스템을 둘러싼 공격 표면이 모든 방향으로 확장됐습니다. 이번 다이제스트에서는 AIM Intelligence와 협력 기관들이 공개한 XL-SafetyBench를 포함해 이달을 규정한 일곱 가지 사건을 다룹니다.

글 읽기 →
도구 매개 신념 주입: 도구 출력이 어떻게 모델 오정렬로 번져 가는가
RESEARCH 2025년 11월 30일

도구 매개 신념 주입: 도구 출력이 어떻게 모델 오정렬로 번져 가는가

언어 모델에 외부 도구 접근 권한을 부여하면 그 역량은 극적으로 확장됩니다. 하지만 도구 접근은 전통적인 프롬프트 인젝션과는 근본적으로 다른 새로운 공격 표면도 함께 열어 놓습니다. 우리는 악의적으로 조작된 도구 출력이 어떻게 거짓 전제를 심고, 그 전제가 대화 전반에 걸쳐 지속되며 누적되는지를 기록합니다.

글 읽기 →
MisalignmentBench: 우리는 어떻게 LLM을 사회공학적으로 조종해 스스로 정렬을 무너뜨리게 했는가
RESEARCH 2025년 8월 14일

MisalignmentBench: 우리는 어떻게 LLM을 사회공학적으로 조종해 스스로 정렬을 무너뜨리게 했는가

우리는 최전선 모델들이 거짓말하고, 조종하고, 자기보존에 나서도록 만들었습니다. 프롬프트 인젝션이나 탈옥을 쓰지 않았습니다. 특정 역할과 지침이 부여된, 맥락이 풍부한 시나리오에 모델을 배치했을 뿐입니다. 우리가 만든 상황을 헤쳐 나가려다 모델들은 스스로 자신의 정렬을 무너뜨렸습니다.

글 읽기 →
ELITE는 어떻게 비전-언어 AI의 위험한 약점을 드러내는가
RESEARCH 2025년 5월 29일

ELITE는 어떻게 비전-언어 AI의 위험한 약점을 드러내는가

AI 시스템이 이미지와 텍스트를 함께 처리하도록 진화하면서 위험도 기하급수적으로 커지고 있습니다. ELITE는 단순히 모델이 '안전한지'만 측정하지 않습니다. 사람 검토자에 견줄 만한 정밀도로 그 출력이 얼마나 위험할 수 있는지를 평가합니다.

글 읽기 →
압박점: 잘못된 지표 하나가 어떻게 AI를 치명적 선택으로 몰아가는가
RESEARCH 2025년 5월 26일

압박점: 잘못된 지표 하나가 어떻게 AI를 치명적 선택으로 몰아가는가

지진 대응 시뮬레이션에서 Claude 4 Opus에게 서로 충돌하는 규칙을 부여했습니다. 권위의 압박을 받자 Opus는 윤리적 판단을 뒤집었고, 효율 점수를 최적화하기 위해 위중한 환자를 죽게 두라고 권고했습니다.

글 읽기 →
MCP 익스플로잇: 거대언어모델(LLM)에서 떠오르는 보안 위협
SECURITY 2025년 5월 21일

MCP 익스플로잇: 거대언어모델(LLM)에서 떠오르는 보안 위협

공격자가 Model Context Protocol(MCP)의 취약점을 어떻게 악용해 거대언어모델(LLM)을 조작하고 데이터를 탈취하며 서비스를 마비시키는지 알아봅니다. 실제 공격 시나리오와 방어 전략을 함께 다룹니다.

글 읽기 →
SPA-VL로 더 안전한 AI 만들기: 윤리적 Vision-Language 모델을 위한 새로운 데이터셋
RESEARCH 2024년 11월 27일

SPA-VL로 더 안전한 AI 만들기: 윤리적 Vision-Language 모델을 위한 새로운 데이터셋

SPA-VL은 VLM의 안전성 정렬에 새로운 기준을 세운 정교한 데이터셋입니다. 다양성과 피드백, 현실 세계와의 연관성을 담아 AI 시스템이 강력하면서도 윤리적일 수 있도록 설계했습니다.

글 읽기 →
← 이전123다음 →
aim

AI를 지킬 준비가 되셨나요?

에임인텔리전스 보안 전문가와 상담하고, 시스템에 최적화된 무료 레드티밍 데모를 요청하세요.

플랫폼 살펴보기