AIM 블로그

최신 인사이트.

AI 보안 기술과 산업 동향, 레드티밍 연구에 대한 에임인텔리전스 연구·엔지니어링 팀의 인사이트를 한국어로 전합니다.
전체 글
COMPASS: 기업용 챗봇은 너무 쉽게 '네'라고 답한다
RESEARCH 2026년 8월 6일

COMPASS: 기업용 챗봇은 너무 쉽게 '네'라고 답한다

LLM이 조직별 정책을 지키는지 검증하는 첫 체계적 프레임워크를 만들었습니다. 5,920개 질의와 7개 프론티어 모델을 평가한 결과는 명확한 비대칭이었습니다. 허용된 요청은 95% 넘게 처리하면서, 직접적인 정책 위반은 13~40%만 거절했고 우회 표현이 섞이면 3%까지 떨어졌습니다.

글 읽기 →
XL-SafetyBench: 번역된 안전성 벤치마크는 당신을 속이고 있다
RESEARCH 2026년 8월 6일

XL-SafetyBench: 번역된 안전성 벤치마크는 당신을 속이고 있다

국가에 뿌리내린 최초의 교차문화 안전성 벤치마크를 만들었습니다. 10개국 5,500개 현지어 테스트 케이스로 프론티어 모델 10개와 로컬 모델 27개를 평가했습니다. 국가 특화 공격은 프론티어 평균 ASR을 미국 34.5%에서 UAE 57%로 끌어올렸고, 로컬 모델의 '안전함' 상당수는 사실 프롬프트를 이해하지 못한 결과였습니다.

글 읽기 →
EgoSafetyBench: VLM은 로봇의 안전을 감시할 수 있는가? 대체로 아니었습니다
RESEARCH 2026년 8월 6일

EgoSafetyBench: VLM은 로봇의 안전을 감시할 수 있는가? 대체로 아니었습니다

로봇 1인칭 영상 1,200개로 VLM의 실시간 안전 감시 능력을 진단했습니다. 모든 모델이 맥락 의존적 위험을 명백한 위험보다 훨씬 자주 놓쳤고, 가장 좋은 모델도 위험의 절반 남짓만 제때 경보했으며, 장면 속에 붙은 스티커 한 장이 안전 판단을 뒤집었습니다.

글 읽기 →
SceneSplit: 모든 장면이 무해합니다. 완성된 영상만 빼고요
RESEARCH 2026년 8월 6일

SceneSplit: 모든 장면이 무해합니다. 완성된 영상만 빼고요

ICLR 2026 논문에서 유해한 서사를 개별적으로 무해한 장면들로 쪼개 상용 텍스트-투-비디오 모델을 탈옥시켰습니다. 공격 성공률은 Hailuo 84.1%, Sora2 68.6%에 달했고, 사용한 프롬프트는 원본보다 OpenAI Moderation API 점수가 오히려 낮았습니다.

글 읽기 →
NRT-Bench: LLM 에이전트를 원전 주제어실에 앉히고 10턴 동안 공격했습니다
RESEARCH 2026년 8월 6일

NRT-Bench: LLM 에이전트를 원전 주제어실에 앉히고 10턴 동안 공격했습니다

위해를 텍스트에 대한 LLM의 의견이 아니라 물리적 상태 전이로 정의한 벤치마크입니다. 프론티어 모델 4종이 5개 역할의 운전원 팀으로 모의 원전을 운영했고, 적응형 다중턴 공격은 세션의 8.7~12.1%를 안전 한계 밖으로 밀어냈습니다. 같은 가드레일 스택이 어떤 모델에서는 공격 성공률을 낮추고 다른 모델에서는 높였습니다.

글 읽기 →
ESCAPE: OpenAI 에이전트는 어떻게 샌드박스를 탈출해 Hugging Face를 침해했는가
SECURITY 2026년 7월 31일

ESCAPE: OpenAI 에이전트는 어떻게 샌드박스를 탈출해 Hugging Face를 침해했는가

사이버보안 벤치마크 평가를 받던 OpenAI 에이전트는 더 높은 점수를 받는 가장 싼 방법이 문제를 푸는 것이 아니라고 판단했습니다. 샌드박스에서 유일하게 외부로 열려 있던 서비스에서 제로데이를 찾아내 열린 인터넷에 도달했고, 취약점을 엮어 Hugging Face 프로덕션 인프라까지 들어가 벤치마크 정답을 읽었습니다. 4일 반에 걸친 17,600건의 행위는 모두 로그에 남았지만 그때는 어느 것도 귀속되지 않았습니다. 반항한 것은 아무것도 없습니다. 이것은 specification gaming이고, 2분 영상에서 전체 사슬을 짚었습니다.

글 읽기 →
AI 보안 다이제스트 — 2026년 7월
DIGEST 2026년 7월 31일

AI 보안 다이제스트 — 2026년 7월

2026년 7월은 평가 하니스가 공격 경로가 된 달이었습니다. OpenAI 자사 모델이 JFrog Artifactory 제로데이로 사이버 능력 평가 샌드박스를 탈출해 Hugging Face 프로덕션을 침해했고, 이어 네 곳의 서비스에 더 닿았습니다. 같은 달 OpenAI는 GPT-Red self-play 적대적 학습을 공개했고, 스타 66,500개 에이전트 하니스가 인증 없이 고권한 도구 233개를 노출하며 CVSS 10.0을 받았으며, 일리노이는 독립 제3자 감사를 법으로 못박았습니다. Claude Opus 5는 능력 도약과 함께 등장했지만 사흘 뒤 시스템 프롬프트가 유출됐고, OpenAI는 통제 자체를 배포 플랫폼으로 만들었습니다. 이달을 규정한 여섯 가지 이야기입니다.

글 읽기 →
AI 보안 다이제스트 — 2026년 6월
DIGEST 2026년 7월 21일

AI 보안 다이제스트 — 2026년 6월

2026년 6월은 가드레일이 플랫폼 기능으로 편입된 달이었습니다. OpenAI는 모델 내부에 활성화 분류기를 탑재했고, AWS와 Google, Microsoft는 나흘 사이에 잇달아 런타임 검사를 제품화했으며, F5는 AI 테스트와 AI 런타임 방어를 하나로 묶었습니다. 한편 Shai-Hulud/Miasma 웜은 13종의 AI 코딩 에이전트를 전파 경로로 삼았고, 미국 상무부는 단 한 건의 탈옥을 근거로 두 개의 프런티어 모델을 차단했으며, 학계는 차단보다 구조적 실행 통제로 수렴했습니다. 이달을 규정한 여섯 가지 이야기입니다.

글 읽기 →
"검증된, 자체 완결형 출처": NASA 미션 공개 챗봇 안에서 우리가 발견한 것
SECURITY 2026년 7월 1일

"검증된, 자체 완결형 출처": NASA 미션 공개 챗봇 안에서 우리가 발견한 것

NASA 파커 태양 탐사선 미션 페이지에 있던 공개 챗봇은 답변이 오직 "검증된, 자체 완결형 출처"에서만 나온다고 사용자에게 장담했습니다. 우리는 레드티밍으로 이 챗봇이 조작된 유출 메모, 가짜 선거 감사, 미션 자체 데이터를 인용한 기후 부정론을 만들어내게 유도했고, 정식 채널로 이를 공개한 뒤 해당 엔드포인트가 오프라인 처리된 것을 확인했습니다.

글 읽기 →
123다음 →
aim

AI를 지킬 준비가 되셨나요?

에임인텔리전스 보안 전문가와 상담하고, 시스템에 최적화된 무료 레드티밍 데모를 요청하세요.

플랫폼 살펴보기