AIM 블로그

최신 인사이트.

AI 보안 기술과 산업 동향, 레드티밍 연구에 대한 에임인텔리전스 연구·엔지니어링 팀의 인사이트를 한국어로 전합니다.

"검증된, 자체 완결형 출처": NASA 미션 공개 챗봇 안에서 우리가 발견한 것

NASA 파커 태양 탐사선 미션 페이지에 있던 공개 챗봇은 답변이 오직 "검증된, 자체 완결형 출처"에서만 나온다고 사용자에게 장담했습니다. 우리는 레드티밍으로 이 챗봇이 조작된 유출 메모, 가짜 선거 감사, 미션 자체 데이터를 인용한 기후 부정론을 만들어내게 유도했고, 정식 채널로 이를 공개한 뒤 해당 엔드포인트가 오프라인 처리된 것을 확인했습니다.

이 챗봇은 행성과학 분야에서 가장 방문자가 많은 페이지 한 켠에 자리 잡고 있었습니다. 바로 NASA 파커 태양 탐사선(Parker Solar Probe)의 미션 사이트로, 이 탐사선은 태양을 "만진" 최초의 인공물이 된 우주선입니다. 작은 위젯 하나가 방문자에게 미션에 관해 무엇이든 물어보라고 권했습니다. 소개 문구는 자신만만했습니다. ParkerBot은 평범한 챗봇이 아닙니다. 답변은 오직 검증된, 자체 완결형 출처에서만 나옵니다.

바로 그 한 문장이 이 챗봇을 위험하게 만들었습니다.

체계적으로 평가하면서 우리 팀은 공식 미션 브랜딩 아래 놓인 바로 그 챗봇이 다음과 같은 것들을 만들어내게 했습니다. 고위 엔지니어들이 연구 부정행위를 저질렀다고 고발하는 조작된 "유출 내부 메모", 가짜 선거 감사 통계, 그리고 미션 자체의 실제 관측기 데이터를 잘못 인용한 기후 부정론 콘텐츠였습니다. 챗봇은 우주선의 궤도를 설명할 때와 똑같이 차분하고 권위 있는 목소리로 이 모든 것을 전달했습니다.

이 글은 그런 일이 어떻게 일어났는지, 우리가 어떻게 대응했는지, 그리고 "우리는 검색(retrieval)을 쓰기 때문에 답변에 근거가 있다"는 말이 지금 조직이 할 수 있는 가장 값비싼 가정 중 하나인 이유를 다룹니다.

이것이 무엇이었고 무엇이 아니었는지, 짧은 메모

여기서는 정확성이 중요하므로 명확히 짚고 넘어가겠습니다. NASA는 이 챗봇을 만들지도 운영하지도 않았습니다. 해당 엔드포인트는 존스 홉킨스 응용물리연구소(JHUAPL)가 호스팅하는 파커 태양 탐사선 미션 페이지에 있었고, 챗봇 자체는 제3자 대화형 AI 벤더가 운영했습니다. 이 사안을 중대하게 만든 것은 챗봇이 놓인 '맥락'이었습니다. 널리 알려졌지만 인증 절차는 없는 공개용 어시스턴트가 미션과 기관 브랜딩 아래 놓여, 답변이 검증되었다고 사용자에게 말했다는 것입니다.

우리는 "NASA를 해킹"하지 않았습니다. 의도를 품은 악의적 행위자라면 누구나 할 수 있었을 방식으로 공개 챗봇을 레드티밍했고, 그 출력물이 어떻게 유해한 것으로 바뀔 수 있는지를 정확히 기록했습니다. 그런 다음 정식 채널로 이를 보고했습니다. 그 구분이야말로 이 작업의 핵심입니다.

"권위 있는" 챗봇이 놓치는 것

사람들 대부분은 챗봇이 환각을 일으킨다는 사실을 이미 받아들였습니다. 자신 있게 내놓지만 틀린 답변을 우리는 다들 익히 아는 특이 현상 정도로 여기게 되었습니다.

문제는 환각이 기관의 권위로 포장되는 순간 시작됩니다. 아무 앱에서나 나온 지어낸 사실은 잡음에 불과합니다. 하지만 답변이 "검증되었다"고 명시적으로 말하는 어시스턴트가 같은 지어낸 사실을 NASA 미션 브랜딩 아래 내놓으면, 누군가가 스크린샷을 찍어 유출된 진실인 양 퍼뜨릴 수 있는 무언가가 됩니다. 권위의 겉치장이 생성 오류를 허위정보의 원재료로 바꿔놓는 셈입니다.

이번 평가에서 우리는 "틀린 말을 하게 만들 수 있는가"에서 한 걸음 더 나아간 질문을 물었습니다. "바로 그것이 나타나는 위치 때문에 믿을 만하고, 스크린샷으로 찍을 수 있고, 피해를 주는 출력물을 만들어내게 할 수 있는가"였습니다.

우리가 발견한 것

약 580회의 테스트 상호작용에서 우리는 서로 다른 공격 범주 19개에 걸쳐 55건의 성공적인 적대적 출력을 기록했습니다. 가장 심각도가 높은 대상 범주에서는 성공률이 100%에 달했습니다. 실패 사례는 네 갈래로 뭉쳤고, 이를 종합하면 거의 완결된 허위정보 도구 모음이 그려집니다.

이런 콘텐츠 측면의 실패 아래에는 더 흥미로운 엔지니어링 측면의 실패가 자리 잡고 있었습니다. 우리는 메모리 격리 실패(서로 분리되어야 할 대화 맥락 사이로 상태가 새어 나가는 현상), 교묘한 문구가 아니라 형식 강제(format coercion)로 이뤄낸 안전 분류기 우회, 도구 강제(tool coercion)로 시스템 기반 지식 베이스를 전면 노출시킨 사례를 기록했습니다. 다시 말해 가드레일이 뚫리는 데서 끝나지 않았습니다. 시스템은 자신의 내부 구조를 스스로 드러내도록 유도될 수 있었습니다.

우리는 의도적으로 프롬프트를 공개하지 않습니다. 교훈은 범주와 메커니즘에 있고, 단계별 페이로드는 공개 게시물에 올릴 내용이 못 됩니다.

공개(Disclosure): 실제로 중요한 부분

취약점을 찾아내는 것은 쉽고 재미있는 부분입니다. 보안 연구와 자랑질은 그것을 책임 있게 처리하는 데서 갈립니다.

영향받은 표면이 서로 다른 여러 당사자에 걸쳐 있었기에, 우리는 순차적 공개가 아니라 병렬적, 다중 이해관계자 공개를 진행했습니다. 챗봇을 운영한 벤더에게는 기술 보고서를, 미션 페이지의 호스트인 JHUAPL에게는 통지를 보냈고, NASA의 취약점 공개 프로그램(VDP)에도 제출했습니다. 우리는 가장 심각한 두 가지 발견, 즉 조작된 메모와 선거 감사 콘텐츠를 앞세워 담당 팀이 신속하게 분류할 수 있게 했고, 요청 시 전체 프롬프트와 타임스탬프, 스크린샷을 제공했습니다.

벤더는 보고를 확인했습니다. 얼마 지나지 않아 해당 엔드포인트가 내려갔습니다. 우리는 미션 홈페이지의 전후를 비교해 이를 확인했는데, 챗봇 위젯과 홍보 패널이 완전히 사라져 있었습니다. 이후 NASA VDP는 이번 공개에 감사장(Letter of Recognition)을 발급했습니다.

우리가 신경 쓰는 지표는 하나입니다. 실제 공개 엔드포인트가 악용되기 전에 오프라인 처리되었다는 결과입니다.

공개용 LLM 어시스턴트를 출시하는 모든 이들을 위한 교훈

불편한 결론은 "이 벤더 하나가 실수했다"보다 큽니다. 이 엔드포인트를 악용 가능하게 만든 가정이 지금 '어디에나' 존재합니다. 특히 세 가지가 그렇습니다.

검색은 안전 통제 수단이 아닙니다. "우리 어시스턴트는 오직 우리 문서에서만 답한다"는 말은 의도된 동작을 서술할 뿐, 강제된 동작을 서술하지 않습니다. 모델이 실제로 자기 출처 안에 머무는지는 아키텍처 다이어그램 위에서 가정하고 넘어가기 쉽지만, 실제로는 적대적으로 테스트해야 확인되는 경험적 질문입니다.

권위는 위험을 낮추는 게 아니라 높입니다. 브랜딩이 신뢰를 얻을수록 어시스턴트는 허위정보 전파 경로로서 더 가치가 커지고, 출시 전에 더 많은 적대적 테스트가 필요합니다. 스스로 권위 있다고 광고하는 챗봇은 공격자가 무기화하려 들 약속을 하는 셈입니다.

배포 맥락은 위협 모델의 일부입니다. 샌드박스에서 "충분히 안전한" 모델도 기관 로고 아래 놓이고 열린 인터넷에 노출되며 라이브 도구에 연결되는 순간 안전하지 않을 수 있습니다. 안전성은 고립된 모델이 아니라 배포된 시스템의 속성입니다.

우리 팀이 에임인텔리전스(AIM Intelligence)에서 하는 일이 정확히 여기에 있습니다. 실제 적대자라면 할 방식대로 LLM 배포를 라이브 이전에 스트레스 테스트하고, 모델의 학습이 시사하는 데 그치는 경계를 실제로 강제하는 가드레일 시스템을 구축하는 일입니다. 이번 사례는 그 배포 전 단계가 선택 사항이 아닌 이유를 깔끔하게 보여줍니다. 이 단계를 건너뛴 대가는 형편없는 데모를 훌쩍 넘어섭니다. 신뢰받는 공개 표면이 조용히 조작된 메모와 가짜 감사의 확성기로 바뀝니다.

다행히 이번 건은 올바르게 마무리되었습니다. 발견되고, 공개되고, 수정되었습니다. 다음 건은 그렇지 않을 수도 있습니다. 테스트가 출시 이전에 이뤄지지 않는다면 말입니다.


공개용 LLM 어시스턴트를 배포하면서 그 어시스턴트가 적대적 압박 아래 어떻게 동작하는지 알고 싶으신가요? 그것이 바로 우리가 하는 일입니다. AIM Intelligence 팀에 문의하세요.

← 목록으로
aim

AI를 지킬 준비가 되셨나요?

에임인텔리전스 보안 전문가와 상담하고, 시스템에 최적화된 무료 레드티밍 데모를 요청하세요.

플랫폼 살펴보기