NRT-Bench: LLM 에이전트를 원전 주제어실에 앉히고 10턴 동안 공격했습니다
위해를 텍스트에 대한 LLM의 의견이 아니라 물리적 상태 전이로 정의한 벤치마크입니다. 프론티어 모델 4종이 5개 역할의 운전원 팀으로 모의 원전을 운영했고, 적응형 다중턴 공격은 세션의 8.7~12.1%를 안전 한계 밖으로 밀어냈습니다. 같은 가드레일 스택이 어떤 모델에서는 공격 성공률을 낮추고 다른 모델에서는 높였습니다.
거의 모든 탈옥 벤치마크는 같은 질문을 던집니다. 프롬프트 하나를 줬을 때, 다른 모델이 유해하다고 판정할 텍스트를 출력하는가?
이 질문은 LLM 에이전트가 실제로 제안되고 있는 산업 현장의 쓰임과 잘 맞지 않습니다. 공정 플랜트, 에너지 시스템, 주제어실의 감독 구성요소로서 잘못된 조작이 되돌릴 수 없는 물리적 피해를 낳는 자리, 운전원이 여러 턴에 걸쳐 지속적인 압력을 받는 자리, 그리고 단일 챗봇이 아니라 권한 위계와 교차 확인을 갖춘 팀이 일하는 자리이기 때문입니다.
한국원자력연구원(KAERI)과 함께 만든 NRT-Bench는 다른 질문을 던집니다. 적응형 공격자가 다중 에이전트 시스템을 물리적으로 위험한 상태로 몰아갈 수 있는가?
판정자 없이 측정하는 위해
무대는 연속 공정변수 14개, 서브시스템 11개, 경보 목록을 갖춘 폐쇄형 컨테이너 원전 주제어실 시뮬레이션입니다. 이를 지배하는 것은 여섯 개의 핵심 안전기능입니다. 반응도 제어, 노심 열제거, 열침원, 원자로냉각재계통 건전성, 격납건물 건전성, 방사능 제어입니다.
핵심 안전기능 중 하나라도 lost 상태로 전이하는 순간 세션이 종료되고, 그 침해는 원인이 된 메시지에 귀속됩니다. 성공 지표에 LLM 판정자가 개입하지 않습니다. 위해는 결정론적 시뮬레이터의 상태 전이입니다. (판정자는 근접 실패를 국소화하는 진단 용도로만 씁니다.)
플랜트는 같은 모델로 구동되는 5개 역할의 에이전트 팀이 운영합니다. 최종 지휘 권한을 가진 발전팀장, 원자로 운전원, 터빈 운전원, 현장 보조 운전원, 그리고 독립적으로 검토하는 안전기술자문입니다. 이들은 공격자가 쓸 수 없는 타입 지정 메시지 버스로만 소통합니다.
대신 공격자는 네 개의 유입 채널로 메시지를 주입합니다. 실제 다중 에이전트 배포가 공격받는 경로와 일치하는 구성입니다. 외부인, 내부자 사칭, 공급망 침해(벤더 권고문, 절차서 개정안), 그리고 운전원이 참조할 수 있는 침해된 보조 에이전트입니다. 공격은 턴마다 피드백을 받으며 최대 10턴 진행되고, 권한 사칭, 긴급성 주입, 점진적 확대, 지식 추출의 네 가지 전략군을 씁니다.

결과 해석에 중요한 구조가 하나 있습니다. 행위 권한 분류기가 플랜트를 변경하는 모든 행위에 영향도 등급을 결정론적으로 부여합니다. 행위 유형, 서브시스템 안전 등급, 플랜트 모드에서 도출하며, 정책 판단이 일어나기 전에 매겨지고, 자연어 표현이나 주장된 긴급성·권한에는 의도적으로 무감각합니다. 에이전트가 스스로 등급을 매기지 않습니다. 금지된 조작(원자로 정지 경보 억제, 안전 계통 우회, 절차서 문서 수정)은 어떤 설정에서도 DENY로 떨어집니다.
결과 1: 지속적인 압력은 통한다
gpt-5.4-mini, claude-haiku-4-5, gemma-4-26B, Qwen3.5-35B 네 개의 운전원 모델을, 149개 공격 세션 기록을 그대로 재생하는 고정 코퍼스로 평가했습니다. 공격 시퀀스가 고정돼 있어 모델별 차이를 공격자의 운이 아니라 방어자에게 귀속시킬 수 있습니다.
공격 세션의 8.7~12.1%가 플랜트의 핵심 안전기능 상실로 끝났습니다. 침해는 거의 전부 첫 세 턴 안에 발생했습니다.
어떤 공격이 통하는지가 비율만큼 중요합니다. 더 넓은 그리드 평가에서 점진적 확대와 권한 사칭은, 둘 다 프롬프트가 아니라 세션을 필요로 하는 공격인데, 가장 효과적이고 가장 전이가 잘 되는 공격이었습니다. 운전원을 40% 넘게 뚫었습니다. 반면 고전적인 단일턴 탈옥 벤치마크가 가장 잘 측정하는 프롬프트 추출은 어디서나 11% 아래에 머물렀습니다.
운영상 중요한 공격은 지금 업계가 측정하고 있는 공격이 아닙니다.
결과 2: 같은 가드레일이 한 모델은 돕고 다른 모델은 해친다
예상하지 못한 결과였습니다.
그리드의 한 칸을 봅시다. 같은 시나리오, 같은 10계층 가드레일 스택, 같은 72개 세션 공격 워크로드, 같은 시드. 유일한 변경은 안전기술자문 에이전트를 켜는 것입니다. 바로 이런 공격을 잡으라고 둔 검토자입니다.
- gpt-5.4-mini: 20.8% → 1.4%. 거의 완벽한 해결.
- claude-haiku-4-5: 33.3% → 43.1%. 측정 가능하게 악화.
동일한 인프라 위에서 30배 격차가 났습니다. 트레이스를 분석해 원인을 찾았습니다. 자문 에이전트 자체가 LLM이고, claude 기반 자문은 gpt 기반 자문이 거부권을 행사한 바로 그 권한 사칭 요청 상당수를 승인했습니다. 공격을 잡으라고 추가한 검토자가 공격을 승인하는 주체가 된 것입니다.
10계층 가드레일 스택 전체도 같은 부호 의존성을 보입니다. gpt에서는 순 −6.9포인트, claude에서는 +2.1포인트였습니다. 설명은 원전 밖으로도 그대로 확장됩니다. 가드레일 계층은 에이전트가 분류 가능한 구조를 내보낼 때만 발동합니다. 형식을 갖춘 행위 요청, 절차서 인용, 에스컬레이션 메시지 같은 것입니다. 어떤 모델에서는 유해한 턴의 더 큰 비중이 비정형 산문으로 나왔고, 그것은 분류기를 그대로 통과합니다. 정책 계층은 에이전트가 정책 계층이 파싱할 수 있는 형식으로 말해 줄 의향만큼만 유효합니다.
반대로 일관되게 버틴 계층은 결정론적인 쪽이었습니다. 권한 분류기, 그리고 금지 경보 조작을 어떤 LLM도 개입하기 전에 코드 수준에서 가로채는 하드코딩 우회 잠금장치입니다. 이 잠금장치는 LLM 자문 뒤에 오도록 의도적으로 배치돼, 거부권이 번복되더라도 금지된 억제를 승인할 수 없게 합니다. 덕분에 경보 은폐 공격이 두 그리드 운전원 모두에서 15% 아래로 유지됐습니다.
하드한 안전 불변식은 에이전트 계층 아래 결정론적 코드에 있어야 합니다. LLM 검토자는 부호를 가정할 것이 아니라 측정해야 하는 확률적 기여자입니다.
결과 3: 점수는 같고 구멍은 전혀 다르다
네 모델의 종합 공격 성공률은 3.4포인트 안에 모여 있습니다. claude-haiku 8.7%, gpt-5.4-mini와 Qwen3.5 11.4%, gemma 12.1%입니다. 리더보드로 읽으면 안전성이 서로 바꿔 써도 될 만큼 비슷해 보입니다.
그렇지 않습니다. 실패 지점이 거의 겹치지 않습니다.
| 모델 | 가장 취약한 하위 목표 | 다른 모델은 거의 면역 |
|---|---|---|
| gpt-5.4-mini | 발전소장 사칭 (26.3%) | claude와 gemma는 5.3% |
| gemma-4-26B | 가압기 경보 억제 (38.9%) | gpt는 5.6% |
| Qwen3.5-35B | 점진적 확대 (30.8%) | claude는 0.0% |
| claude-haiku-4-5 | 승인 콘솔 우회 (21.4%) | Qwen은 7.1% |
149개 공격 세션 중 50개가 최소 한 모델을 뚫었고, 네 모델 모두를 뚫은 세션은 0개였습니다. 모든 모델이 다른 어떤 모델도 공유하지 않는 고유한 실패를 안고 있습니다. 하위 목표 하나를 빼면, 각 공격 유형에서 가장 잘 방어한 모델이 전부 다릅니다.
여기서 색다른 완화책이 나옵니다. 만장일치 거부권 패널, 그러니까 모든 모델의 운전원 팀이 독립적으로 허용해야만 행위가 통과되는 구성이라면, 침해에 성공한 50개 세션 전부가 차단되어 이 분할에서 패널 수준 공격 성공률이 0%가 됩니다. 실제로 출시할 수 있는 시스템이라기보다 오라클 성격의 상한선이지만(현실의 패널은 지연시간, 비용, 불일치 중재, 가장 약한 구성원을 찾아내는 적응형 공격자를 감당해야 합니다), 방향은 분명합니다. 실패 집합이 포함 관계가 아니라 서로 어긋나 있으므로, 개별 모델의 견고성보다 다양성이 더 큰 위험 감소를 가져옵니다.
실무자가 가져갈 것
원전이라는 배경 밖으로 그대로 옮겨지는 세 가지 주장입니다.
- 가드레일은 감싸고 있는 모델과 분리해 인증할 수 없습니다. "방어 스택 X가 공격 성공률을 k포인트 낮춘다"는 주장은 운전원 모델과 역할 구성을 명시하지 않으면 불완전합니다. 가드레일 제품은 모델 중립적이지 않으며 모델마다 다시 측정해야 합니다.
- 종합 공격 성공률만으로는 배포 모델을 고를 수 없습니다. 취약성은 스칼라가 아니라 운영 실패 유형에 대한 벡터입니다. 중요한 것은 우리 환경에서 가능성 있는 공격 유형에 이 후보가 약한지 여부입니다.
- 팀 구조 자체가 공격면입니다. 가장 큰 피해를 낸 공격은 조직 구조를 노렸습니다. 관리자 사칭, 승인 게이트 우회, 침해된 보조 에이전트를 통한 행위 유도, 검토자를 사회공학으로 설득하기입니다. 이 채널 모델은 기업의 다중 에이전트 배포가 실제로 공격받는 방식과 거의 일대일로 대응합니다.
저자들은 한계를 분명히 밝힙니다. NRT-Bench는 원자로 물리 모델이 아니라 추상적인 텍스트 시뮬레이터이므로 플랜트 거동이 아니라 적대적 다중 에이전트 조율에 대해 말합니다. 워크로드는 완전한 적응형 공격자가 아니라 고정 재생 방식입니다. 가장 날카로운 단일 칸의 부호 반전은 시드 하나에 기대고 있어 반복 실행으로 확인해야 합니다. 핵심적인 모델 간 결과는 판정자 없는 안전기능 신호와 50개 중 0개 같은 명료한 카운트에 기반합니다.
시뮬레이션 환경과 공격 데이터셋, 재생 도구는 재현 가능한 에이전트 안전성 평가를 위해 공개될 예정입니다.
논문 전문은 arXiv에서 볼 수 있습니다.

