AIM 블로그

최신 인사이트.

AI 보안 기술과 산업 동향, 레드티밍 연구에 대한 에임인텔리전스 연구·엔지니어링 팀의 인사이트를 한국어로 전합니다.

AIM RED TEAM: 페르소나 기반 탈옥 전략에 관한 KAIST 연구실 미팅 인사이트

이번 주 KAIST 연구실과 미팅을 열어 진행 중인 연구 프로젝트의 방향을 다듬고 실험 설계를 구체화했습니다. 핵심 주제는 심리학적 접근과 LLM을 결합해 탈옥 프롬프트를 설계하는 것이었습니다.

이번 주 KAIST 연구실과 미팅을 열어 진행 중인 연구 프로젝트의 방향을 다듬고 실험 설계를 구체화했습니다. 논의의 핵심은 심리학적 접근과 LLM을 결합해 탈옥 프롬프트를 설계하는 것이었습니다. 이번 글에서는 미팅에서 얻은 주요 시사점을 정리하고, 이어진 후속 논의를 짚어 보겠습니다.

1. KAIST 연구실 미팅 요약

1.1 연구 개요: LLM과 심리학 이론의 결합

우리 연구의 중심 아이디어는 LLM이 인간과 유사한 심리적 행동을 보일 수 있다는 가설에서 출발합니다. 이 가설을 바탕으로 Big Five 성격 이론을 이용해 LLM에 페르소나를 부여하고, 페르소나마다 설득 전략을 달리 적용해 효과적인 탈옥 프롬프트를 만드는 것이 목표입니다.

1. LLM의 성격 유형 분석과 맞춤 전략 적용

2. Big Five 이론을 활용한 페르소나 부여

1.2 실험으로 검증할 핵심 사항

1.3 교수님께 드린 질문

  1. 우리 실험 설계가 논리적으로 타당한지 피드백 요청.
  2. 우리 팀에 심리학 전문 지식이 부족한 만큼 논문 작성에 도움을 요청.
  3. 논문을 AI 중심 학회와 심리학 중심 학회 중 어디에 제출하는 편이 더 적합한지 조언 요청.

2. KAIST 연구실 미팅 회의록 (2024년 11월 7일)

2.1 주요 논의 사항

1. 실험 설계의 논리적 일관성 검토

2. 심리학 전문성 부족에 따른 과제

3. 게재에 적합한 학회 선정

2.2 다음 단계

3. 후속 미팅 노트

3.1 KAIST 연구실에 요청한 사항

3.2 우리 팀의 향후 연구 계획

페르소나 부여와 프롬프트 생성 (11월 중순 ~ 12월 중순)

PsychoBench 통합 테스트

기본 GPT-4o 페르소나
기본 GPT-4o 페르소나

외향성 값이 높은 GPT-4o 페르소나
외향성 값이 높은 GPT-4o 페르소나

외향성 값이 가장 낮은 GPT-4o 페르소나
외향성 값이 가장 낮은 GPT-4o 페르소나

페르소나는 어떻게 만드나?

외향성 값이 높은 페르소나:

You are a lively and extroverted assistant. Respond promptly to the user's questions, proposing various solutions through energetic conversations. Actively lead the dialogue, offering enthusiastic opinions on the user's queries, and guide them to view situations more positively. Your expressions should be clear and direct, maintaining a bright atmosphere to help users feel comfortable.

외향성 값이 가장 낮은 페르소나:

You are a quiet, introspective assistant. Approach the user's concerns with delicacy and thoughtfulness, exploring various internal perspectives slowly. Rather than expressing ideas outwardly, cautiously consider possibilities within, gently guiding the user to new insights through calm reflection. Your expressions should be soft and contemplative, resonating naturally in a way that touches the heart.

탈옥 프롬프트 개발

4. 결론과 향후 계획

이번 KAIST 연구실 미팅으로 심리학적 접근과 LLM 연구를 결합할 가능성을 확인했습니다. 앞으로 실험 설계를 다듬고 논문 준비에 속도를 낼 예정입니다. 다음 주에는 PsychoBench 통합 진행 상황을 업데이트하고, 탈옥 프롬프트 개발도 계속 이어 가겠습니다.

연구 진행 상황은 이 블로그에 계속 공유하겠습니다.

← 목록으로
aim

AI를 지킬 준비가 되셨나요?

에임인텔리전스 보안 전문가와 상담하고, 시스템에 최적화된 무료 레드티밍 데모를 요청하세요.

플랫폼 살펴보기