연구 영역
기본 정보
논문·특허
과제
구성원
Preprint|
인용수 0
·2026
Discovering Universal Activation Directions for PII Leakage in Language Models
Leo Marchyok, Zachary Coalson, Sungho Keum, Sooel Son, Sanghyun Hong
Open MIND
초록

현대 언어 모델은 풍부한 내부 구조를 보이지만, 개인 식별 정보(personally identifiable information, PII) 유출과 같은 개인정보 보호에 민감한 행동이 숨겨진 상태(hidden states) 내에서 어떻게 표현되고 조절되는지에 대해서는 거의 알려져 있지 않다. 본 연구는 보편적 활성화 방향(universal activation directions)을 식별하는 기계적 해석가능성(mechanistic-interpretability) 프레임워크 UniLeak을 제시한다. UniLeak은 잔차 스트림(residual stream) 내의 잠재 방향(latent directions)으로서, 추론 시점에 선형적으로 추가하면 프롬프트 전반에 걸쳐 PII를 생성할 가능성이 일관되게 증가하는 방향을 찾아낸다. 이러한 모델별 방향은 맥락 전반에 걸쳐 일반화되며, 생성 품질에는 최소한의 영향만을 미친 채 PII 생성 확률을 증폭한다. UniLeak은 학습 데이터나 PII에 대한 정답(groundtruth) 접근 없이, 자기 생성 텍스트만을 기반으로 이러한 방향을 복원한다. 여러 모델과 데이터셋에 걸친 실험에서, 이 보편적 방향을 따라 조종(steering)하면 기존의 프롬프트 기반 추출(prompt-based extraction) 방법에 비해 PII 유출이 실질적으로 더 크게 증가한다. 본 결과는 PII 유출에 대한 새로운 관점을 제공한다. 즉, 모델의 표상(representations) 안에 잠재 신호(latent signal)가 중첩(superposition)되어 존재하며, 이를 통해 위험의 증폭과 완화가 모두 가능하다는 것이다.

*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.

키워드
InferencePerspective (graphical)Leakage (economics)Superposition principleLanguage modelResidualInformation extractionSIGNAL (programming language)
타입
Preprint
IF / 인용수
- / 0
게재 연도
2026