연구 영역
기본 정보
논문·특허
과제
구성원
읽는 시간 · 1분 28초

적대적 공격에 강인한 보안 ML: 워터마킹, 집합적 분류, 모델 인버전 및 MoE 안전

Adversarially Robust Security ML: Watermarking, Collective Classification, Model Inversion, and MoE Safety

연구 내용

딥러닝 모델의 소유권 증명과 악성 행위 탐지, 프라이버시 침해 위험, MoE LLM 안전성을 적대적·적응형 공격 관점에서 평가하고 대응 방안을 제시하는 연구

딥러닝 기반 보안 기능의 취약성을 적대적 시나리오에서 검증하기 위해 워터마킹의 소유권 증명 실패 원인을 적대 평가 설계와 적응형 공격 관점에서 분석합니다. 또한 Sybil 공격 환경에서 평판 기반 집합적 분류가 흔들리는 이유를 공격 예산과 모델 맞춤 전략의 영향으로 해석하고, 서로 다른 학습 집합에서 분류 결과의 안정성을 높이는 방식으로 강건성을 확보합니다. 아울러 예측에서 스타일을 추출하는 타깃 모델 인버전, 그리고 MoE LLM에서 오염된 expert가 게이팅 결정을 유도하는 공격을 통해 안전 정렬의 사각지대를 점검합니다. 이러한 결과를 기반으로 적대적 심층신경망 보정 개념과도 연결합니다.

관련 연구 성과

관련 논문

5

관련 특허

2

관련 프로젝트

0

연구 흐름

초기에는 딥러닝 모델 워터마킹이 실질적으로 소유권을 보장하는지, 기존 평가가 불완전하거나 적응형 위협을 간과했을 때 어떤 상한이 나타나는지에 집중했습니다. 이후 웹 서비스 신뢰를 위협하는 Sybil 공격에 대해 집합적 분류의 강건성을 학습 집합 변동성과 공격 예산 최적화 관점에서 확장했습니다. 동시에 모델 인버전과 MoE expert poisoning 같은 최신 위협을 대상으로, 예측 기반 정보 추출과 게이팅 유도 메커니즘이 안전성에 미치는 영향을 분석하는 흐름으로 심화되었습니다.

활용 가능성

활용 가능성은 알앤디써클 특화 AI 에이전트가 생성한 내용으로, 실제 연구 가능 여부는 연구실과의 논의가 필요합니다.

  • DNN 소유권 검증을 위한 워터마킹 강건성 평가
  • 적응형 공격 기반 보안 ML 평가 벤치마크
  • 악성 계정 탐지를 위한 강건 집합적 분류 설계
  • Sybil 공격 방어 안정성 강화
  • MoE LLM 전문가 오염 리스크 점검
  • 게이팅 우회 유도 공격 탐지 및 차단
  • 모델 인버전 위험도 평가 체계
  • 예측 기반 정보 추출 방지 정책
  • 안전 정렬의 잔여 위험 분석 도구
  • 적대적 심층신경망 보정 전략

관련 논문

구분

제목

1

Evaluating the Robustness of Trigger Set-Based Watermarks Embedded in Deep Neural Networks

2

RICC: Robust Collective Classification of Sybil Accounts

3

Targeted Model Inversion: Distilling Style Encoded in Predictions

4

Targeted Model Inversion: Distilling style encoded in predictions

5

MOEVIL: Poisoning Experts to Compromise the Safety of Mixture-of-Experts LLMs

관련 특허

구분

제목

1

악성 계정 탐지를 위한 무작위 추출 기반 집합적 분류 방법 및 시스템

2

적대적 예시에 대한 심층신경망 보정 방법 및 장치