혼합 전문가(Mixture-of-Experts, MoE)는 대규모 언어 모델(LLMs)을 확장하기 위한 대표적인 아키텍처로 부상하였다. 특히, 손쉽게 이용 가능한 미세조정된 LLM들을 전문가로 활용하는 방식은 MoE LLM을 개발하는 데 있어 효율적이고 유연한 접근법을 제공한다. 그러나 고성능이지만 신뢰할 수 없는 LLM을 MoE 시스템에 통합하는 것은 중대한 안전 위험을 수반하며, 이는 MoE LLM 시스템 전반의 안전성을 저해할 가능성이 있다. 현재까지는 공격자가 오염된(poisoned) 전문가 LLM을 도입함으로써 MoE LLM 서비스를 어떻게 훼손할 수 있는지에 대해 탐구한 연구가 없다. 본 논문에서는 MoE LLM의 안전을 훼손하도록 설계된 새로운 전문가 오염 공격인 MOEVIL을 제안한다. 우리는 MoE 시스템 내에서 표적 전문가로부터 유해한 영향이 확산되는 현상을 유해 선호 학습을 수행함으로써 다룬다. 다음으로, 이 전문가의 잠재 벡터(latent vector)를 전략적으로 조작하여 게이팅 네트워크(gating networks)를 기만한다. 이러한 조작은 유해한 질의에 대한 응답을 생성할 때 경로 배정(routing) 결정을 우회적으로(간접적으로) 오염된 전문가 쪽으로 유도한다. MOEVIL은 Llama 및 Qwen LLM을 기반으로 한 다양한 MoE 구성 전반에서, 단 하나의 전문가만 오염시키는 경우에도, 강력한 공격 성능을 보인다. 또한 MOEVIL은 Llama 기반 MoE LLM에서 유해성 점수를 0.58에서 79.42로 증가시키며, 기존의 유해한 전문가 오염 공격들을 능가한다. 더 나아가 우리의 결과는 효율적인 MoE 학습 전략과 결합된 안전 정렬(safety alignment)조차도 이러한 위험을 완전히 완화하지 못함을 보여준다. 본 연구 결과는 MoE 시스템에서 유해한 전문가가 야기하는 중대한 위협을 입증하며, MoE 기반 LLM 개발에서 견고한 안전 대책의 필요성을 강조한다. 우리의 구현은 https://github.com/jaehanwork/MoEvil 에서 제공된다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.