트리거 세트 기반 워터마킹 기법은 심층 신경망 모델 소유자에 대한 소유권을 입증하는 수단을 제공한다는 점에서 최근 주목받고 있다. 본 논문에서는 최신 트리거 세트 기반 워터마킹 알고리즘들이 설계된 목표인 소유권 입증을 달성하지 못한다고 주장한다. 이러한 기능 저하는, 기존 연구에서 워터마킹 알고리즘의 견고성을 평가할 때 흔히 범해 온 두 가지 공통적인 실험적 결함으로부터 비롯된다고 본다: (1) 불완전한 적대적 평가와 (2) 간과된 적응적 공격. 우리는 11개의 대표적인 워터마킹 기법을 기존 공격 6종에 대해 종합적인 적대적 평가를 수행하였으며, 그 결과 각 워터마킹 기법이 적어도 두 가지 비적응적 공격에 대해 견고성을 결여함을 확인하였다. 또한 우리는 표적 모델의 기저 워터마킹 알고리즘에 대한 적대자의 지식을 활용하는 새로운 적응적 공격을 제안한다. 제안된 공격은 11개의 모든 워터마킹 기법을 효과적으로 무너뜨려, 결과적으로 워터마킹된 어떠한 모델에 대해서도 적대자가 소유권을 가리는 것이 가능함을 보여준다. 후속 연구에서는 우리의 적응적 공격을 포함하여, 소유권 워터마킹 기법의 견고성을 입증하기 위한 종합적인 적대적 평가를 수행함으로써 워터마킹 견고성의 의미 있는 상한을 제시하는 데 있어 우리의 지침을 고려할 것을 권장한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.