온디바이스 AI에 대한 수요가 증가함에 따라, 추론 성능을 향상시키면서도 계산 비용과 지연 시간을 최소화하기 위해 엣지 및 모바일 기기에서 경량 소규모 대규모 언어 모델(sLLM)을 배치하려는 노력이 확대되고 있다. sLLM의 디코더 레이어 수가 감소할수록, 임베딩 레이어는 모델 전체 파라미터와 메모리 사용량에서 상당한 비중을 차지한다. 이에 따라 효율적인 데이터 압축이 중요하지만, 양자화 및 프루닝과 같은 기존 방법은 오류에 민감한 임베딩 레이어에 적용할 경우 정확도를 크게 저하시킨다. 또한 임베딩 레이어 연산은 산술 집약도(바이트당 연산 횟)가 낮아 메모리 바운드 특성을 보인다. 이러한 한계는 기존 폰 노이만(von Neumann) 아키텍처에서 처리-내-메모리(Processing-in-Memory, PIM) 아키텍처로의 전환을 요구한다. 본 논문은 (1) sLLM 임베딩 레이어를 위한 무손실 압축 알고리즘인 XOR 기반 마스킹 압축(XOR-based Masking Compression, XMC), 및 (2) 임베딩 레이어의 메모리 병목을 완화하기 위해 XMC를 PIM 아키텍처에 통합한 PriME를 제안한다. XMC는 ADD 및 XOR 마스킹을 사용하여 16비트 FP 데이터에서 0비트 표현을 향상시키며, 평균 압축률 를 달성하면서 3-사이클의 압축 해제 지연으로 구현 가능하다. PriME는 PIM 내에서 압축 데이터를 병렬 처리할 수 있게 하여, GPU 대비 임베딩 연산을 평균 가속하고 최대 까지 향상시키는 동시에, 에너지 소비를 30% 이상 감소시켜 평균 에너지 효율이 개선된다. 광범위한 적용을 위해 설계된 PriME는 다양한 sLLM과 호환되며, 멀티모달 소형 비전 언어 모델로의 확장까지 고려한 확장성을 갖추고 있어 효율적인 AI 가속을 위한 다목적성을 보여준다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.