Energy-Latency Optimization via Adaptive Computation in Spiking Transformers
연구 내용
스파이킹 네트워크 기반 비전 Transformer에서 적응적 연산 시간을 Spatio-temporal 관점으로 통합하고, 입력 표현 안정화와 토큰 프루닝으로 에너지와 지연을 동시에 개선하는 연구
본 연구는 spiking neural network의 에너지 이점을 유지하면서 다중 타임스텝 연산으로 인한 높은 지연과 연산량을 줄이는 데 초점을 둡니다. adaptive computation time 개념을 Spiking Transformer에 적용하기 위해, temporal similarity 전제를 만족시키도록 spike patch splitting을 통합 입력 표현으로 구성합니다. 이어서 적응형 spiking self-attention을 통해 spatial·temporal 축에서 토큰을 동적으로 pruning하여 불필요한 연산을 줄입니다. 또한 정적 아키텍처 한계를 동적 계산 정책과 공동 설계하여 저전력·실시간 요구를 충족하는 방향으로 기술을 정립합니다.
관련 연구 성과
관련 논문
1편
관련 특허
0건
관련 프로젝트
1건
연구 흐름
초기에는 SNN 기반 Transformer가 갖는 지연·계산 오버헤드를 줄이기 위한 동적 연산 시간 아이디어를 검토하는 단계로 시작되었습니다. 이후 adaptive computation time의 핵심 전제가 Spiking Transformer에서 어떻게 깨지는지를 분석하고, temporal 안정성을 확보하기 위한 입력 표현 설계를 포함한 공동 설계 개념으로 확장했습니다. 그 결과 통합 spike patch splitting 모듈을 도입해 temporal 불일치를 완화하고, 이후 적응형 spiking self-attention이 공간·시간 양축에서 token pruning을 수행하도록 연구를 구체화했습니다. 최근에는 이러한 구조를 실제 저전력 실행을 목표로 한 뉴로모픽 AI 반도체 플랫폼 연구로 연결하는 흐름을 보입니다.
활용 가능성
활용 가능성은 알앤디써클 특화 AI 에이전트가 생성한 내용으로, 실제 연구 가능 여부는 연구실과의 논의가 필요합니다.
관련 논문
구분
제목
STAS: Spatio-Temporal Adaptive Computation Time for Spiking Transformers
관련 프로젝트
구분
제목
초저전력 뉴로모픽 AI 반도체 기반 실시간 LMM 플렛폼 연구