프로젝트 소개
본 과제는 인터넷, IoT 기기, SNS 등에서 계속 생성되는 대용량 데이터를 빠르게 모으고, 여러 컴퓨터가 나누어 학습한 뒤 새로운 데이터를 기존 모델에 반영하는 분산 데이터 파이프라인을 개발하는 연구임. 이를 통해 데이터가 지속적으로 들어오는 상황에서도 인공지능 모델을 효율적으로 갱신하는 기술 확보가 목적임.
연구 목표는 데이터 수집, 데이터 ingestion, 분산 학습, 점진적 모델 업데이트로 이어지는 전체 파이프라인 구축과 edge computing 환경의 연합학습 확장 적용임. 핵심 연구 내용은 분산 웹 크롤링과 중복제거, Kafka기반 데이터 ingestion 구조 최적화, 물리적으로 분할된 분산학습 모델 개발, pretrained model 기반 전이 연합학습 구현임. 또한 지속 유입 데이터의 점진적 반영 기술과 이미지·자연어·로그·SNS 기반 Real World 벤치마크를 마련하여 성능 평가를 수행함. 기대 효과는 오픈소스 기반 데이터 파이프라인 활용 확대와 수평적 확장성 및 수직적 확장성을 결합한 학습 기술 확보임. 자율주행, 사이버보안 감시센터, 에너지 및 IoT 분야의 실시간 판단과 모델 업데이트에 활용 가능함.