4차산업 및 AI 주도 시대에 딥리닝 기계학습의 중요성은 날로 커지고 있다. 그런데, 기계학습 및 AI 알고리즘의 실시간성과 메모리에 들어가지 않는 실제적인 대용량 데이터에 대한 연구는 미흡한 실정이다. 또한, 엣지디바이스에 특화된 기계학습 및 AI알고리즘의 연구는 상당히 미흡하다. 본 연구에서는 센서 데이터와 같이 메모리에 들어가지 않는 대용량 데이터를 ...
실시간 데이터
온라인 학습
분산최적화
딥러닝
엣지컴퓨팅
2
주관|
2021년 8월-2023년 8월
|211,276,000원
커머스 빅데이터 분석 기반 AI 추천 시스템 구현과 차세대 커머스 네트워크 플랫폼 구축
본 과제는 네트워크 커머스 플랫폼에 트래킹·데이터 수집과 AI 추천을 결합해 다양한 쇼핑 채널로 상품을 노출·연결하는 기능을 구현하는 연구임.
연구 목표는 커머스 빅데이터 분석과 Multi-Domain 추천 알고리즘, 실시간(On-line) 추천, time 정보 반영 추천을 고도화하고 inapp SDK, DMP 연동, 고객 행태기반 상품 타겟팅, 주간·월간 트래픽 분석, ADMIN 관리, api 기반 상품 연동(항공·숙박·예약·Activity), 이벤트/프로모션 모듈을 구축하는 데 있음. 기대 효과는 판매 전환율 향상, 운영 비용 절감, 제휴사 UI/UX 변경 기반 저비용 쇼핑몰 구축, 초기 상품 소싱 비용 대폭 절감임.
본 과제는 커머스 플랫폼을 만들어 판매·광고·데이터 수집·추천까지 한 흐름으로 제공하는 연구임.
연구 목표는 커머스 플랫폼 기본 Admin 기능과 커머스 네트워크 특화 기능을 구현하고, 커머스 빅데이터 분석 및 AI 추천 알고리즘을 개발해 상품 전시를 정교화하는 데 있음. 핵심 연구 내용은 로그인·주문·상품·회원·게시판·프로모션/쿠폰 등 쇼핑 Admin 구현, 타겟 광고 관리와 채널 유입 광고 web SDK (javascript), 모듈별 API 및 배송 확장, 상품 전시 매체 필터링·변수 기준 상품 타겟팅(성별 연령 타겟팅)·추천알고리즘 기반 상품 타겟팅, 셀러드 발급정보 수집 및 SDK 수집정보 반영·매체 고객정보 수집, 상품 클릭/view/장바구니/구매 데이터 수집, Word2Vec·CNN(Convolutional Neural Network)&Transfer Learning 기반 DMP 및 CB(Contents Based)·CF(Collaborative Filtering)·앙상물 추천 시스템 개발임. 기대 효과는 운영 비용 절감과 판매전환율 향상, 제휴사의 저비용 UI/UX 변경 기반 자체 쇼핑몰 구축, 초기 상품 소싱 비용 절감 및 채널 다양화를 통한 노출 확대 기대임.
1. 먼저 실시간 대용량데이터에 대한 특성 패턴화 작업을 수행하는 방법을 개발한다.
이를 위해, 실시간 대용량데이터에 대해 Connective Dependence 방식으로 군집화와 이상치 탐지를 할 수 있는 알고리즘을 개발한다. 또한, 이상치 제거의 실시간 의사결정을 위하여, oc-svm 기반의 최적 이상치 탐지 알고리즘을, 데이터의 sample generatin 방법을 통해 개발한다.
데이터 sample generation 방법은 실시간 대용량 데이터의 기하공간 구조에 기반하여 정상상황의 데이터와 이상치 데이터의 경우로 나누어 생성하고, 최적 탐지 알고리즘에 사용한다. 위의 방법을 통해 실시간 데이터의 군집 특성과 패턴을 찾아낼 수 있게 된다.
2. 다음으로, 실시간 대용량데이터의 예측 모형 방법을 개발한다.
이를 위해, 크게 3가지 모형을 개발하고 한다. 첫째로, ARIMA 기반 방법을 실시간 대용량에 맞게 바꾸는 작업과 둘째로, 분산최적화 방법인 ADMM을 사용하여 딥뉴럴네트워크 예측 모형을 개발하고 한다.
실시간 대용량데이터 특화된 ARIMA 그룹 회귀 모형의 이론적 및 실험적 특징을 확인하고 실시간 예측 모형을 구성한다. 그리고, 딥러닝에서 기본적으로 사용되는 딥뉴럴네트워크에서 실시간 대용량 데이터가 안정적으로 예측이 되도록 sparse한 학습이 가능하게 만든다. 이는 딥러닝의 '큰 파라미터 공간' 문제를 해결함과 동시에 실시간 대용량 데이터에 대한 성능을 보장해주는 주요한 연구 결과가 될 것이다. 랜덤포레스트에 대하여 실시간 데이터에 대한 온라인 트리 업데이트 및 트리 제거 및 추가 알고리즘을 개발하고 한다.
3. 마지막으로, 실시간 대용량에 특화된 기계학습 알고리즘을 해석과 적용이 가능하도록 모형 해석기를 개발하고자 한다. 모형 해석기를 통하여 기계학습 결과를 사용하여 의사결정을 할 때에, 변수의 선택과 설정이 가능하게 한다. 또한, 개발된 기계학습 알고리즘을 실시간 반도체 공정데이터, 대용량 타이어 실험 데이터, 실시간 전력 센서데이터에 적용하여 검증하도록 한다.
1. 먼저 실시간 대용량데이터에 대한 특성 패턴화 작업을 수행하는 방법을 개발한다.
이를 위해, 실시간 대용량데이터에 대해 Connective Dependence 방식으로 군집화와 이상치 탐지를 할 수 있는 알고리즘을 개발한다. 또한, 이상치 제거의 실시간 의사결정을 위하여, oc-svm 기반의 최적 이상치 탐지 알고리즘을, 데이터의 sample generatin 방법을 통해 개발한다.
데이터 sample generation 방법은 실시간 대용량 데이터의 기하공간 구조에 기반하여 정상상황의 데이터와 이상치 데이터의 경우로 나누어 생성하고, 최적 탐지 알고리즘에 사용한다. 위의 방법을 통해 실시간 데이터의 군집 특성과 패턴을 찾아낼 수 있게 된다.
2. 다음으로, 실시간 대용량데이터의 예측 모형 방법을 개발한다.
이를 위해, 크게 3가지 모형을 개발하고 한다. 첫째로, ARIMA 기반 방법을 실시간 대용량에 맞게 바꾸는 작업과 둘째로, 분산최적화 방법인 ADMM을 사용하여 딥뉴럴네트워크 예측 모형을 개발하고 한다.
실시간 대용량데이터 특화된 ARIMA 그룹 회귀 모형의 이론적 및 실험적 특징을 확인하고 실시간 예측 모형을 구성한다. 그리고, 딥러닝에서 기본적으로 사용되는 딥뉴럴네트워크에서 실시간 대용량 데이터가 안정적으로 예측이 되도록 sparse한 학습이 가능하게 만든다. 이는 딥러닝의 '큰 파라미터 공간' 문제를 해결함과 동시에 실시간 대용량 데이터에 대한 성능을 보장해주는 주요한 연구 결과가 될 것이다. 랜덤포레스트에 대하여 실시간 데이터에 대한 온라인 트리 업데이트 및 트리 제거 및 추가 알고리즘을 개발하고 한다.
3. 마지막으로, 실시간 대용량에 특화된 기계학습 알고리즘을 해석과 적용이 가능하도록 모형 해석기를 개발하고자 한다. 모형 해석기를 통하여 기계학습 결과를 사용하여 의사결정을 할 때에, 변수의 선택과 설정이 가능하게 한다. 또한, 개발된 기계학습 알고리즘을 실시간 반도체 공정데이터, 대용량 타이어 실험 데이터, 실시간 전력 센서데이터에 적용하여 검증하도록 한다.