주요 논문
5
*2026년 기준 최근 6년 이내 논문에 한해 Impact Factor가 표기됩니다.
1
Article
|
·
인용수 1
·
2025SinWaveFusion: Learning a single image diffusion model in wavelet domain
Jisoo Kim, Jiwoo Kang, Tae-Wan Kim, Heeseok Oh
IF 4.2 (2025)
Image and Vision Computing
https://doi.org/10.1016/j.imavis.2025.105551
Wavelet
Artificial intelligence
Image (mathematics)
Computer science
Domain (mathematical analysis)
Computer vision
Pattern recognition (psychology)
Mathematics
Mathematical analysis
2
Article
|
·
인용수 1
·
2024Blind Image Quality Evaluation using Pseudo Reference Images
Yunjeong Yong, Heeseok Oh
Journal of the Institute of Electronics and Information Engineers
무참조 이미지 화질 평가(no-reference image quality assessment; NR-IQA)는 참조 영상에 대한 정보가 주어지지 않은 상태에서 인간 시각 체계를 반영하여 이미지 화질 저하 수준을 객관적으로 정량화 하는 것을 목표로 한다. 기존 NR-IQA 기술은 특정 왜곡 특성에 대해 높은 민감성을 갖고 있으며, 의미론적 화질 인지 및 화질 저하 수준을 판단하기에는 한계를 지니고 있다. 본 논문에서는 기존 NR-IQA 접근 방식의 한계를 극복하고 예측 정확도를 향상시키기 위해 지역적 왜곡 패턴 추출과 고수준 의미 정보 추출에 보다 능숙한 완전 참조 (full-reference IQA; FR-IQA) 방식의 프레임워크를 따르는 NR-IQA 모델인 multi-scale pseudo image quality assessor(MPIQ)를 제안한다. 제안하는 MPIQ는 하이브리드 구조에 기반해 합성곱 네트워크를 통한 지역적 왜곡 패턴 추출과 트랜스포머 기반의 전역적 화질 수준 이해를 도모하며, 의사 참조 이미지 reconstructor와 quasi FR-IQA regressor라는 두 가지 모듈로 구성된다. 의사 참조 이미지 reconstructor는 FR-IQA 방식과 유사하게 화질 추론 모델이 동작할 수 있도록 인코더-디코더 구조를 차용하여 의사 참조 이미지를 재구성하고 이미지 왜곡 정보를 학습한다. 이 과정에서 크기 불변 왜곡 패턴의 추출을 위해 다중 스케일 구조를 반영하였다. Quasi FR-IQA regressor는 왜곡 이미지에서 추출된 특징과 의사 참조 이미지 특징의 차이를 통해 전역적 왜곡 수준을 도출함으로써 이미지 화질 수준을 최종적으로 예측한다. MPIQ는 주관적 평가를 통해 획득된 mean opinion score에 end-to-end로 학습되었으며, 실험 결과 기존 NR-IQA 기술 대비 20%의 성능 향상을 달성하였다.
https://doi.org/10.5573/ieie.2024.61.2.77
Artificial intelligence
Image quality
Computer science
Computer vision
Quality (philosophy)
Image (mathematics)
Pattern recognition (psychology)
3
Article
|
인용수 2
·
2024Detection-Free Object Tracking for Multiple Occluded Targets in Plenoptic Video
Yunjeong Yong, Jiwoo Kang, Heeseok Oh
IF 2.6 (2024)
Electronics
다중 객체 추적(MOT)은 시각 분야의 기본 과제이나, 플레노픽 비디오를 위한 MOT 기법은 희소하다. 높은 성능을 보이는 대부분의 2D MOT 알고리즘은 주로 탐지 기반 방법을 사용하며, 이는 특정 객체에 대해서만 동작한다는 단점을 가진다. 임의의 원하는 객체를 추적할 수 있도록 하기 위해, 본 논문은 플레노픽 비디오에서의 MOT를 위한 획기적인 비탐지 기반 추적 방법을 제안한다. 제안된 방법은 전통적인 탐지 기반 추적 방법과 달리, 가림(occlusion)이 존재하는 상황에서 표적을 추적하는 데 따른 어려움에 초점을 둔다. 본 논문은 플레노픽 비디오의 다초점(multifocal) 정보를 활용하는 특화 알고리즘을 제시하며, 가림 객체 추적에 대한 견고성을 확보하기 위해 초점 범위 제한(focal range restriction)과 동적 초점 범위 조정(dynamic focal range adjustment) 기법을 포함한다. 공간 탐색 능력을 향상시키기 위해, 앵커 앙상블(anchor ensemble)과 공간 탐색 영역의 동적 변화(dynamic change of spatial search region) 알고리즘 또한 제안된다. 또한 MOT 관점에서, 관련 계산 시간을 줄이기 위해 모션 적응형 시간 스케줄링(motion-adaptive time scheduling) 기법을 제안하며, 이는 일정 수준의 정확도를 보장하면서 계산 속도를 향상시킨다. 실험 결과, 추적 성능이 유의미하게 개선되었으며, 플레노픽 비디오에서 가림 표적에 대해 교집합 대비 합집합(intersection over union) 기준 77%의 성공률을 보였고, 이는 플레노픽 객체 추적 분야에서의 상당한 진전을 의미한다.
https://doi.org/10.3390/electronics13030590
Computer vision
Artificial intelligence
Video tracking
Computer science
Tracking (education)
Object (grammar)
Object detection
Computer graphics (images)
Pattern recognition (psychology)
Psychology
4
Article
|
인용수 114
·
2022Cybersickness and Its Severity Arising from Virtual Reality Content: A Comprehensive Study
Heeseok Oh, Wookho Son
IF 3.9 (2022)
Sensors
가상현실(VR) 경험은 흔히 부정적 영향인 사이버멀미(cybersickness)를 유발하며, 이는 오심, 방향감각 상실, 시각적 불편감을 초래한다. 카메라 이동, 시야각, 경로 길이, 프레임 기준, 조작성 등 다양한 VR 콘텐츠의 속성에 따라 사이버멀미의 정도가 어떻게 달라지는지를 정량적으로 분석하기 위해, 서로 다른 콘텐츠 속성을 대표하는 52개의 VR 장면으로 구성된 사이버멀미 기준(CYRE) 콘텐츠를 생성하였다. 렌더링된 VR 장면과 생체 신호와 같은 객관적 데이터와 더불어, 154명의 참가자로부터 가능한 한 신뢰성 있게 주관적 의견을 수집하기 위한 사이버멀미 평가 프로토콜을 설계하였다. 실험을 통해 얻은 데이터를 조사함으로써, 각 콘텐츠 요인에 따라 사이버멀미가 달라지는 정도와 관련된 통계적으로 유의미한 관계를 각각 별도로 확인하였다. 우리는 사이버멀미의 중증도가 뇌 활동을 반영하는 6가지 생물학적 특징(즉, Fp1 델타, Fp1 베타, Fp2 델타, Fp2 감마, T4 델타, T4 베타 파형의 상대 파워 스펙트럴 밀도)과 높은 상관관계를 보였으며, 결정계수는 0.9를 초과하였다. 또한, 우리의 실험 결과는 개인 특성(연령 및 취약성) 역시 사이버멀미 수준과 정량적으로 연관되어 있음을 보여주었다. 특히, 구성된 데이터셋에는 각 VR 장면에 대응하는 다수의 라벨(즉, 주관적 사이버멀미 점수)이 포함되어 있다. 우리는 이러한 라벨을 사용하여 사이버멀미 예측 모델을 구축하고 신뢰할 수 있는 예측 성능을 도출하였다. 따라서 제안된 데이터셋은 사이버멀미 정량화와 관련된 일반 목적 시나리오 전반에 널리 적용될 것으로 기대된다.
https://doi.org/10.3390/s22041314
Virtual reality
Computer science
Content (measure theory)
Controllability
Frame (networking)
Artificial intelligence
Mathematics
5
Article
|
인용수 7
·
2022Convolved Quality Transformer: Image Quality Assessment via Long-Range Interaction Between Local Perception
Heeseok Oh, Jinwoo Kim, Taewan Kim, Sanghoon Lee
IF 3.9 (2022)
IEEE Access
합성곱 신경망(CNN)과 트랜스포머(Transformer)로 구성된 하이브리드 아키텍처는 학습 표현의 한계를 확장하면서 다양한 비전 과제를 구현하려는 새로운 경향이다. CNN과 트랜스포머의 작동 메커니즘의 관점에서 볼 때, 이들에 대한 기능적 결합은 국소 왜곡 인지와 전역 품질 집계를 모두 활용해야 하는 화질 평가(IQA)에 적합하나, 이러한 접근을 적용한 연구는 드물다. 본 논문은 전체 참조(full-reference) IQA를 위한 종단 간(end-to-end) CNN-트랜스포머 하이브리드 모델인 convolved quality transformer(CQT)를 제시한다. CQT는 인간의 지각적 특성에서 영감을 받아, 품질 점수를 평가하기 위해 CNN과 트랜스포머의 장점을 통합하도록 설계되었다. CQT에서 합성곱 층은 국소 왜곡 특징 추출을 전문화하고, 트랜스포머는 이를 집계하여 이들 간의 장거리 상호작용을 통해 총체적 품질을 추정한다. 이러한 일련의 과정은 다중 스케일 특징 맵에서 반복되어 품질 표현을 민감하게 포착한다. CQT의 하위 모듈들이 각자의 역할을 적절히 수행하는지 검증하기 위해, 국소 왜곡으로부터 전역 품질을 추론하는 과정에서의 상호작용을 주의(attention) 시각화를 통해 심층적으로 분석한다. 마지막으로, 단계별(feature embeddings) 임베딩으로부터 지각적으로 풀링된 정보가 최종 품질 수준을 도출한다. 실험 결과는 제안된 모델이 기존의 데이터 기반 접근들에 비해 우수한 성능을 달성하며, 표준 데이터셋에 대해서도 잘 일반화됨을 보여준다.
https://doi.org/10.1109/access.2022.3209810
Computer science
Transformer
Artificial intelligence
Feature extraction
Pattern recognition (psychology)
Convolutional neural network
Image quality
Visualization
Computer vision
Image (mathematics)