RnDCircle Logo
온병원 연구실
국립군산대학교 소프트웨어학과 온병원 교수
자연어처리
에세이 자동 평가
창의성 평가
홈
연구 영역
기본 정보
논문·특허
과제
구성원
홈

온병원 연구실

국립군산대학교 소프트웨어학과 온병원 교수

온병원 연구실은 소프트웨어 분야에서 기계학습 및 데이터 마이닝 기반의 자연어 처리 연구를 수행합니다. 특히 에세이 자동 평가와 창의성 점수 예측을 위해 감성 반영 학습데이터 생성, 희귀 토큰 기반 표현 분석, 대조학습 기반 BERT 모델을 결합합니다. 또한 추상적 요약에서는 잠재공간 클러스터 패턴을 학습하는 인코더-디코더 구조를 설계합니다. 아울러 유해 표현과 사이버범죄 은어, 낚시성 문장 탐지를 위해 신경망 분류와 오토인코더 기반 잠재 유사도 비교 프레임워크를 활용합니다.

자연어처리에세이 자동 평가창의성 평가대조학습 BERT희귀 토큰 분석
대표 연구 분야
연구 영역 전체보기
에세이 창의성 평가 및 자동 피드백을 위한 NLP 모델 thumbnail
에세이 창의성 평가 및 자동 피드백을 위한 NLP 모델
Automated Essay Scoring and Creativity Evaluation via NLP Data Generation
연구 분야 상세보기
잠재공간 클러스터 패턴을 이용한 추상적 요약 모델 thumbnail
잠재공간 클러스터 패턴을 이용한 추상적 요약 모델
Abstractive Summarization with Latent Cluster Patterns
연구 분야 상세보기
사이버범죄 은어 및 유해 콘텐츠를 탐지하는 딥러닝 텍스트 분류 thumbnail
사이버범죄 은어 및 유해 콘텐츠를 탐지하는 딥러닝 텍스트 분류
Deep Text Classification for Cybercrime Slang and Harmful Content Detection
연구 분야 상세보기
연구 성과 추이
표시된 성과는 수집된 데이터 기준으로 산출되며, 일부 차이가 있을 수 있습니다.
주요 논문
5
논문 전체보기
1
Article
|
·
인용수 3
·
2023
A Pooled RNN-based Deep Learning Model based on Data Augmentation for Clickbait Detection
Jeong-Jae Kim, Sang-Min Park, Byung-Won On
The Journal of Korean Institute of Information Technology
최근 가짜 뉴스 탐지 문제는 데이터 공학에서 가장 시급한 문제 중 하나이다. 본 논문에서는 가짜 뉴스 탐지 문제 중 가장 본질적인 문제인 낚시성 기사 탐지 문제를 해결하기 위해 두 가지의 새로운 접근 방법을 제안한다. 먼저, RNN 기반의 Bi-LSTM 다중 계층들, max-pooling 계층들, 그리고 fully-connected 계층들로 구성된 딥러닝 모델을 제안한다. 또한, 딥러닝 모델의 정확도를 향상하기 위해 대용량, 고품질의 학습 데이터를 자동으로 생성하는 데이터 증강 알고리즘을 제안한다. 제안된 알고리즘으로 생성된 학습 데이터가 인간 평가자가 만든 데이터와 거의 일치함을 보인다. 제안된 딥러닝 모델은 기존 주요 방안에 비해 36% 정확도 향상시키며, 학습 데이터를 자동으로 생성하는 새로운 접근 방식은 딥러닝 모델의 정확도를 크게 높인다. 이러한 제안방안은 낚시성 기사 감지를 위해 현재까지 시도되지 않은 새로운 연구이다.
https://doi.org/10.14801/jkiit.2023.21.4.45
Recurrent neural network
Pooling
Artificial intelligence
Computer science
Deep learning
Machine learning
Artificial neural network
2
Article
|
인용수 7
·
2023
Learning Cluster Patterns for Abstractive Summarization
Sung-Guk Jo, Seunghyuk Park, Jeong-Jae Kim, Byung-Won On
IF 3.4 (2023)
IEEE Access
최근 PEGASUS 및 BART와 같은 사전학습된 시퀀스-투-시퀀스 모델이 추상적 요약에서 최첨단 성능을 보이고 있다. 이러한 모델에서 파인튜닝 동안 인코더는 문장을 잠재 공간의 문맥 벡터로 변환하고, 디코더는 문맥 벡터에 근거하여 요약 생성 과제를 학습한다. 본 접근법에서는 중요한(context salient) 문맥 벡터와 중요하지 않은(context non-salient) 문맥 벡터의 두 군집을 고려하며, 이를 통해 디코더가 요약 생성 시 중요한 문맥 벡터에 더 집중(attend)할 수 있도록 한다. 이를 위해 인코더와 디코더 사이에 새로운 군집 생성기 레이어(cluster generator layer)를 제안하는데, 이 레이어는 먼저 중요한 및 중요하지 않은 벡터의 두 군집을 생성한 뒤, 잠재 공간에서 군집들이 서로 분리되도록 정규화(normalizes)하고 군집의 규모를 축소(shrinks)한다. 실험 결과, 제안된 모델은 이러한 구별되는 군집 패턴을 학습함으로써 CNN/DailyMail 및 XSUM 데이터셋에서 BART와 PEGASUS와 같은 최첨단 모델보다 성능이 우수했으며, ROUGE는 최대 2~30%, BERTScore는 0.1~0.8%까지 향상되었다.
https://doi.org/10.1109/access.2023.3346911
Automatic summarization
Salient
Computer science
Context (archaeology)
Generator (circuit theory)
Artificial intelligence
Sequence (biology)
Encoder
Cluster (spacecraft)
Context model
3
Article
|
·
인용수 0
·
2023
Training Set Creation Method for Essay Creativity Score Prediction Models
Deokgi Kim, Sangwoo Han, S.-H. Park, Yougyeon Kim, Sanghyun Park, Junyoung Jo, Seoin Choi, Youbin Lee, Daegon Yu, Byung-Won On
The Journal of Korean Institute of Information Technology
학생들은 에세이를 작성해보면서, 제4차 산업혁명에 꼭 필요한 창의성을 키울 수 있다. 그러나 현재 수작업에 의존하는 창의성 평가방식은 주관적이며, 많은 예산과 시간이 소요된다. 따라서 대량의 에세이에서 창의성을 정량적으로 평가할 수 있도록 인공지능 모델을 개발하는 것이 중요하다. 본 논문에서 에세이 창의성 점수 예측모델에 필요한 학습데이터를 구축하는 방안을 제안하고, 대용량 학습데이터를 효과적으로 구축할 수 있도록 웹기반 레이블링 시스템을 개발한다. 제안 시스템을 통해, 약 3,766개의 에세이에 대한 학습데이터를 구축하였고 심도 있는 분석을 통해, 3명의 평가자 간 Kendall 점수는 평균 82.7%로 평가자 간 강한 상관관계를 보였고, 가설검정을 통해 제안 시스템을 사용하는 것이 기존 수작업 방식보다 통계적으로 유의미한 것을 보였다.
https://doi.org/10.14801/jkiit.2023.21.10.69
Creativity
Set (abstract data type)
Training set
Computer science
Artificial intelligence
Psychology
Social psychology
Programming language
최신 정부 과제
5
과제 전체보기
1
2022년 3월-2027년 2월
|449,389,000원
텍스트의 창의성 평가 및 피드백을 위한 인공지능 기술 개발
창의적인 글쓰기 능력은 일상생활과 직업 세계, 그리고 학문 분야에 이르기까지 폭넓게 요구되고 있다. 제4차 산업혁명 시대에서는 새로운 지식과 독창적인 아이디어를 창출하고 그것을 효과적으로 표현할 수 있는 능력을 갖춘 인재를 필요로 한다. 이 연구에서는 창의적인 글쓰기 능력을 평가할 수 있는 객관적인 기준을 연구하고, 입력으로 주어진 텍스트의 창의성을 평가하...
창의적인 글쓰기 평가
창의성 평가 학습데이터
자연어처리 기술
인공지능
설명가능한 AI
심층학습
전이학습
변분
2
주관|
2019년 6월-2022년 2월
|137,500,000원
지능형 챗봇을 위한 한국어 감성분석 기술 개발
<1차년도> o 대용량 감성어휘를 포함하는 한국어 감성사전 구축을 위한 빅데이터 및 인공지능 기술 개발 - 국립국어원의 표준국어대사전(511,414개 어휘 수록)과 한국어 원시 말뭉치(1억2천3백만 어휘 수록)로부터 감성 어휘를 추출하기 위한 맵리듀스 기반의 분산 처리 및 딥 러닝 기반의 기계학습 모형 개발 o 신조어 식별 및 감성 판별 기술 및 운용 시스템 개발 - 감성 반응(sentiment-aware) 웹 크롤링 기술 개발 - 신조어 식별, 감성 자동 판별 모형 개발 - 신조어 감성어휘 수집기 개발 <2차년도> o 도메인 감성사전 자동 생성 기술 개발 - 일반 한국어 감성사전을 기초자료로 활용하여 도메인 의존적ㅇ니 감성 어휘 추출 및 추출 어휘의 극성 및 정도 값 자동 판별 모형 개발 - 특정 도메인을 입력하여 도메인 의존 감성어 식별, 감성 판별 및 저장 등의 기능을 수행하는 도메인 감성사전 자동 생성 엔진 개발 o 문맥 분석을 통한 단어 보다는 구 또는 절 등의 n-그램 감성 표현 추출 기술 개발 - 형태소 분석 및 의존 구문 분석을 통해 n-그램 형태의 감성 표현 추출을 위한 딥 러닝 모형 개발 <3차년도> o 지능형 챗봇을 위한 한국어 감성분석 기술 개발 - 기존 감성분석 방법을 사용할 경우에 발생하는 문제점 해결 - 지능형 챗봇에 적합 감성분석 기술을 임베딩 하는 새로운 딥 러닝 모델 개발 - 지능형 챗봇 감성분석 기술을 위한 평가 세트, 평가 지표, 평가 모형 개발
감성분석
자연어처리
인공지능
심층학습
지능형 챗봇
감성사전
도메인 감성사전
문맥 기반 감성사전
감성 반응 웹
3
주관|
2016년 6월-2019년 5월
|150,000,000원
빅데이터 시대의 사회조사분석사를 위한 공개 소프트웨어 개발
o 설문 문항에 대한 여론조사 결과 생성 알고리즘 개발 - 빅데이터 감성분석을 통한 설문조사 결과 생성 o 딥러닝 기반의 웹 페이지 분류 모형 개발 - 여론조사 및 시장조사와 관련 없는 웹 페이지 제거 o 토픽 자동 추출 알고리즘 개발 - 텍스트 데이터로부터 주요 토픽 추출 및 알고리즘 자동화 o 분산 인메모리 기반의 토픽 추출 알고리즘 개발 - 기존 맵리듀스 성능을 개선한 스파크에 최적화된 토픽 추출 알고리즘 개발 o 딥러닝을 통한 토픽 요약 알고리즘 개발 - 추출된 토픽에 대한 구체적인 사건이나 내용 파악 o 기개발된 알고리즘의 오픈 소스화 - 웹 기반의 토픽 추출 및 요약 결과 비주얼라이제이션
빅데이터
여론조사
시장조사
사회조사분석사
문서요약
기계학습
토픽모델
딥러닝
스파크
최신 특허
특허 전체보기
상태출원연도과제명출원번호상세정보
등록2021에세이 분류 장치의 동작 방법 및 이를 수행하는 에세이 분류 장치1020210089643
등록2017버킷 단위의 정렬을 기반으로 하는 해시 충돌 처리 방법1020170096213
등록2017비휘발성 메모리의 PCM+ 트리 데이터베이스화 방법1020170018282
전체 특허

에세이 분류 장치의 동작 방법 및 이를 수행하는 에세이 분류 장치

상태
등록
출원연도
2021
출원번호
1020210089643

버킷 단위의 정렬을 기반으로 하는 해시 충돌 처리 방법

상태
등록
출원연도
2017
출원번호
1020170096213

비휘발성 메모리의 PCM+ 트리 데이터베이스화 방법

상태
등록
출원연도
2017
출원번호
1020170018282