연구 영역
기본 정보
논문·특허
과제
구성원
Preprint|
인용수 0
·2025
TiTok: Transfer Token-level Knowledge via Contrastive Excess to Transplant LoRA
Cheolsoo Jung, Jae‐Hyung Kim
arXiv (Cornell University)
초록

대규모 언어 모델(LLM)은 실제 환경에서 널리 적용되고 있으나, 이를 미세조정(fine-tuning)하는 데에는 상당한 계산 및 저장 비용이 수반된다. LoRA와 같은 매개변수 효율적 미세조정(Parameter-Efficient Fine-Tuning, PEFT) 방법은 이러한 비용을 완화하지만, 적응된 매개변수는 기반(base) 모델에 의존하므로 서로 다른 백본(backbone)으로는 전이될 수 없다. 이러한 문제를 해결하는 한 방법은 지식 증류(knowledge distillation)이지만, 그 효과는 본질적으로 학습 데이터에 의존한다. TransLoRA와 같은 최근 연구는 합성 데이터를 생성함으로써 이를 회피하고자 했으나, 추가 판별자(discriminator) 모델을 학습해야 하므로 복잡성이 증가한다. 본 논문에서는 토큰 수준 지식 전이를 통해 효과적인 LoRA 이식(Transplantation)을 가능하게 하는 새로운 프레임워크인 TiTok을 제안한다. 구체적으로, TiTok은 LoRA가 적용된 소스 모델과 적용되지 않은 소스 모델 간의 토큰 단위 대조(contrastive) 초과분(excess)을 통해 과업에 유의미한 정보를 포착한다. 이 초과분은 유익한 토큰을 부각시키며, 추가 모델이나 오버헤드 없이 합성 데이터에 대한 선택적 필터링을 가능하게 한다. 다수의 전이 설정에 걸쳐 3개의 벤치마크에서 수행한 실험을 통해, TiTok이 전반적으로 일관되게 효과적이며 기준선(baselines) 대비 평균 성능 향상이 +4~10%에 이르는 것을 확인하였다.

*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.

키워드
DiscriminatorTransfer (computing)Knowledge baseTraining setKnowledge transferTransfer of learningWork (physics)
타입
Preprint
IF / 인용수
- / 0
게재 연도
2025