연구 영역
기본 정보
논문·특허
구성원
Preprint|
인용수 0
·2025
One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL
Hyungjoo Chae, Dong-Jin Kang, Kim, Jihyuk, Beong-woo Kwak, Sunghyun Park, Haeju Park, Jinyoung Yeo, Moontae Lee, Kyungjae Lee
ArXiv.org
초록

R1의 공개와 함께, 대규모 추론 모델(LRM)이 널리 이용 가능해짐에 따라 연구자들은 흔히 R1의 긴 연쇄 사고(CoT) 추론에 언어 모델을 학습시키는 방식으로 새로운 LRM을 훈련한다. 기존 연구들은 LRM의 역량이 직접 증류를 통해 재현될 수 있음을 보여주었지만, (예: R1) 기존 모델에 대한 지속적인 의존은 해당 분야의 발전을 가로막는 핵심적인 한계로 남아 있다. 독립적인 LRM 개발을 위한 첫 단계로서, 본 논문은 추론 시점에서 스케일링하도록 학습되지 않은 LLM들로 긴 CoT 데이터셋을 구성할 수 있는 가능성을 탐색한다. 이를 위해, 우리는 기존의 짧은 CoT LLM들을 사용해 주석을 단 100K 규모의 CoT 정당화(rationale)로 이루어진 데이터셋인 Long CoT Collection을 제시한다. 또한 o1의 새로운 추론 전략을 짧은 CoT LLM들로 유도하는 파이프라인을 개발하여, 이들이 더 오랫동안 사고하도록 하고 사고 예산(thought budget)에 대한 제어 가능성을 도입함으로써 과잉사고(overthinking) 문제를 더 잘 관리할 수 있게 한다. 광범위한 분석을 통해, 본 데이터셋이 R1에 필적하는--또는 약간 더 낮은--품질을 달성함을 검증한다. 더 나아가 본 실험은, 본 데이터셋으로 학습하는 것이 일반적인 추론 능력을 강화할 뿐 아니라 강화학습을 위한 탄탄한 기반을 제공함을 보여준다. 즉, 본 데이터로 초기화된 모델은 RLVR에서 2–3배 더 큰 향상을 보인다.

*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.

키워드
Pipeline (software)ControllabilityQuality (philosophy)Training setFoundation (evidence)Reinforcement learning
타입
Preprint
IF / 인용수
- / 0
게재 연도
2025