인간 피드백 기반 강화학습

RLHF(Reinforcement Learning from Human Feedback, 인간 피드백 기반 강화학습)는 인공지능 모델, 특히 거대 언어 모델(LLM)이 생성하는 결과물을 인간의 가치관, 의도, 선호도에 맞게 정렬(Alignment)시키기 위해 사용되는 머신러닝 훈련 기법이다. 단순한 다음 단어 예측을 넘어, 인간 관점에서 유용하고 무해하며 정직한(Helpful, Harmless, Honest) 답변을 도출하도록 모델의 행동을 교정한다.

RLHF 파이프라인은 일반적으로 세 가지 핵심 단계로 구성된다.

  1. 지도형 미세조정(SFT, Supervised Fine-Tuning): 고품질의 프롬프트와 사람이 직접 작성한 답변 데이터셋을 사용하여 사전 훈련된 모델을 1차적으로 미세조정한다.
  2. 보상 모델(Reward Model) 훈련: 모델이 하나의 프롬프트에 대해 여러 개의 다른 응답을 생성하면, 인간 평가자가 응답의 품질에 순위를 매긴다. 이 선호도 데이터를 바탕으로 특정 응답이 주어졌을 때 평가 점수(스칼라 값)를 예측하는 독립된 신경망인 보상 모델을 훈련한다.
  3. 강화학습 훈련 (PPO 적용): 언어 모델이 답변을 생성하면 보상 모델이 점수를 부여한다. 이 컴퓨팅된 보상 수치를 극대화하는 방향으로 PPO(Proximal Policy Optimization) 같은 강화학습 알고리즘을 적용하여 언어 모델의 가중치를 최종 업데이트한다.

모델 정렬(Alignment)을 위해 업계에서 주로 사용되는 과정인 지도형 미세조정(SFT), 기존의 RLHF, 그리고 최근 RLHF의 대안으로 부상한 DPO(Direct Preference Optimization)의 구조적 차이와 특징은 다음과 같다.

정렬 방법론핵심 메커니즘훈련 인프라 및 복잡도뚜렷한 장단점
SFT (Supervised Fine-Tuning)고품질의 정답(질문-답변 쌍) 데이터를 모델이 직접 모방하도록 지도 학습 수행낮음 (단일 언어 모델만 훈련)훈련이 빠르고 직관적이나, 지시에 없는 엣지 케이스나 미묘한 인간의 선호도를 반영하는 데 한계가 있음
RLHF (Reinforcement Learning from Human Feedback)독립된 보상 모델을 훈련한 뒤, PPO 알고리즘을 통해 보상 최적화 방향으로 모델 피드백 루프 구성높음 (언어 모델, 보상 모델 구조 및 강화학습 파이프라인 동시 유지 필요)모델의 성능과 뉘앙스를 대폭 향상시키나, 여러 모델을 동시에 로드해야 하므로 훈련 비용이 크고 하이퍼파라미터 조율이 불안정함
DPO (Direct Preference Optimization)보상 모델 훈련과 강화학습 단계를 생략하고, 선호/비선호 데이터를 수식적으로 변환하여 언어 모델에 직접 최적화중간 (SFT와 유사한 자원 소모, 데이터 구축은 RLHF와 동일)RLHF의 불안정성을 제거하고 메모리 비용을 크게 절감하지만, 선호도 데이터의 품질(노이즈)에 극도로 민감하게 반응함

출처 (Sources):

  • Ouyang, L., et al. (2022), “Training language models to follow instructions with human feedback”. Advances in Neural Information Processing Systems (NeurIPS). Available at: https://arxiv.org/abs/2203.02155
  • Christiano, P. F., et al. (2017), “Deep Reinforcement Learning from Human Preferences”. Advances in Neural Information Processing Systems (NeurIPS). Available at: https://arxiv.org/abs/1706.03741
  • Hugging Face, “Illustrating Reinforcement Learning from Human Feedback (RLHF)”. Available at: https://huggingface.co/blog/rlhf

Entities