개념

RLHF

사람이 매긴 답의 선호를 보상으로 삼아, 모델을 사람이 원하는 방향으로 다듬는 강화학습. 넓게 보면 파인튜닝의 일종.

사람이 매긴 답 선호를 보상으로 삼아 모델을 사람이 원하는 방향으로 다듬는 RLHF 모델 답 생성 답 A 답 B 사람 선호 👍 답 A 보상으로 모델 다듬기
RLHF 개념도

핵심 포인트

  • 사람이 모델의 여러 답에 선호(어느 쪽이 더 나은가)를 매긴다.
  • 그 선호를 보상으로 삼는 강화학습으로 모델을 사람이 원하는 방향으로 다듬는다.
  • 더 정확하기보다 더 도움 되고 안전하며 예의 바른 답을 내도록 조정한다.

예시

같은 질문에 대한 두 답 중 사람이 더 나은 쪽을 고르면, 그 평가를 보상으로 모델이 그런 답을 더 내도록 학습한다.

한 걸음 더

RLHF는 정렬(alignment)을 이루는 대표적 방법이다 — "더 똑똑하게"가 아니라 "사람 뜻에 더 맞게" 만드는 단계다.

관련 개념

역링크