개념
RLHF
핵심 포인트
- 사람이 모델의 여러 답에 선호(어느 쪽이 더 나은가)를 매긴다.
- 그 선호를 보상으로 삼는 강화학습으로 모델을 사람이 원하는 방향으로 다듬는다.
- 더 정확하기보다 더 도움 되고 안전하며 예의 바른 답을 내도록 조정한다.
예시
같은 질문에 대한 두 답 중 사람이 더 나은 쪽을 고르면, 그 평가를 보상으로 모델이 그런 답을 더 내도록 학습한다.
한 걸음 더
RLHF는 정렬(alignment)을 이루는 대표적 방법이다 — "더 똑똑하게"가 아니라 "사람 뜻에 더 맞게" 만드는 단계다.