개념
강화학습
행동의 보상과 벌점을 통해 더 나은 선택을 배우는 학습 방식.
핵심 포인트
- 정답을 직접 알려 주는 대신, 행동의 결과로 보상이나 벌점을 주어 배우게 한다.
- 에이전트는 더 큰 보상을 얻는 방향으로 시행착오를 거치며 전략을 다듬는다.
- 게임·로봇 제어처럼 "좋은 행동"을 일일이 적기 어려운 문제에 어울린다.
예시
미로를 빠져나가면 +1, 벽에 부딪히면 -1을 주면, AI는 점점 출구로 가는 길을 스스로 찾는다.
한 걸음 더
RLHF는 이 강화학습 아이디어를 사람의 선호 평가에 적용해, LLM을 사람이 원하는 방향으로 다듬는 방법이다.