개념

강화학습

행동의 보상과 벌점을 통해 더 나은 선택을 배우는 학습 방식.

에이전트가 행동하고 환경이 보상으로 답하며 더 나은 선택을 배우는 강화학습 순환 에이전트 환경 행동 보상 · 상태
강화학습 개념도

핵심 포인트

  • 정답을 직접 알려 주는 대신, 행동의 결과로 보상이나 벌점을 주어 배우게 한다.
  • 에이전트는 더 큰 보상을 얻는 방향으로 시행착오를 거치며 전략을 다듬는다.
  • 게임·로봇 제어처럼 "좋은 행동"을 일일이 적기 어려운 문제에 어울린다.

예시

미로를 빠져나가면 +1, 벽에 부딪히면 -1을 주면, AI는 점점 출구로 가는 길을 스스로 찾는다.

한 걸음 더

RLHF는 이 강화학습 아이디어를 사람의 선호 평가에 적용해, LLM을 사람이 원하는 방향으로 다듬는 방법이다.

관련 개념

역링크