개념

정렬

AI의 행동과 답을 사람의 의도·가치에 맞추는 것. RLHF가 대표적 방법이다.

AI의 행동과 답을 사람의 의도·가치에 맞추는 정렬 AI 행동·답 사람 의도·가치 정렬 전 · 빗나감 정렬 후 · 명중
정렬 개념도

핵심 포인트

  • AI의 행동과 답을 사람의 의도·가치에 맞추는 것을 뜻한다.
  • 능력을 키우는 일과 별개로, 그 능력을 "안전하고 도움 되게" 쓰도록 방향을 맞춘다.
  • RLHF가 대표적 방법이며, 해롭거나 빗나간 답을 줄이는 것이 목표다.

예시

위험한 행동을 알려 달라는 요청을 모델이 정중히 거절하도록 만드는 것이, 사람의 가치에 맞춘 정렬이다.

한 걸음 더

"더 똑똑한 AI"와 "사람 뜻에 맞는 AI"는 다른 문제다 — 정렬은 후자를 다루며, AI 안전 연구의 핵심 주제다.

관련 개념

역링크