개념
정렬
AI의 행동과 답을 사람의 의도·가치에 맞추는 것. RLHF가 대표적 방법이다.
핵심 포인트
- AI의 행동과 답을 사람의 의도·가치에 맞추는 것을 뜻한다.
- 능력을 키우는 일과 별개로, 그 능력을 "안전하고 도움 되게" 쓰도록 방향을 맞춘다.
- RLHF가 대표적 방법이며, 해롭거나 빗나간 답을 줄이는 것이 목표다.
예시
위험한 행동을 알려 달라는 요청을 모델이 정중히 거절하도록 만드는 것이, 사람의 가치에 맞춘 정렬이다.
한 걸음 더
"더 똑똑한 AI"와 "사람 뜻에 맞는 AI"는 다른 문제다 — 정렬은 후자를 다루며, AI 안전 연구의 핵심 주제다.