ADV-016숲훈련 진화형
보상 모델
Reward Model
학습 난이도
숲
어떤 답변이 더 좋은지 점수화하도록 학습된 모델.
한 문장으로 이해하기
보상 모델은 어떤 답변이 더 좋은지 점수를 매기도록 따로 학습된 모델입니다. 이 점수가 강화학습의 나침반 역할을 합니다.
이렇게 떠올리세요
답안마다 점수를 매겨 주는 채점 선생님과 같습니다.
실제 예시
RLHF에서는 보상 모델이 매긴 점수를 높이도록 본 모델을 학습시킵니다.
핵심 한 문장
보상 모델은 답변에 점수를 매기는 채점 모델입니다.
위 문장을 보지 않고 자기 말로 다시 설명해보면 오래 기억에 남습니다.