RREDPAPA
용어 목록으로 돌아가기
ADV-016훈련 진화형

보상 모델

Reward Model

학습 난이도

어떤 답변이 더 좋은지 점수화하도록 학습된 모델.

한 문장으로 이해하기

보상 모델은 어떤 답변이 더 좋은지 점수를 매기도록 따로 학습된 모델입니다. 이 점수가 강화학습의 나침반 역할을 합니다.

이렇게 떠올리세요

답안마다 점수를 매겨 주는 채점 선생님과 같습니다.

실제 예시

RLHF에서는 보상 모델이 매긴 점수를 높이도록 본 모델을 학습시킵니다.

핵심 한 문장

보상 모델은 답변에 점수를 매기는 채점 모델입니다.

위 문장을 보지 않고 자기 말로 다시 설명해보면 오래 기억에 남습니다.

헷갈리는 용어

같이 보면 좋은 용어