RREDPAPA
용어 목록으로 돌아가기
ADV-017훈련 진화형

선호학습

Preference Learning

학습 난이도

여러 답변 중 더 좋은 답을 고르는 선호를 학습하는 방식.

한 문장으로 이해하기

선호학습은 둘 이상의 답변 중 사람이 더 좋아한 쪽을 기준으로 모델을 학습시키는 방식입니다. 무엇이 정답인지보다 무엇이 더 나은지를 가르칩니다.

이렇게 떠올리세요

두 시안 중 더 마음에 드는 것을 고르게 해 취향을 익히는 것과 같습니다.

실제 예시

A와 B 답변 중 사람이 A를 고른 데이터를 모아 모델을 다듬습니다.

핵심 한 문장

선호학습은 더 나은 답을 고른 선호로 가르치는 방식입니다.

위 문장을 보지 않고 자기 말로 다시 설명해보면 오래 기억에 남습니다.

헷갈리는 용어

같이 보면 좋은 용어