ADV-017숲훈련 진화형
선호학습
Preference Learning
학습 난이도
숲
여러 답변 중 더 좋은 답을 고르는 선호를 학습하는 방식.
한 문장으로 이해하기
선호학습은 둘 이상의 답변 중 사람이 더 좋아한 쪽을 기준으로 모델을 학습시키는 방식입니다. 무엇이 정답인지보다 무엇이 더 나은지를 가르칩니다.
이렇게 떠올리세요
두 시안 중 더 마음에 드는 것을 고르게 해 취향을 익히는 것과 같습니다.
실제 예시
A와 B 답변 중 사람이 A를 고른 데이터를 모아 모델을 다듬습니다.
핵심 한 문장
선호학습은 더 나은 답을 고른 선호로 가르치는 방식입니다.
위 문장을 보지 않고 자기 말로 다시 설명해보면 오래 기억에 남습니다.