Sanyanggae LogoSanyanggae

🤖 AI & 인공지능

RLHF와 DPO: 선호 데이터로 모델을 조정하는 방식 비교

보상모델을 이용한 학습과 직접 선호 최적화의 차이, 선호와 사실 정확성의 관계를 설명합니다.

사냥개 (Sanyanggae)발행 수정 1분
RLHF와 DPO: 선호 데이터로 모델을 조정하는 방식 비교 주제 설명용 이미지
주제 설명용 이미지

사람이 두 답변 중 하나를 선호한다는 정보는 모델을 조정하는 학습 데이터가 될 수 있습니다. 선호는 유용한 기준이지만 사실이 참인지, 정책에 맞는지와 완전히 같은 척도는 아닙니다.

보상모델을 이용한 RLHF

대표적인 과정에서는 응답에 대한 선호 자료로 보상모델을 학습하고, 모델의 정책을 보상과 참조 모델의 관계를 고려해 조정합니다. 학습 데이터와 평가 방식에 따라 잘못된 보상을 이용하거나 평가자가 좋아할 문체에 치우칠 수 있습니다.

DPO의 차이

DPO는 선호하는 응답과 덜 선호하는 응답의 쌍을 이용해 정책을 직접 최적화하는 목적함수를 제시합니다. 별도 보상모델과 PPO 같은 강화학습 루프를 구성하는 대표적인 RLHF 방식과 차이가 있습니다. 단순한 학습 절차가 모든 데이터에서 더 정확한 모델을 보장하는 것은 아닙니다.

비교할 때 확인할 조건

기초 모델, 선호 데이터와 평가 질문을 가능한 한 동일하게 맞춥니다. 선호 점수 외에 사실 오류, 거절의 적절성과 특정 집단에 대한 편향도 살펴야 합니다. 논문에 나온 성능은 그 실험의 결과이며 새로운 모델과 업무에서 같은 차이를 재현했다고 주장하려면 별도 측정이 필요합니다.

근거와 참고 자료

이 글은 공개된 자료를 바탕으로 설명합니다. 출처 표시는 해당 기관의 감수나 인증을 의미하지 않습니다.

운영자 소개 및 연락처

같은 주제의 다른 글