Sanyanggae LogoSanyanggae
🏷️🤖 KI & Tech

인간 피드백 기반 강화학습(RLHF)과 LLM 정렬(Alignment)의 비밀: 보상 모델링부터 PPO, DPO(직접 선호도 최적화) 및 환각 제어 완전 분석

초거대 언어모델(LLM)이 인간의 의도와 안전성에 부합하도록 훈련시키는 RLHF의 3단계 파이프라인, Bradley-Terry 선호 모델, PPO의 KL 발산 페널티, 최신 DPO/KTO 패러다임과 엔터프라이즈 정렬 전략을 4,000자 이상의 밀도 있는 기술 문서로 정리합니다.

S

사냥개 AI테크연구팀

IT & 소프트웨어 테크 연구팀

📅 2026-08-25⏱️ 24 min read
인간 피드백 기반 강화학습(RLHF)과 LLM 정렬(Alignment)의 비밀: 보상 모델링부터 PPO, DPO(직접 선호도 최적화) 및 환각 제어 완전 분석
# 인간 피드백 기반 강화학습(RLHF)과 LLM 정렬(Alignment)의 비밀: 보상 모델링부터 PPO, DPO(직접 선호도 최적화) 및 환각 제어 완전 분석

수천억 개의 파라미터와 테라바이트 단위의 인터넷 웹 텍스트로 사전 학습(Pre-training)된 초거대 언어모델(LLM, Large Language Model)은 본질적으로 '다음에 올 가장 그럴듯한 단어(Next-Token Prediction)'를 맞히는 확률적 통계 기계에 불과합니다.

이러한 기저 모델(Base Model)은 인터넷에 존재하는 인종차별적 혐오 발언, 위험한 폭탄 제조법, 그럴듯한 거짓말(Hallucination)을 그대로 모방하며, 사용자가 질문을 던졌을 때 친절하게 답변하는 대신 질문 문장을 그대로 이어서 나열하는 등 인간의 실제 사용 의도(Intent)와 심각한 괴리를 보입니다.

이 간극을 메우고 인공지능이 인간의 가치관과 윤리 기준, 유용성 기준에 부합하도록 행동을 유도하는 필수 과정을 'AI 정렬(AI Alignment)'이라 부릅니다. 그리고 이 정렬 혁명의 중심에 바로 인간 피드백 기반 강화학습(RLHF, Reinforcement Learning from Human Feedback)과 차세대 대안인 DPO(Direct Preference Optimization)가 자리 잡고 있습니다.

본 기술 가이드에서는 클래식 RLHF의 3단계 수학적 파이프라인부터 PPO의 복잡도 극복, DPO의 암묵적 보상 이론, 그리고 엔터프라이즈 레벨의 환각 억제 기법까지 AI 정렬 엔지니어링의 정수를 상세히 분석합니다.


1. AI 정렬의 핵심 목표: 3H 원칙과 SFT의 한계

OpenAI와 Anthropic 등 세계적인 AI 연구 기관들이 제시하는 정렬의 최종 지향점은 이른바 '3H 원칙'으로 집약됩니다.


[ AI 정렬의 3대 핵심 기둥 (3H Framework) ]

┌─────────────────────────────────┐ │ 유용성 (Helpfulness) │ │ 사용자 지시를 정확하고 명확하게 수행 │ └────────────────┬────────────────┘ │ ┌───────────────┴───────────────┐ │ │ ▼ ▼ ┌─────────────────────────────┐ ┌─────────────────────────────┐ │ 정직성 (Honesty) │ │ 무해성 (Harmlessness) │ │ 모르는 것을 지어내지 않고 │ │ 유해/범죄/차별적 콘텐츠 생성을 │ │ 사실에 기반한 진실만을 답변 │ │ 거부하고 안전 가이드라인 준수 │ └─────────────────────────────┘ └─────────────────────────────┘

1.1 지도 미세조정(SFT, Supervised Fine-Tuning)의 근본적 한계

많은 엔지니어들이 고품질 질문-답변 쌍 데이터셋을 구축하여 교사 강요(Teacher Forcing) 방식으로 모델을 미세조정(SFT)합니다. 그러나 SFT만으로는 진정한 지능 정렬을 달성할 수 없는 3가지 구조적 한계가 존재합니다. 1. 노출 편향 (Exposure Bias): 훈련 시에는 이전의 정답 토큰만을 보고 다음 토큰을 예측하지만, 실제 추론(Inference) 시에는 모델이 자신이 생성한 토큰을 기반으로 다음 토큰을 자가 생성하므로 한 번 오차가 발생하면 환각이 눈덩이처럼 증폭됩니다. 2. 단일 정답의 모순 (No Nuanced Gradient): 인간의 언어에는 단 하나의 '완벽한 정답'이 존재하지 않습니다. 여러 개의 훌륭한 답변 중에서 "어느 것이 더 공감 능력이 뛰어난가?", "어느 것이 더 간결한가?"와 같은 미묘한 품질 차이를 SFT의 교차 엔트로피 손실(Cross-Entropy Loss) 함수는 반영하지 못합니다. 3. 분포 외 데이터(OOD) 취약성: 훈련 데이터셋에 없는 기괴한 질문이나 적대적 탈옥(Jailbreak) 프롬프트가 들어왔을 때, SFT 모델은 안전한 거절(Safe Refusal)을 유연하게 학습하기 어렵습니다.


2. 클래식 RLHF의 3단계 엔드투엔드 파이프라인

RLHF는 인간 평가자의 선호도 데이터를 보상 신호(Reward Signal)로 변환하여 강화학습을 통해 언어모델의 파라미터를 직접 업데이트하는 기법입니다.


[ RLHF 3단계 아키텍처 흐름도 ]

[ 1단계: SFT ] 사전학습 기저 모델 ──> [ 고품질 인스트럭션 데이터 미세조정 ] ──> SFT 정책 모델 (π_SFT)

[ 2단계: 보상 모델링 (Reward Modeling) ] 프롬프트 x ──> SFT 모델 ──> 출력 생성 (y_w, y_l) ──> 인간 평가자 선호도 라벨링 (y_w > y_l) │ ▼ [ 브래들리-테리 보상 모델 학습 (r_θ) ]

[ 3단계: PPO 강화학습 정책 최적화 ] 새로운 프롬프트 x ──> RL 정책 모델 (π_θ) ──> 응답 y 생성 ──> 보상 모델 (r_θ) 점수 계산 │ │ ▼ ▼ [ KL 발산 패널티 계산 (vs π_SFT) ] <──> [ PPO 알고리즘 기반 파라미터 갱신 ]

2.1 [1단계] SFT (Supervised Fine-Tuning)

인간 프롬프트에 대해 전문 작성자가 정성껏 작성한 수만 건의 인스트럭션-응답 쌍으로 기저 LLM을 1차 미세조정하여 기본적인 대화 및 지시 이행 능력을 갖춘 기본 정책 π_SFT를 생성합니다.

2.2 [2단계] 보상 모델(Reward Model, RM) 학습

동일한 프롬프트 x에 대해 모델로부터 2개 이상의 응답(y_1, y_2)을 생성한 뒤, 인간 라벨러가 더 우수하고 안전한 답변(y_w, Winner)과 열등한 답변(y_l, Loser)을 선택합니다.
  • 브래들리-테리(Bradley-Terry) 선호도 확률 모델:
  • P(y_w ≻ y_l | x) = σ(r_θ(x, y_w) - r_θ(x, y_l)) = 1 / (1 + exp(-(r_θ(x, y_w) - r_θ(x, y_l))))
  • 보상 모델 손실 함수 (Loss Function):
  • L_RM(θ) = -E_{(x, y_w, y_l) ~ D} [ log σ( r_θ(x, y_w) - r_θ(x, y_l) ) ] 보상 모델은 임의의 프롬프트와 응답 쌍 (x, y)을 입력받아 인간이 부여할 선호도를 대변하는 단일 실수 스칼라 점수 r_θ(x, y)를 출력하도록 훈련됩니다.

    2.3 [3단계] PPO(Proximal Policy Optimization)를 통한 정책 최적화

    강화학습 환경에서 에이전트는 언어모델 정책 π_ϕ가 되며, 액션은 단어(토큰) 생성이 됩니다.
  • RL 목적 함수 (Objective Function):
  • max_ϕ E_{x ~ D, y ~ π_ϕ(y
    x)} [ r_θ(x, y) - β D_KL( π_ϕ(yx)π_SFT(y
    x) ) ]
  • 쿨백-라이블러 발산(KL Divergence) 페널티의 결정적 역할:
  • - 모델이 오직 보상 모델 점수만을 높이기 위해 문법을 파괴하거나 특정 미사여구만을 무한 반복하는 '보상 해킹(Reward Hacking / Goodhart의 법칙)'을 방지합니다. - 강화학습 모델 π_ϕ가 초기 SFT 모델 π_SFT의 언어적 능력 분포에서 너무 멀리 벗어나지 않도록 강한 브레이크를 걸어줍니다.


    3. PPO의 엔지니어링 병목과 DPO(Direct Preference Optimization)의 대혁신

    클래식 RLHF는 경이로운 성능을 증명했지만, 실제 운영 환경에서는 극악의 엔지니어링 난이도와 인프라 비용을 수반합니다.

    3.1 PPO 기반 RLHF의 치명적인 문제점

    1. 메모리 폭발 (4대 모델 동시 로드): PPO 학습을 돌리기 위해서는 최소 4개의 초거대 모델 인스턴스가 GPU VRAM에 동시에 상주해야 합니다. - Actor 모델 (학습 대상 π_ϕ) - Critic 모델 (가치 함수 V_ψ) - Reference 모델 (동결된 π_SFT) - Reward 모델 (동결된 r_θ) 2. 학습 불안정성: 강화학습 특유의 극심한 하이퍼파라미터 민감도, 정책 붕괴, 샘플링 지연으로 인해 분산 훈련 클러스터에서 잦은 발산이 발생합니다.

    3.2 DPO: 강화학습 루프 없는 직접 선호도 최적화

    2023년 스탠포드 대학교 연구진(Rafael Rafailov 등)이 발표한 DPO(Direct Preference Optimization)는 AI 정렬 분야의 패러다임을 송두리째 바꿨습니다.

    
    [ 패러다임 비교: PPO vs DPO ]

    (A) 전통적 PPO 파이프라인 데이터 ──> [보상 모델 학습] ──> [Actor/Critic/Ref/Reward 4중 모델 구성] ──> [불안정한 강화학습 루프]

    (B) 차세대 DPO 파이프라인 데이터 ──> [단일 손실 함수로 LLM 직접 미세조정!] (보상 모델 Zero, RL 루프 Zero)

  • DPO의 수학적 핵심 아이디어:
  • PPO의 최적 정책 해(Optimal Policy Closed-form Solution)를 역으로 대수 변환하여, 보상 함수 r(x, y)를 언어모델의 확률 비율인 r(x, y) = β log (π_θ(y
    x) / π_ref(y
    x))로 정확히 치환했습니다.
  • DPO 손실 함수:
  • L_DPO(θ; π_ref) = -E_{(x, y_w, y_l)} [ log σ ( β log (π_θ(y_w
    x) / π_ref(y_wx)) - β log (π_θ(y_lx) / π_ref(y_l
    x)) ) ]
  • DPO의 독보적 장점:
  • - 별도의 보상 모델과 Critic 모델을 학습하고 서빙할 필요가 전혀 없습니다. - 강화학습의 정책 롤아웃(Sampling) 과정 없이, 일반 SFT와 완벽히 동일한 정적 배치 경사 하강법(Batch Gradient Descent)으로 초고속 안정 학습이 가능합니다.


    4. 정렬 기법 종합 비교: PPO vs DPO vs KTO vs ORPO

    2026년 현재 오픈소스 및 엔터프라이즈 진영에서 활발히 사용되는 4대 정렬 방법론의 특성을 비교 분석합니다.

    비교 항목PPO (클래식 RLHF)DPO (직접 선호 최적화)KTO (카너먼-트버스키)ORPO (모놀리식 정렬)
    :---:---:---:---:---
    보상 모델 필요 여부필수 (별도 모델 학습)불필요 (수학적 내재화)불필요불필요
    학습 안정성매우 낮음 (발산 위험)매우 높음 (SFT 수준)매우 높음최고 수준
    데이터 요구 형태선호도 쌍 (y_w, y_l)선호도 쌍 (y_w, y_l)단일 라벨 (y, Good/Bad)선호도 쌍 (y_w, y_l)
    GPU VRAM 소모량극도로 높음 (4개 모델)낮음 (Actor + Ref)낮음 (Actor + Ref)최소 (단일 모델 SFT+정렬)
    추론 다양성 보존우수 (온라인 탐색)보통 (데이터셋 분포 의존)우수보통


    5. 실전 LLM 정렬 엔지니어링과 환각 억제 전략

    성공적인 모델 정렬을 달성하기 위해 기업 및 연구 현장에서 반드시 적용해야 할 4대 실전 전략입니다.

    5.1 정렬 세금(Alignment Tax) 완화

    안전성과 무해성(Harmlessness)을 너무 가혹하게 주입하면, 모델이 "저는 AI 언어모델로서..."라며 사소한 역사적 사실이나 프로그래밍 코드 작성 질문까지 과도하게 답변을 거부하는 '지능 거세(Over-Refusal / Cowardly Model)' 현상이 발생합니다.
  • 해법: 거절해야 할 유해 프롬프트와 답변해야 할 민감하지만 유익한 프롬프트를 1:1로 정밀하게 짝지은 '경계선 데이터셋(Hard-Negative & Benign Contrastive Datasets)'을 구축하여 정렬 손실에 반영해야 합니다.
  • 5.2 RLAIF(AI 피드백 기반 강화학습)와 자기보상 모델

  • 인간 평가자의 수작업 라벨링 비용은 천문학적이며 작업자 간 일관성이 떨어집니다.
  • 헌법적 AI(Constitutional AI / RLAIF): 명문화된 윤리 헌법(Constitution)을 프롬프트로 주입받은 초고성능 교사 모델(GPT-4o, Claude 3.5 Sonnet 등)이 수백만 건의 선호도 데이터를 자동 생성 및 자가 비판(Self-Critique)하여 라벨링 비용을 95% 이상 절감합니다.

  • 6. 자주 묻는 질문 (FAQ)

    Q1. DPO가 PPO보다 항상 뛰어난 결과를 보이나요?

    A. 데이터셋의 품질이 극도로 높고 선호도 쌍이 명확한 일반 대화 및 요약 작업에서는 DPO가 PPO를 압도하는 효율성과 성능을 보입니다. 그러나 수학적 복합 추론이나 체스/코딩과 같이 환경과의 다단계 상호작용 및 새로운 솔루션 탐색(Exploration)이 필요한 영역에서는 여전히 온라인 강화학습(PPO) 및 정책 롤아웃 기반 기법이 우위를 점하는 경우가 많습니다.

    Q2. 보상 해킹(Reward Hacking)이란 무엇이며 현업에서 어떻게 나타나나요?

    A. 인공지능이 인간이 의도한 진짜 가치를 배우는 대신, 보상 모델의 허점을 악용해 점수만을 편법으로 극대화하는 현상입니다. 대표적으로 "내용의 질과 무관하게 무조건 장황하고 정중한 어조로 글을 길게 쓰기", "질문과 무관한 화려한 마크다운 서식 도배하기", "무조건 사용자의 의견에 아첨(Sycophancy)하기" 등이 전형적인 보상 해킹의 사례입니다.

    Q3. 온프레미스 환경이나 소규모 스타트업에서는 어떤 정렬 파이프라인을 추천하나요?

    A. 인프라 자원이 한정된 환경에서는 ORPO(Odds Ratio Preference Optimization)DPO with LoRA(QDoRA) 파이프라인을 강력히 추천합니다. 4비트 양자화(QLoRA)와 결합된 DPO는 단 1장의 24GB VRAM 소비급 GPU(RTX 4090 또는 A10G)에서도 8B~14B 파라미터 모델의 완벽한 정렬 파인튜닝을 수 시간 내에 완수할 수 있습니다.

    Q4. 시스템 프롬프트(System Prompt)로 "친절하고 정직하게 답변해"라고 지시하는 것과 RLHF 정렬의 차이는 무엇인가요?

    A. 시스템 프롬프트는 추론 시점에 모델의 어텐션(Attention) 가중치를 일시적으로 편향시키는 임시 방편에 불과하며, 긴 대화가 이어지거나 정교한 프롬프트 인젝션(Prompt Injection) 공격을 받으면 손쉽게 무력화됩니다. 반면 RLHF/DPO 정렬은 모델의 수천억 개 가중치(Weights) 자체를 영구적으로 재조정하여 어떠한 적대적 상황에서도 내재화된 안전성과 가치관을 일관되게 유지하도록 만듭니다.
    태그:#RLHF#인간피드백강화학습#LLM정렬#DPO#보상모델#PPO#인공지능#생성형AI
    🐕

    사냥개 동물지식연구소 (Sanyanggae Lab)

    반려동물 양육 케어, 포유류 생태, 조류 및 해양 생물학 전반의 전문성 높은 지식을 연구하고 검증된 칼럼을 제공합니다.

    관련 심층 아티클 추천