강화학습을 활용한 확산 모델의 최적화: DRLX 프레임워크와 DDPO 알고리즘
최근 대규모 언어 모델(LLM) 분야에서는 인간의 피드백을 통한 강화학습(RLHF, Reinforcement Learning from Human Feedback)이 모델의 지시 이행 능력과 답변 품질을 높이는 핵심 기술로 자리 잡았습니다. 이러한 흐름은 텍스트 생성 모델을 넘어 이미지 생성 모델인 확산 모델(Diffusion Models)로 확장되고 있습니다. 확산 모델 역시 프롬프트에 대한 충실도를 높이거나 ...
7월 31일 09:40에 게시됨
DeepSpeed에서 PPO 알고리즘 구현 및 코드 분석
기본 개념
가치(Value):
(1) 액터(Actor)가 현재 상태 또는 상태-액션 쌍에 대해 예측하는 장기 누적 보상의 추정치
(2) 우위 함수(Advantage Function) 계산에 사용되며, 액터 모델의 매개변수 업데이트를 지도함
(3) 크리틱(Critic) 모델을 통해 학습됨
보상(Reward):
환경이 액터가 특정 시점에 액션을 수행한 후 제공하는 즉각적인 피드백 신호
구체적인 코드 구현
우 ...
6월 23일 17:59에 게시됨
강화학습의 전략적 기울기 접근법
목차
서론
1. 가치 기반 접근법 재검토
1.1 핵심 개념
1.2 한계점
2. 전략 직접 최적화 이유
2.1 전략 기울기의 핵심 원리
2.2 직관적 이점
3. 전략 기울기 정리
3.1 유도 과정
3.2 최종 표현식
4. REINFORCE 알고리즘
4.1 알고리즘 단계
4.2 코드 예시
5. 분산 감소: 기준선 도입
5.1 기준선 기법
5.2 최적 기준선
6. REINFORCE에서 현대 알고리즘으로
7. 결론
서론
강화 ...
5월 26일 13:42에 게시됨