강화학습을 활용한 확산 모델의 최적화: DRLX 프레임워크와 DDPO 알고리즘

최근 대규모 언어 모델(LLM) 분야에서는 인간의 피드백을 통한 강화학습(RLHF, Reinforcement Learning from Human Feedback)이 모델의 지시 이행 능력과 답변 품질을 높이는 핵심 기술로 자리 잡았습니다. 이러한 흐름은 텍스트 생성 모델을 넘어 이미지 생성 모델인 확산 모델(Diffusion Models)로 확장되고 있습니다. 확산 모델 역시 프롬프트에 대한 충실도를 높이거나 ...

7월 31일 09:40에 게시됨

다중 목적 강화학습 알고리즘의 일반화 및 정책 적응 복제 과정 기록

논문 링크: https://arxiv.org/pdf/1908.08342 논문 코드: https://github.com/RunzheYang/MORL 블로그: https://blog.csdn.net/weixin_56760882/article/details/145572826 이 문서는 심해 보물 환경(DST)을 예시로 들어 복제 결과를 설명한 것이지만, 본문에서는 FTN(과일 나무 탐사) 환경을 기반으로 복제 과정을 설명합니다. 복제 과정에서 원 논문 코드를 git으로 가 ...

7월 8일 08:17에 게시됨

강화학습의 전략적 기울기 접근법

목차 서론 1. 가치 기반 접근법 재검토 1.1 핵심 개념 1.2 한계점 2. 전략 직접 최적화 이유 2.1 전략 기울기의 핵심 원리 2.2 직관적 이점 3. 전략 기울기 정리 3.1 유도 과정 3.2 최종 표현식 4. REINFORCE 알고리즘 4.1 알고리즘 단계 4.2 코드 예시 5. 분산 감소: 기준선 도입 5.1 기준선 기법 5.2 최적 기준선 6. REINFORCE에서 현대 알고리즘으로 7. 결론 서론 강화 ...

5월 26일 13:42에 게시됨