강화학습을 활용한 확산 모델의 최적화: DRLX 프레임워크와 DDPO 알고리즘

최근 대규모 언어 모델(LLM) 분야에서는 인간의 피드백을 통한 강화학습(RLHF, Reinforcement Learning from Human Feedback)이 모델의 지시 이행 능력과 답변 품질을 높이는 핵심 기술로 자리 잡았습니다. 이러한 흐름은 텍스트 생성 모델을 넘어 이미지 생성 모델인 확산 모델(Diffusion Models)로 확장되고 있습니다. 확산 모델 역시 프롬프트에 대한 충실도를 높이거나 ...

7월 31일 09:40에 게시됨