DeepSpeed에서 PPO 알고리즘 구현 및 코드 분석
기본 개념
가치(Value):
(1) 액터(Actor)가 현재 상태 또는 상태-액션 쌍에 대해 예측하는 장기 누적 보상의 추정치
(2) 우위 함수(Advantage Function) 계산에 사용되며, 액터 모델의 매개변수 업데이트를 지도함
(3) 크리틱(Critic) 모델을 통해 학습됨
보상(Reward):
환경이 액터가 특정 시점에 액션을 수행한 후 제공하는 즉각적인 피드백 신호
구체적인 코드 구현
우 ...
6월 23일 17:59에 게시됨
대규모 언어 모델의 사실성 향상 기법: 미세 조정 및 추론 전략
사전 훈련 단계에서 대규모 언어 모델(LLM)이 습득하는 사실 지식은 파편화되어 분포되어 있거나 훈련 데이터의 통계적 편향에 영향을 받기 쉽습니다. 감독 미세 조정(SFT)과 정렬 훈련은 이러한 지식 표현을 재구성하는 데 중요한 기회를 제공합니다. 특정 구조적 제약 하에 파라미터 공간의 지식 분포를 조정함으로써 모델은 더 견고한 사실 관계를 구축하고, 동시에 자 ...
6월 14일 21:27에 게시됨