DeepSpeed에서 PPO 알고리즘 구현 및 코드 분석

기본 개념 가치(Value): (1) 액터(Actor)가 현재 상태 또는 상태-액션 쌍에 대해 예측하는 장기 누적 보상의 추정치 (2) 우위 함수(Advantage Function) 계산에 사용되며, 액터 모델의 매개변수 업데이트를 지도함 (3) 크리틱(Critic) 모델을 통해 학습됨 보상(Reward): 환경이 액터가 특정 시점에 액션을 수행한 후 제공하는 즉각적인 피드백 신호 구체적인 코드 구현 우 ...

6월 23일 17:59에 게시됨

대규모 언어 모델의 사실성 향상 기법: 미세 조정 및 추론 전략

사전 훈련 단계에서 대규모 언어 모델(LLM)이 습득하는 사실 지식은 파편화되어 분포되어 있거나 훈련 데이터의 통계적 편향에 영향을 받기 쉽습니다. 감독 미세 조정(SFT)과 정렬 훈련은 이러한 지식 표현을 재구성하는 데 중요한 기회를 제공합니다. 특정 구조적 제약 하에 파라미터 공간의 지식 분포를 조정함으로써 모델은 더 견고한 사실 관계를 구축하고, 동시에 자 ...

6월 14일 21:27에 게시됨