DeepSeek와 Huawei Ascend 호환:HAI-LLM, Megatron-LM, DeepSpeed 프레임워크 활용 분석
DeepSeek 모델의 훈련 방식과 Huawei Ascend 칩셋과의 호환성에 대한 의문은 종종 Megatron-LM 또는 DeepSpeed와 같은 프레임워크의 사용 여부와 관련하여 제기됩니다. 이에 대한 명확한 답변은 다음과 같이 두 가지 측면으로 나누어 설명할 수 있습니다.
1. DeepSeek 자체 훈련 프레임워크: HAI-LLM
DeepSeek는 자체적으로 HAI-LLM (Highly Adaptive & Integrated LL ...
7월 25일 18:58에 게시됨
DeepSpeed에서 PPO 알고리즘 구현 및 코드 분석
기본 개념
가치(Value):
(1) 액터(Actor)가 현재 상태 또는 상태-액션 쌍에 대해 예측하는 장기 누적 보상의 추정치
(2) 우위 함수(Advantage Function) 계산에 사용되며, 액터 모델의 매개변수 업데이트를 지도함
(3) 크리틱(Critic) 모델을 통해 학습됨
보상(Reward):
환경이 액터가 특정 시점에 액션을 수행한 후 제공하는 즉각적인 피드백 신호
구체적인 코드 구현
우 ...
6월 23일 17:59에 게시됨
H100 8way 클러스터에서의 Qwen2-VL 분산 학습 및 DeepSpeed 최적화 전략
멀티모달 대형 언어 모델의 분산 학습 아키텍처
Qwen2-VL과 같은 대규모 멀티모달 모델을 학습할 때 단일 노드의 컴퓨팅 자원만으로는 병목현상이 발생하기 쉽습니다. 이를 해결하기 위해 open-r1-multimodal 프레임워크는 다단계 최적화 파이프라인을 제공합니다. 이 파이프라인은 추론 데이터 증류(Distillation), 지도 미세조정(SFT), 그리고 GRPO(Generative Reinforc ...
6월 13일 01:11에 게시됨