DeepSeek와 Huawei Ascend 호환:HAI-LLM, Megatron-LM, DeepSpeed 프레임워크 활용 분석

DeepSeek 모델의 훈련 방식과 Huawei Ascend 칩셋과의 호환성에 대한 의문은 종종 Megatron-LM 또는 DeepSpeed와 같은 프레임워크의 사용 여부와 관련하여 제기됩니다. 이에 대한 명확한 답변은 다음과 같이 두 가지 측면으로 나누어 설명할 수 있습니다. 1. DeepSeek 자체 훈련 프레임워크: HAI-LLM DeepSeek는 자체적으로 HAI-LLM (Highly Adaptive & Integrated LL ...

7월 25일 18:58에 게시됨

DeepSpeed에서 PPO 알고리즘 구현 및 코드 분석

기본 개념 가치(Value): (1) 액터(Actor)가 현재 상태 또는 상태-액션 쌍에 대해 예측하는 장기 누적 보상의 추정치 (2) 우위 함수(Advantage Function) 계산에 사용되며, 액터 모델의 매개변수 업데이트를 지도함 (3) 크리틱(Critic) 모델을 통해 학습됨 보상(Reward): 환경이 액터가 특정 시점에 액션을 수행한 후 제공하는 즉각적인 피드백 신호 구체적인 코드 구현 우 ...

6월 23일 17:59에 게시됨

H100 8way 클러스터에서의 Qwen2-VL 분산 학습 및 DeepSpeed 최적화 전략

멀티모달 대형 언어 모델의 분산 학습 아키텍처 Qwen2-VL과 같은 대규모 멀티모달 모델을 학습할 때 단일 노드의 컴퓨팅 자원만으로는 병목현상이 발생하기 쉽습니다. 이를 해결하기 위해 open-r1-multimodal 프레임워크는 다단계 최적화 파이프라인을 제공합니다. 이 파이프라인은 추론 데이터 증류(Distillation), 지도 미세조정(SFT), 그리고 GRPO(Generative Reinforc ...

6월 13일 01:11에 게시됨