Gemma-3 멀티모달 모델의 GPU 메모리 최적화: PyTorch 캐시 동적 할당 및 해제 전략

Gemma-3 12B 모델과 VRAM 단편화 문제 Gemma-3 12B와 같은 대규모 멀티모달 AI 모델을 운용할 때, 초기 추론 속도는 빠르지만 대화가 길어지거나 이미지를 여러 장 처리하다 보면 시스템이 지연되거나 CUDA out of memory (OOM) 오류가 발생하는 경우가 많습니다. 이는 하드웨어의 성능 부족보다는 VRAM(비디오 RAM) 관리 및 메모리 풀링 메커니즘에서 기인하는 문제입니다 ...

8월 3일 13:06에 게시됨