작은 AI 모델로 C드라이브 정리: Qwen1.5-1.8B 기반 지능형 분석 시스템 설계
작은 AI가 해결하는 C드라이브 저장 공간 부족 문제
컴퓨터 사용 중 가장 익숙한 스트레스 요인 중 하나는 바로 "C드라이브 용량 부족" 경고창이다. 수많은 파일과 폴더 속에서 무엇을 삭제해야 할지 막막할 때, 단순히 '일괄 삭제'보다 더 나은 방법이 있을까? 이 글에서는 전통적인 정리 방식을 넘어, 소규모 양자화 언어 모델(Qwen1.5-1.8B GPTQ)을 활용해 안전하고 투 ...
7월 10일 01:09에 게시됨
Baichuan-M2-32B-GPTQ-Int4 로컬 배포 및 Typora 기반 의료 문서 자동 생성 가이드
1. 의료 문서 자동화의 필요성
매일 아침 8시가 되면 병원 정보과 직원은 20여 건의 진료 기록, 검사 보고서, 퇴원 요약본을 처리해야 합니다. 이러한 문서는 형식이 정해져 있지만 내용은 모두 달라 수동 정리는 시간이 많이 소요될 뿐만 아니라 오류 발생 가능성도 높습니다. 실제로 주요 투약 기록 하나를 누락하여 임상 부서에서 반송된 사례가 빈번하게 발생합니다.
...
7월 9일 21:51에 게시됨
vLLM 기반 대규모 모델 추론 최적화 기술 분석
메모리 효율과 처리 성능을 동시에 잡는 vLLM의 핵심 설계 원리
대규모 언어 모델을 실제 서비스에 배포할 때 가장 흔한 고민은?
하나의 7B 모델이 단일 A100 GPU에서 80% 이상의 메모리 사용률을 기록하면서도, 동시 요청 수가 30개도 못 버티는 상황. 이는 단순한 자원 낭비를 넘어, 운영 비용과 사용자 경험에 심각한 영향을 미칩니다.
이 문제를 해결한 핵심 도구가 바 ...
6월 10일 01:39에 게시됨
대규모 언어 모델의 양자화 기술과 최적화 전략
양자화 기술 개요 및 적용
최근 대규모 언어 모델의 효율적 배포를 위해 다양한 양자화 기법이 등장했다. 이는 메모리 사용량을 줄이고 추론 성능을 높이는 데 중점을 두며, 주로 GPTQ, AWQ, GGUF 등의 방법이 활용된다.
GPTQ: 사후 양자화 기반
목표: 4비트 양자화를 통해 가속기(특히 GPU)에서의 추론 효율성을 극대화
방식: 스칼라 양자화 후 잔차에 대해 벡터 양자화 ...
6월 5일 22:46에 게시됨