시스템 개요 및 아키텍처
EVA-01 시각 동기화 시스템은 최신 멀티모달 대형 언어 모델인 Qwen2.5-VL-7B를 엔진으로 사용하며, 사용자가 업로드한 이미지를 분석하고 대화할 수 있는 인터페이스를 제공합니다. 이 시스템은 단순한 이미지 캡셔닝을 넘어, 복잡한 장면의 논리적 추론과 텍스트 추출(OCR)이 가능하도록 설계되었습니다. 특히 '에반게리온' 테마의 사용자 인터페이스를 통해 몰입감 있는 조작 환경을 제공하며, 사용자가 정의한 전술 용어 사전을 통해 모델의 답변 스타일을 특정 도메인에 맞춰 조정할 수 있는 것이 특징입니다.
런타임 환경 구성
시스템의 원활한 추론을 위해 NVIDIA GPU 환경이 권장됩니다. 하드웨어 요구 사항과 소프트웨어 설치 단계는 다음과 같습니다.
시스템 요구 사항
- OS: Windows 10/11, Linux (Ubuntu 22.04 권장), macOS
- Python: 3.9 이상
- VRAM: 12GB 이상 (RTX 3060 12GB 이상 권장, 최적의 성능을 위해 RTX 4090 권장)
- 의존성 라이브러리: PyTorch, Transformers, Streamlit, Accelerate 등
설치 및 실행
터미널에서 아래 명령어를 실행하여 프로젝트 환경을 구축합니다.
# 1. 소스 코드 다운로드 및 디렉토리 이동
git clone https://github.com/vision-synchro/EVA-01-Core.git
cd EVA-01-Core
# 2. 필수 패키지 설치
pip install -r requirements_core.txt
# 3. Streamlit 대시보드 구동
streamlit run main_interface.py
명령어 실행 후 브라우저에서 http://localhost:8501에 접속하면 시스템 제어판이 활성화됩니다.
핵심 기능: 멀티모달 시각 동기화
대시보드에 접속하면 사용자는 이미지를 업로드하고 즉시 대화를 시작할 수 있습니다. 시스템은 다음과 같은 시각적 분석 능력을 보유하고 있습니다.
- 장면 추론: 이미지 내 개체 간의 관계를 분석하여 상황을 논리적으로 설명합니다.
- 정밀 OCR: 이미지에 포함된 인쇄체 및 수필체 텍스트를 인식하고 구조화된 데이터로 변환합니다.
- 다회차 대화: 이전 대화의 맥락을 유지하며 이미지의 특정 부분에 대해 심층적인 질의응답을 수행합니다.
전술 용어 사전(Tactical Lexicon) 커스터마이징
EVA-01 시스템의 가장 차별화된 기능은 tactical_lexicon.json 파일을 통한 출력 스타일 제어입니다. 이 기능을 통해 AI가 일반적인 답변 대신 특정 전문 용어나 컨셉에 맞는 답변을 하도록 유도할 수 있습니다.
사전 파일 구조 변경 예시
기본 제공되는 NERV 스타일 사전을 비즈니스 또는 의료 도메인으로 변경하여 적용할 수 있습니다. 아래는 용어 매핑 파일의 구조입니다.
{
"context_mapping": {
"person": ["피실험체", "대상자"],
"error": ["싱크로율 저하", "노이즈 감지"],
"city": ["제3신도쿄시", "전술 거점"],
"check": ["패턴 분석 중", "코드 확인"]
},
"interface_templates": [
"// 데이터 링크 개시 //",
"대상체의 위협 레벨을 분석합니다.",
"분석 결과가 메인 프레임으로 전송되었습니다."
]
}
이 파일을 수정하면 AI는 이미지를 분석할 때 '사람'을 '피실험체'로, '도시'를 '전술 거점'으로 부르는 등 특유의 페르소나를 유지하게 됩니다. 이는 특정 산업군(의료, 법률, 군사 등)의 전문 용어를 학습시키지 않고도 신속하게 프롬프트 수준에서 제어하는 효과를 줍니다.
최적화 및 성능 튜닝
시스템의 응답 속도와 정확도를 높이기 위해 다음과 같은 파라미터를 조정할 수 있습니다.
해상도 및 VRAM 제어
입력 이미지의 해상도가 높을수록 분석 정확도는 올라가지만 VRAM 사용량이 급증합니다. config.py 파일에서 max_resolution 값을 조정하여 성능 균형을 맞출 수 있습니다.
# config.py 예시
SYNC_CONFIG = {
"max_pixels": 1024 * 768, # 해상도 제한을 통한 속도 개선
"use_flash_attn": True, # FlashAttention-2 지원 시 활성화
"device_map": "auto" # 자동으로 GPU 메모리 할당
}
다단계 추론 기법
복잡한 이미지의 경우, 처음에는 전체적인 레이아웃을 질문하고("이미지의 전반적인 구도를 설명해줘"), 그 다음 특정 객체의 세부 정보를 묻는("중앙에 있는 장치의 모델명을 확인해줘") 단계별 접근 방식을 통해 추론의 정확도를 극대화할 수 있습니다.
도메인별 활용 시나리오
이 시스템은 단순한 재미를 넘어 실제 산업 현장에 적용 가능합니다.
- 제조 현장: 설비 사진을 업로드하고 사전에 정의된 '결함 사전'을 적용하여 이상 징후를 보고서 형식으로 출력.
- 디자인 분석: UI/UX 스크린샷을 통해 색상 대비, 폰트 가독성 등을 디자인 가이드라인 용어로 분석.
- 문서 자동화: 영수증이나 계약서 이미지를 업로드하여 필요한 핵심 지표만 특정 용어로 치환하여 추출.