우리 팀만의 vLLM 플러그인 만들기 1편 - 검색 AI 모델 서빙 성능 극대화하기
AI
우리 팀만의 vLLM 플러그인 만들기 1편 - 검색 AI 모델 서빙 성능 극대화하기
두줄요약
검색·추천 스코어링 모델을 vLLM 기반 풀링 런타임과 IO Processor로 전환해 성능을 크게 높인 사례를 소개했습니다. 전후처리 통합과 배치 최적화로 처리량과 지연 시간을 개선했습니다.
핵심 내용
- 검색·추천 스코어링 모델 서빙을 vLLM 기반 풀링 런타임과 IO Processor로 전환해 경로 최적화 중심으로 성능을 끌어올린 사례
- Hugging Face encode 대비 재순위화 처리량 6.2배, 속성 기반 감성 모델 p50 지연 83.8% 감소, 이미지 랭킹은 단계별 최적화로 16.5배 향상
- 전처리·후처리 통합, continuous batching, CUDA Graph, cp.async, 배치 효율 개선이 주요 성능 요인
- 플러그인 패키지로 묶어 pip install 한 번으로 배포 가능하게 구성
적용해볼 점
- 모델 순전파뿐 아니라 요청 경로 전반의 네트워크·직렬화·배치 손실 점검
- 토큰화처럼 가벼운 전후처리는 IO Processor로 통합, CPU 비용이 큰 작업은 병렬성 검증 후 적용
- 자료형과 캐시 처리, 요청 단위 메모리 해제 규칙을 명시적으로 관리
