홈으로 돌아가기
공식 웹사이트 방문하기
vLLM 고처리량 저지연 오픈소스 LLM 추론 서빙 엔진
공식 서비스 바로가기
서비스 상세 소개
vLLM 고처리량 저지연 오픈소스 LLM 추론 서빙 엔진: PagedAttention 가상 메모리 알고리즘을 도입하여 GPU 메모리 낭비를 줄이고, 기존 엔진 대비 최대 24배 높은 처리량을 달성한 프로덕션 LLM 서빙 표준 엔진입니다.
vLLM은 UC 버클리 연구진이 개발한 초고속 LLM 추론 엔진입니다. 운영체제의 가상 메모리 페이징 기법을 어텐션 연산에 도입한 PagedAttention 기술을 통해 KV 캐시 단편화를 제로화하고 GPU 활용률을 극대화했습니다. OpenAI 규격 호환 고성능 비동기 스트리밍 웹 서버를 기본 내장하여 상용 AI 서비스 백엔드의 표준으로 채택되고 있습니다.
핵심 기능 목록
PagedAttention 기술로 KV 캐시 메모리 단편화 제로화
연속 배치 기반 요청 실시간 동적 묶음 처리
분산 GPU 텐서 병렬화 및 파이프라인 병렬화 완벽 지원
OpenAI 호환 고성능 비동기 스트리밍 웹 서버 내장
Llama, DeepSeek, Qwen 등 최신 오픈소스 가중치 모델 즉각 로드