LeanX

vLLM

vLLM은 대규모 언어 모델을 서버에서 효율적으로 실행하고 제공(서빙)하는 오픈소스 추론 엔진입니다. 여러 사용자의 동시 요청을 묶어 처리하도록 설계돼 서비스 운영에 쓰입니다.

쉽게 말하면

식당에 주문이 한꺼번에 몰릴 때, 주방이 주문을 잘 묶어 동시에 조리하면 손님이 덜 기다리죠? vLLM은 AI 모델이 여러 요청을 효율적으로 나눠 처리하게 해주는 주방 운영 시스템이에요.

예시

여러 사용자의 동시 요청을 받는 사내 AI 챗봇 서버에 vLLM 설치 → 오픈 모델을 올려 OpenAI 호환 API 형태로 응답 제공

함께 보면 좋은 용어

올라마, GGUF

더 배우기

AX 가이드 전체 보기

다음 단계

이 개념을 우리 팀 업무에 어떻게 적용할지 고민된다면 아래에서 시작할 수 있습니다.