vLLM v0.23.0, 기본 실행기와 KV 캐시 계층을 확장하다

vLLM v0.23.0의 Model Runner V2 기본 적용 확대와 객체 저장소 기반 KV 캐시 오프로딩이 모델 서빙 운영에 갖는 의미를 정리한다.

이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준

vLLM v0.23.0은 모델 실행 경로의 기본값과 KV 캐시의 저장 계층을 함께 확장한 릴리스다. 특히 Llama·Mistral 밀집 모델의 기본 실행기가 Model Runner V2로 바뀌었고, KV 캐시를 객체 저장소로 내보낼 수 있는 보조 계층이 추가됐다. 모델 호환성 확대뿐 아니라 요청 처리, 캐시 관리, 분산 실행, 하드웨어 최적화를 함께 다룬 업데이트라는 점에서 AI 모델 서빙 인프라의 변화 방향을 보여준다.

무엇이 달라졌나

가장 명확한 변화는 Model Runner V2의 기본 적용 범위다. v0.23.0부터 Llama와 Mistral의 밀집 모델에서는 Model Runner V2가 기본으로 선택된다.1 기존 실행 경로를 명시적으로 선택하지 않은 배포에서도 모델 종류에 따라 실제 사용되는 러너가 달라질 수 있다는 뜻이다.

캐시 계층도 확장됐다. vLLM의 KV 캐시 오프로딩 프레임워크에 객체 저장소 기반 보조 계층이 추가됐다.2 릴리스에는 요청별 오프로딩 정책과 분산 KV 연결, 데이터 병렬 배치, 파이프라인 병렬 처리에 관련된 기능 및 수정도 포함돼 있다.

배경

AI 인프라는 모델을 실행하는 런타임만이 아니라 요청 처리, 캐시 관리, 분산 실행, 하드웨어별 커널 최적화를 포괄한다. vLLM 같은 모델 서빙 프로젝트에서는 실행기의 선택과 KV 캐시의 배치가 같은 서빙 경로 안에서 맞물린다. 이번 릴리스가 모델 실행, 캐시 이동, 분산 서빙과 장치별 최적화를 폭넓게 갱신한 것도 이런 구조를 반영한다.

왜 중요한가

Model Runner V2가 널리 쓰이는 Llama·Mistral 계열의 기본값이 됐다는 것은 새 실행 경로가 일부 선택적 구성에서 일반적인 배포 경로로 이동했음을 뜻한다. 운영자는 업그레이드 전후에 지연 시간과 처리량뿐 아니라 기존 설정, 확장 기능 및 모델별 동작이 유지되는지 확인할 필요가 있다.

객체 저장소 보조 계층은 KV 캐시를 장치나 단일 호스트의 메모리 바깥으로 이동시키는 선택지를 넓힌다. 이는 캐시 계층을 더 유연하게 구성할 기반이지만, 실제 효과는 저장소 지연, 네트워크 비용, 캐시 적중 패턴과 운영 환경에 따라 달라질 수 있다.

한계와 남은 질문

제공된 근거는 두 기능의 추가와 기본값 변경을 확인하지만, 이전 버전 대비 성능 수치나 모델별 호환성 결과는 제시하지 않는다. 객체 저장소 보조 계층이 어떤 저장소를 지원하는지, 장애 시 일관성과 복구를 어떻게 처리하는지, 어느 규모에서 이점이 생기는지도 현재 문맥만으로는 알 수 없다. Model Runner V2 전환에 따른 구체적인 마이그레이션 조건과 회귀 위험 역시 별도 검증이 필요하다.

관련 지식

이번 변화는 대형 언어 모델의 서빙 경로와 AI 인프라의 캐시·분산 실행 계층에 직접 관련된다. 릴리스에는 모델과 멀티모달 지원 확대도 포함됐지만, 제공된 canonical Claim만으로는 개별 멀티모달 변경 사항을 구체적으로 확정할 수 없다.

출처

각주

  1. vLLM v0.23.0 릴리스 노트 — Llama와 Mistral 밀집 모델에서 Model Runner V2가 기본으로 선택된다는 설명.

  2. vLLM v0.23.0 릴리스 노트 — KV 캐시 오프로딩 프레임워크에 객체 저장소 보조 계층이 추가됐다는 설명.

이전
Model Runner V2의 기본 적용 범위가 Qwen3 중심이었고, KV 캐시 오프로딩에 객체 저장소 기반 보조 계층이 없었다.
현재
Llama와 Mistral 밀집 모델까지 Model Runner V2가 기본 적용되고, KV 캐시에 객체 저장소 기반 보조 오프로딩 계층이 포함됐다.

관련 지식

project:vllm

  • implementstechnology:speculative-decoding신뢰도 99%마지막 검증 2026-08-26

출처

피드로 돌아가기