vLLM v0.28.0, 추측 디코딩과 계층형 KV 캐시를 확장하다

vLLM v0.28.0의 추측 디코딩, 계층형 KV 캐시와 Model Runner V2 변화, 업그레이드 시 확인할 호환성 문제를 정리합니다.

이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준

vLLM v0.28.0은 새 모델을 추가하는 데 그치지 않고 추론 속도, 메모리 계층, 실행 구조와 기본 설정을 함께 손본 릴리스다. Kimi-K3와 DeepSeek V4의 실행 경로를 최적화하고 추측 디코딩과 KV 캐시 관리 기능을 확장한 반면, 의존성과 API에는 호환성 파괴 변경이 포함됐다.

무엇이 달라졌나

이번 버전에는 DFlash2의 로컬 컨볼루션과 후보 선택기, DSpark의 신뢰도 기반 검증, 드래프트 모델을 위한 비동기 스케줄링이 구현됐다.1 긴 문맥에서 사용하는 MLA 캐시 수집과 샘플링 경로도 개선됐으며, GPU와 CPU 사이의 동기화를 줄이는 작업이 이뤄졌다.

메모리 측면에서는 계층형 KV 캐시가 디스크 오프로딩과 외부 보조 계층 관리자를 지원한다. Model Runner V2에는 실행 단계 분리, 가중치 오프로딩, 다중 계층 MTP KV 캐시, 인코더 CUDA 그래프가 추가됐다. 기본 배치 토큰 수는 8192에서 16384로 늘었고 Mamba 모델의 프리픽스 캐싱은 기본으로 활성화됐다.

배경

[[project:vllm|vLLM]]은 대형 언어 모델의 추론과 서빙을 지원하는 오픈소스 프로젝트로, GPU와 CPU뿐 아니라 ROCm과 XPU 환경용 배포물도 제공한다. 이번 릴리스는 모델 실행 경로, 스케줄링, 캐시, 분산 실행과 서빙 계층을 한 번에 확장했다는 점에서 [[topic:ai/infrastructure|AI 인프라]] 업데이트에 가깝다.

왜 중요한가

추측 디코딩은 드래프트 모델이 만든 후보를 검증해 생성 과정을 가속하는 접근이다. v0.28.0은 후보 생성·선택뿐 아니라 신뢰도에 따른 검증과 비동기 스케줄링까지 다루므로, 추측 디코딩의 실행 경로를 여러 단계에서 개선하려는 변화로 볼 수 있다.1

계층형 KV 캐시와 가중치 오프로딩은 제한된 장치 메모리에서 긴 문맥이나 큰 모델을 운용할 때 선택할 수 있는 메모리 배치 수단을 넓힌다. 다만 실제 처리량과 지연시간이 얼마나 개선되는지는 제공된 맥락만으로 확인할 수 없다.

한계와 남은 질문

기본값 변경은 기존 배포의 메모리 사용량과 동작을 바꿀 수 있다. bitsandbytes 지원은 외부 플러그인으로 이동했고 Transformers 의존성은 5.15.0으로 올라갔으며 일부 사용 중단 API가 제거됐다. 따라서 업그레이드 전에는 의존성, 삭제된 API, 캐시 설정과 배치 토큰 기본값을 점검할 필요가 있다.

릴리스 정보에는 여러 기능이 열거돼 있지만 하드웨어별 벤치마크, 모델별 성능 향상 폭, 디스크 오프로딩의 비용은 이 맥락에 제시되지 않았다. Kimi-K3와 DeepSeek V4 최적화가 어떤 환경에서 얼마나 효과적인지도 알 수 없다.

관련 지식

[[topic:ai/llm|대형 언어 모델]] 서빙에서는 실행 엔진의 연산 효율뿐 아니라 요청 스케줄링과 KV 캐시 배치가 처리량과 지연시간에 영향을 준다. 추측 디코딩은 검증 가능한 후보를 미리 생성하는 방식이며, 계층형 캐시는 빠르지만 제한된 장치 메모리와 더 느린 보조 저장 계층을 함께 활용하는 구조다.

이번 공개는 새 모델 자체보다 여러 모델을 실제 환경에서 제공하는 런타임의 변화라는 점에서 [[topic:ai/model-releases|모델 공개]]와 [[topic:ai/infrastructure|AI 인프라]]가 맞닿는 사례다.

출처

각주

  1. vLLM v0.28.0의 DFlash2, DSpark 신뢰도 기반 검증, 드래프트 모델 비동기 스케줄링 구현. 2

이전
v0.24.0은 추측 디코딩 지원을 확장했지만, 이번 버전에 명시된 세부 기능은 반영되지 않았다.
현재
v0.28.0에서 DFlash2, DSpark 검증, 드래프트 모델 비동기 스케줄링을 포함한 추측 디코딩 기능이 확장됐다.

관련 지식

project:vllm

  • implementstechnology:speculative-decoding신뢰도 99%마지막 검증 2026-08-26

출처

피드로 돌아가기