vLLM 0.28.0, 배치 토큰 기본값을 두 배로 높였다
vLLM 0.28.0의 배치 토큰 기본값 변경과 추측 디코딩·KV 캐시·하드웨어 지원 확장이 운영에 미치는 의미를 정리합니다.
이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준
vLLM 0.28.0이 2026년 8월 26일 공개됐다. 이번 버전은 모델 러너, 추측 디코딩, KV 캐시, 하드웨어 백엔드와 모델 지원을 폭넓게 손보는 동시에 기본 설정과 호환성에 영향을 주는 변경을 포함한다. 특히 한 번에 배치할 수 있는 토큰 수의 기본값이 커져, 업그레이드 전후의 처리량과 자원 사용을 함께 점검할 필요가 있다.
무엇이 달라졌나
vLLM 0.28.0에서는 max_num_batched_tokens 기본값이 8192에서 16384로 높아졌다.1 이와 함께 모델 러너, 초안 모델의 비동기 스케줄링과 여러 추측 디코딩 방식, 세분화된 프리픽스 재사용이 확장됐다. KV 캐시 영역에는 디스크를 포함하는 계층형 오프로딩, 외부 보조 계층 관리자, 병렬 구성과 독립적인 CPU 레이아웃 관련 기능이 포함됐다.
실행 환경 측면에서는 CUDA, ROCm, CPU, XPU용 배포 산출물이 제공되며 NVIDIA와 AMD 하드웨어를 위한 커널과 실행 경로가 추가됐다. 일부 기존 기능은 외부 플러그인으로 이동하거나 제거됐다.
배경
AI 인프라는 대형 언어 모델을 실제 환경에서 추론하고 서비스하기 위한 런타임, 스케줄링, 캐시와 하드웨어 지원 계층을 포괄한다. 이 가운데 배치 토큰 한도는 서버가 요청을 묶어 처리하는 방식과 맞닿아 있다. KV 캐시의 배치와 오프로딩 방식 역시 제한된 가속기 메모리를 활용하는 운영 구조에 관여한다.
이번 공개는 새로운 모델이나 가중치 자체보다, 여러 모델을 실행하는 추론·서빙 런타임의 변화라는 성격이 강하다. 따라서 대형 언어 모델 운영자에게는 단순한 기능 추가뿐 아니라 기본값 변경과 제거·이관된 기능의 호환성도 검토 대상이 된다.
왜 중요한가
max_num_batched_tokens의 기본값이 두 배로 증가했기 때문에, 기존 값을 명시하지 않은 배포는 버전만 올려도 동작 조건이 달라질 수 있다.1 실제 처리량이나 메모리 사용량이 얼마나 변하는지는 제공된 근거만으로 단정할 수 없지만, 기본값에 의존하는 환경이라면 업그레이드 전후 측정이 필요하다는 점은 분명하다.
또한 추측 디코딩, 프리픽스 재사용, KV 캐시 오프로딩과 여러 하드웨어 실행 경로가 한 릴리스에서 함께 바뀌었다. 이는 다양한 장비와 워크로드를 지원하는 폭을 넓히는 변화인 동시에, 운영자가 자신의 구성에서 어떤 경로가 선택되는지 다시 확인해야 하는 이유가 된다.
한계와 남은 질문
제공된 근거는 릴리스의 전체 변경 방향과 max_num_batched_tokens 기본값 변경을 확인하지만, 특정 모델·GPU·요청 패턴에서의 성능 수치나 메모리 증가량은 제시하지 않는다. 따라서 기본값 상승이 각 환경에서 처리량 향상, 지연 변화 또는 메모리 압박으로 어떻게 나타나는지는 별도 벤치마크가 필요하다.
외부 플러그인으로 이동하거나 제거된 기능의 정확한 목록과 마이그레이션 절차도 이 문맥만으로는 알 수 없다. 운영 적용 전에는 공식 릴리스 노트에서 사용 중인 기능과 플랫폼에 해당하는 호환성 파괴 변경을 직접 대조해야 한다.
관련 지식
- vLLM: 대형 언어 모델의 추론과 서빙을 위한 오픈소스 프로젝트.
- AI 인프라: 추론 런타임, 스케줄링, 캐시와 하드웨어 지원 계층.
- 대형 언어 모델: 대형 언어 모델의 학습, 공개와 성능 보고를 다루는 주제.
- 모델 공개: 새 모델·가중치·API와 이를 실행하는 런타임 공개를 함께 살펴보는 주제.
출처
각주
-
vLLM v0.28.0 공식 릴리스, 2026년 8월 26일 공개. ↩ ↩2
- 이전
- max_num_batched_tokens 기본값 8192
- 현재
- max_num_batched_tokens 기본값 16384
관련 지식
project:vllm
- implementstechnology:speculative-decoding신뢰도 99%마지막 검증 2026-08-26
출처
- v0.28.0주 출처