vLLM v0.25.0, 기본 러너 전환과 PagedAttention 제거

vLLM v0.25.0의 Model Runner V2 기본화와 PagedAttention 제거가 모델 서빙 운영에 미치는 의미를 정리합니다.

이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준

vLLM v0.25.0은 밀집 모델의 기본 실행 경로를 Model Runner V2로 전환하고, 기존 PagedAttention 구현을 제거했다. 이번 릴리스의 핵심은 단순한 기능 추가보다 모델 서빙 런타임의 기본값과 오래된 구현을 동시에 바꿨다는 데 있다.12

무엇이 달라졌나

첫째, Model Runner V2가 모든 밀집 모델의 기본 실행 경로가 됐다.1 앞선 v0.23.0에서는 이 러너가 Qwen3에 이어 Llama와 Mistral 계열 밀집 모델에도 기본 적용됐지만, v0.25.0은 적용 범위를 모든 밀집 모델로 명시했다.

둘째, 기존 PagedAttention 구현이 제거됐다.2 릴리스에는 이 밖에도 모델 지원, 파서, 추측 디코딩, 하드웨어별 실행 및 분산 서빙과 관련된 업데이트가 포함됐다. 다만 입력에 제공된 정규 Claim이 구체적으로 확정하는 변화는 Model Runner V2의 기본화와 PagedAttention 제거 두 가지다.

배경

[[vLLM]]은 AI 모델을 실행하고 요청을 처리하는 모델 서빙 프로젝트다. 관련 주제인 [[AI 인프라]]는 런타임뿐 아니라 요청 처리, KV 캐시 관리, 분산 실행, 하드웨어별 커널 최적화를 함께 다룬다. 앞선 v0.23.0에서는 Model Runner V2의 적용 확대, 파서 인터페이스 통합, KV 캐시 오프로딩, 파이프라인 병렬 처리와 장치별 성능 최적화가 진행됐다.

[[모델 공개]]의 관점에서도 서빙 런타임은 중요하다. 새 모델이나 아키텍처가 공개되더라도 실제 운용에는 런타임의 모델 호환성, 스케줄링, 캐시 이동 및 가속기 지원이 필요하기 때문이다. 제공된 지식 문맥에 따르면 vLLM v0.19.0 역시 Gemma 4 지원과 추측 디코딩, 캐시 오프로딩, 여러 하드웨어 플랫폼 개선을 포함했다.

왜 중요한가

기본 실행 경로의 변경은 별도 설정을 하지 않은 밀집 모델 워크로드가 새 러너를 사용하게 된다는 뜻이다.1 따라서 vLLM을 업그레이드하는 운영자는 새 기능의 존재 여부뿐 아니라 기본 동작이 달라졌다는 점을 확인할 필요가 있다.

PagedAttention 제거는 기존 구현이 더 이상 릴리스에 포함되지 않는 변화다.2 이 입력만으로는 제거된 구현에 의존하던 설정이나 확장 기능이 정확히 무엇인지 판단할 수 없지만, 업그레이드 검증에서 메모리 관리와 실행 경로를 살펴봐야 할 이유는 분명하다. 두 변화는 vLLM이 새로운 모델 러너를 중심으로 실행 구조를 정리하고 있음을 보여준다.

한계와 남은 질문

제공된 Claim은 기본 러너 변경과 PagedAttention 제거 사실을 확인하지만, 성능 향상 폭이나 메모리 사용량 변화, 호환되지 않는 설정, 마이그레이션 절차는 제시하지 않는다. PagedAttention을 대체하는 구체적인 구현과 사용자 조치도 이 문맥만으로는 알 수 없다.

또한 모델·파서·추측 디코딩·하드웨어·분산 서빙 업데이트의 존재는 Event에 포함돼 있으나, 각 항목의 세부 변경과 영향은 정규 Claim으로 제공되지 않았다. 실제 도입 전에는 사용 중인 모델과 가속기, 분산 구성에서 회귀 테스트가 필요한지 릴리스 원문과 프로젝트 문서를 추가로 확인해야 한다.

관련 지식

이번 변화는 [[AI 인프라]]에서 모델 실행 경로와 캐시 구현이 어떻게 함께 진화하는지를 보여주는 사례다. 관련 엔티티는 [[vLLM]]이며, 새 모델을 실제 환경에서 서비스할 수 있게 하는 런타임 변화라는 점에서 [[모델 공개]]와도 연결된다.

출처

vLLM 프로젝트가 공개한 v0.25.0 릴리스 정보를 근거로 작성했다.12

각주

  1. vLLM v0.25.0 릴리스 — https://github.com/vllm-project/vllm/releases/tag/v0.25.0 2 3 4

  2. vLLM v0.25.0 릴리스 — https://github.com/vllm-project/vllm/releases/tag/v0.25.0 2 3 4

이전
Model Runner V2가 일부 밀집 모델에 단계적으로 기본 적용되고, 기존 PagedAttention 구현이 남아 있었음
현재
모든 밀집 모델이 Model Runner V2를 기본 실행 경로로 사용하고, 기존 PagedAttention 구현은 제거됨

관련 지식

project:vllm

  • implementstechnology:speculative-decoding신뢰도 99%마지막 검증 2026-08-26

출처

피드로 돌아가기