AI 인프라

마지막 검증 2026-08-26

이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준

개요

AI 추론 인프라는 대형 언어 모델을 여러 하드웨어와 실행 환경에서 효율적으로 제공하기 위한 런타임, 스케줄링, 캐시 관리, 통신 계층을 포함한다. vLLM v0.28.0은 CUDA, ROCm, CPU, XPU용 배포물을 제공하며 모델 실행과 서빙 계층을 함께 확장했다.

추론 성능

이번 버전은 Kimi-K3와 DeepSeek V4의 실행 경로를 최적화하고 DFlash2, DSpark 검증, 드래프트 모델 비동기 스케줄링 등 추측 디코딩 기능을 추가했다. GPU와 CPU 사이의 동기화를 줄이고 긴 문맥의 MLA 캐시 수집과 샘플링 경로도 개선했다.

메모리와 분산 실행

계층형 KV 캐시는 디스크 오프로딩과 외부 보조 계층 관리자를 지원한다. Model Runner V2에는 실행 단계 분리, 가중치 오프로딩, 다중 계층 MTP KV 캐시, 인코더 CUDA 그래프 등의 기능이 추가됐다.

배포와 호환성

기본 배치 토큰 수가 8192에서 16384로 늘었고 Mamba 모델의 프리픽스 캐싱이 기본 활성화됐다. 한편 bitsandbytes 지원은 외부 플러그인으로 이동했고 Transformers 의존성은 5.15.0으로 올라갔으며 일부 사용 중단 API가 제거됐다.

링크된 엔티티

  • 추측 디코딩

최근 변경