모델 공개
마지막 검증 2026-08-28
이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준
개요
모델 공개는 새로운 모델과 가중치, API가 제공되는 시점과 이용 조건을 다룬다. Gemini 3.5 Transcribe는 음성을 정돈된 텍스트로 변환하는 모델로, 실시간 스트리밍용 모델과 사전 녹음 오디오 처리용 모델이 각각 제공된다.
음성 전사 모델
Gemini 3.5 Transcribe는 말하는 도중의 자기 수정과 군더더기 표현을 처리하고 결과를 자동으로 서식화한다. 사용자 지정 어휘와 85개가 넘는 언어의 자동 감지를 지원하며, 사전 녹음 오디오에서는 단어 단위 타임스탬프와 화자 구분을 제공한다. 개발자는 Gemini API의 Live API와 Interactions API를 통해 공개 미리보기로 사용할 수 있다.
추론 인프라 공개
vLLM v0.24.0은 MiniMax-M3와 DiffusionGemma 등 새로운 모델 지원을 추가하고, 추측 디코딩과 스트리밍 파서 엔진, 분산 서빙 및 여러 하드웨어 경로를 확장했다. 또한 vLLM이 내부에서 CUDA_VISIBLE_DEVICES를 설정하지 않도록 바꾸고 device_ids 인자를 제공했다.