Update vLLM to v0.27.1 - #6
Merged
Merged
Conversation
Signed-off-by: Chris Leonard <chleonar@redhat.com> Co-authored-by: Shengqi Chen <harry-chen@outlook.com>
Signed-off-by: zjy0516 <riverclouds.zhu@qq.com> Co-authored-by: OpenAI Codex <codex@openai.com> Co-authored-by: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com>
…t#49496) Signed-off-by: reidliu41 <reid201711@gmail.com>
…7494) Signed-off-by: reidliu41 <reid201711@gmail.com>
Signed-off-by: khluu <khluu000@gmail.com> Co-authored-by: OpenAI Codex <codex@openai.com>
Signed-off-by: Itay Alroy <ialroy@nvidia.com>
…vllm-project#48589) Signed-off-by: Xin He <xin3.he@intel.com> Co-authored-by: Kunshang Ji <kunshang.ji@intel.com>
…llm-project#49345) Signed-off-by: NickLucche <nicolo.lucchesi@mistral.ai>
Signed-off-by: Angel Li <liangel@meta.com> Co-authored-by: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com> Co-authored-by: Matthew Bonanni <mbonanni@redhat.com> Co-authored-by: Michael Goin <mgoin64@gmail.com>
…models (vllm-project#49612) Signed-off-by: Nick Hill <nickhill123@gmail.com> Co-authored-by: Claude Fable 5 <noreply@anthropic.com>
…50131) Signed-off-by: Harry Mellor <19981378+hmellor@users.noreply.github.com>
Signed-off-by: Nick Hill <nickhill123@gmail.com> Co-authored-by: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
…lock size (vllm-project#48391) Signed-off-by: oops-oom <73481342@qq.com> Signed-off-by: oops-oom <liubin8905@vip.qq.com> Co-authored-by: oops-oom <73481342@qq.com> Co-authored-by: Claude Opus 4.8 (1M context) <noreply@anthropic.com> Co-authored-by: Wentao Ye <44945378+yewentao256@users.noreply.github.com> Co-authored-by: Shengqi Chen <harry-chen@outlook.com>
…roject#49964) Signed-off-by: Jonguk Cheong <jdal3031@snu.ac.kr> Co-authored-by: OpenAI Codex <codex@openai.com>
…ject#49877) Signed-off-by: Itay Etelis <itay.etelis@ibm.com> Co-authored-by: Itay Etelis <itay.etelis@ibm.com> Co-authored-by: Itay Etelis <Itay.etelis@gmail.com>
Signed-off-by: ibrahimibrahim <ibib2595@gmail.com> Co-authored-by: ibrahimibrahim <ibib2595@gmail.com> Co-authored-by: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
…it (vllm-project#50053) Signed-off-by: Nick Hill <nickhill123@gmail.com> Co-authored-by: Andreas Karatzas <akaratza@amd.com>
…m-project#48407) Signed-off-by: Yiliu Dong <91178480+qianlihuang@users.noreply.github.com> Co-authored-by: OpenAI Codex <codex@openai.com>
…m-project#50081) Signed-off-by: Bugen Zhao <i@bugenzhao.com>
…mm (vllm-project#47773) Signed-off-by: jiacao-amd <jiahui.cao@amd.com> Co-authored-by: TJian <tunjian.tan@embeddedllm.com>
Signed-off-by: Andreas Karatzas <akaratza@amd.com>
… fused name matches over class match (vllm-project#49483) Signed-off-by: Brian Dellabetta <bdellabe@redhat.com>
…ct#49030) Signed-off-by: xiaoming <1259730330@qq.com>
…r DeepSeek-V4 (vllm-project#49714) Signed-off-by: shen-shanshan <467638484@qq.com>
Signed-off-by: johnny <johnnyychiu@gmail.com>
vllm-project#50129) Signed-off-by: Bugen Zhao <i@bugenzhao.com>
…batches (vllm-project#50065) Signed-off-by: siddhant-bharti <sbharti@together.ai> Co-authored-by: Claude Fable 5 <noreply@anthropic.com>
Signed-off-by: Bugen Zhao <i@bugenzhao.com>
…th (vllm-project#49618) Signed-off-by: jdebache <jdebache@nvidia.com>
vllm-project#44972) Signed-off-by: chun-wan <chun-wan@amd.com>
…ne) (vllm-project#50688) Signed-off-by: Omkar Shewale <omkarshewale2001@gmail.com>
…r_parallel_size=1 (vllm-project#50766) Signed-off-by: Turner Jabbour <doubleujabbour@gmail.com> Co-authored-by: Claude <noreply@anthropic.com>
…tore groups (vllm-project#49069) Signed-off-by: Yifan Qiao <yifanqiao@inferact.ai> Co-authored-by: xijiade.aihemaiti <3146335281@qq.com>
…roject#50547) Signed-off-by: YAMAMOTO Takashi <yamamoto@midokura.com>
…project#50764) Signed-off-by: Omkar Shewale <omkarshewale2001@gmail.com> Signed-off-by: Andreas Karatzas <Andreas.Karatzas@amd.com> Co-authored-by: Andreas Karatzas <akaratza@amd.com> Co-authored-by: Andreas Karatzas <Andreas.Karatzas@amd.com>
…oject#51003) Signed-off-by: khluu <khluu000@gmail.com> (cherry picked from commit a1657a0)
vllm-project#50915) Signed-off-by: harjoth <harjoth.khara@gmail.com> (cherry picked from commit 122b3d4)
…lm-project#50157) Signed-off-by: amitz-nv <203509407+amitz-nv@users.noreply.github.com> Co-authored-by: OpenAI Codex <codex@openai.com> (cherry picked from commit 52c0e3c)
Signed-off-by: khluu <khluu000@gmail.com> Co-authored-by: OpenAI Codex <codex@openai.com> (cherry picked from commit a5149b2)
Signed-off-by: jiahanc <173873397+jiahanc@users.noreply.github.com> Signed-off-by: wzhao18 <wzhao18.sz@gmail.com> Co-authored-by: jiahanc <173873397+jiahanc@users.noreply.github.com> Co-authored-by: Kevin H. Luu <khluu000@gmail.com> (cherry picked from commit f18e10a)
Signed-off-by: mayuyuace <qiming1.zhang@intel.com> (cherry picked from commit 2755489)
vllm-project#50656) Signed-off-by: Tyler Michael Smith <tlrmchlsmth@gmail.com> Co-authored-by: Claude <noreply@anthropic.com> Co-authored-by: Jee Jee Li <pandaleefree@gmail.com> (cherry picked from commit 5df9999)
…roject#51131) (cherry picked from commit beca88e)
…dules_mapping (vllm-project#51249) Signed-off-by: JianDan0212 <zhangyj0212@gmail.com> Co-authored-by: JianDan0212 <zhangyj0212@gmail.com> (cherry picked from commit 5fba75a)
…e_position (vllm-project#51113) Signed-off-by: Yifan Qiao <yifanqiao@inferact.ai> Co-authored-by: Hernan <kodek@eat1337.com> Co-authored-by: yanghui1-arch <3053034939@qq.com> Co-authored-by: Claude Opus 5 <noreply@anthropic.com> (cherry picked from commit c56f169)
Signed-off-by: Wu, Xiaochang <xiaochang.wu@intel.com> Signed-off-by: Xiaochang Wu <xiaochang.wu@intel.com> Co-authored-by: Kunshang Ji <kunshang.ji@intel.com> (cherry picked from commit d5aae2b)
Signed-off-by: zjy0516 <riverclouds.zhu@qq.com> (cherry picked from commit 27d7303)
Signed-off-by: Jeff Ma <jeffjma@umich.edu> (cherry picked from commit 04d13b5)
Signed-off-by: lkm2835 <lkm2835@gmail.com> Co-authored-by: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com> (cherry picked from commit 9ae11a6)
…ject#51196) Signed-off-by: Linkun Chen <github@lkchen.net> (cherry picked from commit 7f58e82)
Signed-off-by: Harry Mellor <19981378+hmellor@users.noreply.github.com> Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com>
Signed-off-by: Andrii Skliar <askliar@nvidia.com> Co-authored-by: Andrii Skliar <askliar@nvidia.com> Co-authored-by: Benjamin Chislett <bchislett@nvidia.com> (cherry picked from commit b977407)
Signed-off-by: khluu <khluu000@gmail.com> Co-authored-by: OpenAI Codex <codex@openai.com> (cherry picked from commit 8a9f9f7)
Use a release-specific uv cache for source-built test dependencies and verify that the Arctic native extension loads in the resulting image. Co-authored-by: OpenAI Codex <codex@openai.com> Signed-off-by: khluu <khluu000@gmail.com>
The arm64 test lockfile intentionally omits arctic-inference, so only validate its native extension on platforms where the package is installed. Co-authored-by: OpenAI Codex <codex@openai.com> Signed-off-by: khluu <khluu000@gmail.com>
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
vLLM v0.26.0 → v0.27.1 업데이트 보고서
upstream(
vllm-project/vllm)의v0.27.1태그를main(v0.26.0 기반)에 머지한 브랜치입니다.개요
vllm/코어만 776개 파일 (+65,208 / −13,952)vllm/v1/attention/ops/triton_merge_attn_states.py, 아래 상세)max_num_partial_prefills/max_long_partial_prefills인자 제거([Misc] Remove old now unsupportedmax_num_partial_prefillsandmax_long_partial_prefillsvllm-project/vllm#49244), Plamo2([Model] Remove Plamo2 vllm-project/vllm#49729)·Ouro([Model] Remove Ouro vllm-project/vllm#49786) 모델 제거.본 프로젝트(P/D Disaggregation·MoE/EP 연구) 관련 핵심 변경
P/D Disaggregation
add_remote_agentstep in D->P handshake vllm-project/vllm#49345).prepare_value벡터화([Perf][KVConnector][Mooncake] Vectorize prepare_value on the KV load path vllm-project/vllm#48531).대규모 서빙 / EP·DP
MoE 성능/구조
reduce_scatter회귀 수정으로 E2E 처리량 5% 회복([Perf] Fix moereduce_scatterperf regression by removing additional comm, 5% E2E throughput gain back. vllm-project/vllm#48763), bias 없는 non-grouped topk 라우팅의 fused path 디스패치(perf: dispatch non-grouped bias-less topk routing methods to fused path vllm-project/vllm#49618), LL BF16 router GEMM 튜닝([Perf] Tune LL BF16 Router GEMM vllm-project/vllm#48774),VLLM_TRITON_USE_TD로 Triton tensor-descriptor fused MoE 경로 제공(fused_moe: add VLLM_TRITON_USE_TD tensor-descriptor path vllm-project/vllm#42436), topk에서 cudagraph/DP 패딩 스킵(skip cudagraph/DP padding in topk vllm-project/vllm#48979).KV Offloading
일반 주요 변경 (Highlights)
모델 지원
엔진 코어
하드웨어
sm_107) 타깃 추가(Addsm_107for Rubin vllm-project/vllm#49387)와 SM107 NVLink all-reduce([Rubin] Enable NVLink all-reduce paths on SM107 vllm-project/vllm#49647). ROCm gfx1250 활성화(Enable gfx1250 ROCm architecture vllm-project/vllm#46516), XPU QK Norm+RoPE fusion([XPU] Enable QK Norm + RoPE fusion pass on XPU vllm-project/vllm#49394), Arm CPU INT8 fused MoE 커널([CPU][Perf] INT8 Fused MoE Kernel for Arm CPUs vllm-project/vllm#48637).API / 프론트엔드
vllm-bench의vllmCLI 통합([Rust][Benchmark] Integratevllm-benchtovllm-rs&vllmCLI vllm-project/vllm#48930).cache_salt([Frontend] Add cache_salt support to Anthropic Messages API vllm-project/vllm#49498).양자화
v0.27.1 패치 내용
머지 충돌 해소 상세
vllm/v1/attention/ops/triton_merge_attn_states.py1건:output_lse를 head/token stride 인자로 접근)이 같은tl.store라인에서 충돌.060b5f61d) upstream(stride 파라미터) 쪽을 채택. 머지 결과 파일 전체가 stride 방식 시그니처를 사용함을 확인.🤖 Generated with Claude Code