Skip to content

Inference: Bring chat completions API inline with vllm/official openAI spec - #5276

Merged
sidsingh-nvidia merged 5 commits into
NVIDIA:mainfrom
sidsingh-nvidia:siddharth/fix-think-token-retention-multi-turn
Jul 14, 2026
Merged

Inference: Bring chat completions API inline with vllm/official openAI spec#5276
sidsingh-nvidia merged 5 commits into
NVIDIA:mainfrom
sidsingh-nvidia:siddharth/fix-think-token-retention-multi-turn

Commits

Commits on Jun 10, 2026

Commits on Jun 25, 2026

Commits on Jul 13, 2026