Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
Original file line number Diff line number Diff line change
Expand Up @@ -62,6 +62,7 @@ policy:
lr_warmup_init: 5.0e-08
sequence_packing:
enabled: true
fuse_loss: true
generation:
max_new_tokens: 1536
vllm_cfg:
Expand Down
Original file line number Diff line number Diff line change
Expand Up @@ -7,6 +7,7 @@ grpo:
max_val_samples: 16
loss_fn:
use_importance_sampling_correction: true
force_on_policy_ratio: true
checkpointing:
checkpoint_dir: results/grpo-deepseek-v3-32n8g
policy:
Expand Down
Original file line number Diff line number Diff line change
Expand Up @@ -7,6 +7,7 @@ grpo:
max_val_samples: 16
loss_fn:
use_importance_sampling_correction: true
force_on_policy_ratio: true
checkpointing:
checkpoint_dir: results/grpo-qwen3-235b-16n8g
policy:
Expand All @@ -17,6 +18,8 @@ policy:
logprob_batch_size: 1
max_total_sequence_length: 8192
make_sequence_length_divisible_by: 8
sequence_packing:
fuse_loss: true
dtensor_cfg:
enabled: false
megatron_cfg:
Expand Down
Original file line number Diff line number Diff line change
Expand Up @@ -10,6 +10,8 @@ policy:
train_micro_batch_size: 1
logprob_batch_size: 2
max_total_sequence_length: 4096
sequence_packing:
fuse_loss: true
dtensor_cfg:
enabled: false
optimizer: null
Expand Down
Original file line number Diff line number Diff line change
Expand Up @@ -10,6 +10,8 @@ policy:
train_micro_batch_size: 1
logprob_batch_size: 4
max_total_sequence_length: 40960
sequence_packing:
fuse_loss: true
dtensor_cfg:
enabled: false
optimizer: null
Expand Down
Original file line number Diff line number Diff line change
Expand Up @@ -10,6 +10,8 @@ policy:
train_micro_batch_size: 1
logprob_batch_size: 4
max_total_sequence_length: 4096
sequence_packing:
fuse_loss: true
dtensor_cfg:
enabled: false
optimizer: null
Expand Down
Original file line number Diff line number Diff line change
Expand Up @@ -20,6 +20,12 @@ NUM_MINUTES=240

exit_if_max_steps_reached

# envvars for better fp8 inference performance
export VLLM_USE_FLASHINFER_MOE_FP8=1
export VLLM_FLASHINFER_MOE_BACKEND=latency
export VLLM_FLASHINFER_ALLREDUCE_BACKEND=mnnvl
export VLLM_ALLREDUCE_USE_FLASHINFER=1

# Run the experiment
cd $PROJECT_ROOT
uv run examples/run_grpo.py \
Expand Down
Loading