Skip to content

Stop Nemo_CICD_Test from failing in forks - #2024

Merged
ko3n1g merged 1 commit into
NVIDIA:mainfrom
tdene:tde/disable_fork_nemoci
Oct 29, 2025
Merged

Stop Nemo_CICD_Test from failing in forks#2024
ko3n1g merged 1 commit into
NVIDIA:mainfrom
tdene:tde/disable_fork_nemoci

Conversation

@tdene

@tdene tdene commented Oct 29, 2025

Copy link
Copy Markdown
Contributor

What does this PR do ?

Stops failure message spam in forks due to Nemo_CICD_Test failing due to is-not-external-contributor failing due to CICD Megatron-LM running on schedule & on pushes in forks.

Contribution process

flowchart LR
    A[Pre-checks] --> B[PR Tests]
    subgraph Code Review/Approval
        C1[Expert Review] --> C2[Final Review]
    end
    B --> C1
    C2 --> D[Merge]
Loading

Pre-checks

  • I want this PR in a versioned release and have added the appropriate Milestone (e.g., Core 0.8)
  • I have added relevant unit tests
  • I have added relevant functional tests
  • I have added proper typing to my code Typing guidelines
  • I have added relevant documentation
  • I have run the autoformatter.sh on my PR

Code review

The following process is enforced via the CODEOWNERS file for changes into megatron/core. For changes outside of megatron/core, it is up to the PR author whether or not to tag the Final Reviewer team.

For MRs into `main` branch

(Step 1): Add PR label Expert Review

(Step 2): Collect the expert reviewers reviews

  1. Attach the Expert Review label when your PR is ready for review.
  2. GitHub auto-assigns expert reviewers based on your changes. They will get notified and pick up your PR soon.

⚠️ Only proceed to the next step once all reviewers have approved, merge-conflict are resolved and the CI is passing.
Final Review might get declined if these requirements are not fulfilled.

(Step 3): Final Review

  1. Add Final Review label
  2. GitHub auto-assigns final reviewers based on your changes. They will get notified and pick up your PR soon.

(Optional Step 4): Cherry-pick into release branch

If this PR also needs to be merged into core_r* release branches, after this PR has been merged, select Cherry-pick to open a new PR into the release branch.

For MRs into `dev` branch The proposed review process for `dev` branch is under active discussion.

MRs are mergable after one approval by either eharper@nvidia.com or zijiey@nvidia.com.

Merging your PR

Any member of core-adlr and core-nemo will be able to merge your PR.

@tdene
tdene requested a review from a team as a code owner October 29, 2025 10:36
@tdene tdene added the Final Review PR is in the "final review" stage label Oct 29, 2025
@ko3n1g ko3n1g added this to the Core 0.16 milestone Oct 29, 2025

@ko3n1g ko3n1g left a comment

Copy link
Copy Markdown
Contributor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

Ty!

@ko3n1g
ko3n1g merged commit 69d23c4 into NVIDIA:main Oct 29, 2025
14 checks passed
@tdene
tdene deleted the tde/disable_fork_nemoci branch October 29, 2025 13:10
asolergi-nv pushed a commit to asolergi-nv/Megatron-LM that referenced this pull request Oct 31, 2025
sidsingh-nvidia pushed a commit to sidsingh-nvidia/Megatron-LM that referenced this pull request Oct 31, 2025
yeyu-nvidia pushed a commit to yeyu-nvidia/Megatron-LM that referenced this pull request Oct 31, 2025
Jianbing-D pushed a commit to Jianbing-D/Megatron-LM that referenced this pull request Nov 12, 2025
* ci: Move test optimizer into its own bucket (NVIDIA#1909)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Use matrix for approval-bot

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Update function name

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Adjust approval-bot for copy-pr-bot

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Parametrize workflow

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Parametrize workflow

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Remove attribute

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Update container image tag to use GitHub SHA

* chore: Remove file

* ci: Fix approval bot

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Configure cherrypick bot (NVIDIA#1925)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ci approve dev (NVIDIA#1933)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Update nightly schedule (NVIDIA#1934)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Bump pre-flight for runs on main/dev (NVIDIA#1935)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Allow skipping on main (NVIDIA#1936)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/pr template community bot (NVIDIA#1937)

* ci: More granular unit tests buckets (NVIDIA#1932)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Add sequence packing to RL (NVIDIA#1911)

Add sequence packing to RL

* chore: Update template (NVIDIA#1939)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* chore: Add description about who can merge (NVIDIA#1940)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/fix main on eos (NVIDIA#1938)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/internal mrs (NVIDIA#1942)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Fix branch of approval bot (NVIDIA#1944)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Approvalbot for other branches (NVIDIA#1947)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(fix): Approval bot (NVIDIA#1949)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(fix): Approval gate

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Approval gate rule

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Update golden values nightly

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Approval gate

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Approval bot

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Sync branches

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Smaller image

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Better output

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: sync branches

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Fix sync bot

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Finalize

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Finalize

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/sync branches (NVIDIA#1956)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Increase time limit for main tests

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/add milestone (NVIDIA#1951)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Remove M-FSDP testing under LTS environment (NVIDIA#1959)

* ci: Run on push to release branch (NVIDIA#1960)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Add golden values for inference

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Fix typo in rl section of CODEOWNERS (NVIDIA#1968)

* ci: Update copyright checker (NVIDIA#1973)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/auto reminder GitHub (NVIDIA#1955)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Update secret

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(fix): `Run tests` label (NVIDIA#1970)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Disable tests again

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Add merge-group to copyright check

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Copyright check on merge-queue

Signed-off-by: oliver könig <okoenig@nvidia.com>

* zarr soft deprecation (NVIDIA#2004)

Signed-off-by: dimapihtar <dpihtar@gmail.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Make `get_asyncio_loop` safe to use repeatedly (NVIDIA#1990)

Co-authored-by: oliver könig <okoenig@nvidia.com>

* Update symmetric registration interface to sync-up with upstream pytorch change (NVIDIA#1924)

Signed-off-by: Youngeun Kwon <youngeunk@nvidia.com>
Signed-off-by: Youngeun <kyeg9404@gmail.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* chore: Update codeowners (NVIDIA#2012)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Deduplicate dynamic engine + coordinator. (NVIDIA#1981)

Co-authored-by: Mcore Bot <mcore-bot@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Safely access state dict args in load ckpt (NVIDIA#1957)

Signed-off-by: Maanu Grover <maanug@nvidia.com>

* Allow mixed-batch sampling in dynamic inference (NVIDIA#1927)

* Stop Nemo_CICD_Test from failing in forks (NVIDIA#2024)

* Clean up dynamic inference step (NVIDIA#1992)

Co-authored-by: Lawrence McAfee <lmcafee@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* ci: Auto-update copy-pr-bot vetters (NVIDIA#1850)

Signed-off-by: oliver könig <okoenig@nvidia.com>
Co-authored-by: AJ Schmidt <ajschmidt8@users.noreply.github.com>

* Have datasets account for tokenizers which incorrectly define PAD (NVIDIA#2017)

* ci: Enable integration tests (NVIDIA#2023)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Fix build-push-wheel workflow (NVIDIA#2022)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* chore: Update tooling for interactive jobs (NVIDIA#2032)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* revert(hotfix): ci: trustees_override (NVIDIA#2041)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* add missing warnings import in model parallel config (NVIDIA#2039)

Signed-off-by: ykarnati <ykarnati@nvidia.com>

* Reduce-scatter implementation with FP32 accumulation (NVIDIA#1967)

Signed-off-by: Deepak Narayanan <dnarayanan@nvidia.com>

* ci(fix): Workflows on `main` (NVIDIA#2045)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* build: Bump modelopt (NVIDIA#2046)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Remove TestCaptureFreezeGC unit test. (NVIDIA#1978)

* ci: Add multi-approval action (NVIDIA#2051)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Repair codeowners file

* ci(hotfix): Set docs allowed to fail

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/test iteration time (NVIDIA#2067)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Remove performance for ckpt-resume

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Allow inference test throughput to vary by 10% (NVIDIA#2070)

* ci(hotfix): Inference test pipeline

Signed-off-by: oliver könig <okoenig@nvidia.com>

* chore: Fix autoformatter (NVIDIA#2073)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Remove iteration-time from t5

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): disable inference test

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Disable inference test

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Bypass approvalbot in merge-queue (NVIDIA#2082)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Enable merge-group for approval bot

Signed-off-by: oliver könig <okoenig@nvidia.com>

* chore: Update local tooling (NVIDIA#2066)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Add extra RL files (NVIDIA#2077)

Co-authored-by: Robert Kirby <rkirby@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Prevent summary jobs from running in forks (NVIDIA#2083)

Co-authored-by: oliver könig <okoenig@nvidia.com>

* ci: Fix test scope (NVIDIA#2091)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Remove publish workflows

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Refactor the attention metadata into separate classes (NVIDIA#2001)

Co-authored-by: Siddharth Singh <136645615+sidsingh-nvidia@users.noreply.github.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Guard against incorrectly using MoE prefill graphs (NVIDIA#2030)

Co-authored-by: oliver könig <okoenig@nvidia.com>

* Revert "Refactor the attention metadata into separate classes (NVIDIA#2001)"

This reverts commit a652e2c.

* Run mr-slim tests in lightweight-mode (NVIDIA#2106)

Signed-off-by: Charlie Truong <chtruong@nvidia.com>

* Inference | Lazy compile UVM allocator. (NVIDIA#1977)

Co-authored-by: Mcore Bot <mcore-bot@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* chore: Reenable trustees (NVIDIA#2108)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Revert "Inference | Lazy compile UVM allocator. (NVIDIA#1977)"

This reverts commit 7487c53.

* ci(fix): Changeset of copyright checker (NVIDIA#2110)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/chore/update release settings (NVIDIA#2097)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Remove unnecessary check on rotary_pos_cos (NVIDIA#2003)

Signed-off-by: Keshav Santhanam <ksanthanam@nvidia.com>

* (Reverted) Inference | Lazy compile UVM allocator. (NVIDIA#2125)

Co-authored-by: Mcore Bot <mcore-bot@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Refactor Attention Metadata to Separate Classes (NVIDIA#2112)

Co-authored-by: Siddharth Singh <136645615+sidsingh-nvidia@users.noreply.github.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Refactor model_provider to model_builder format for ModelOpt examples (NVIDIA#2107)

* wandb Inference stats logging (NVIDIA#2026)

Co-authored-by: root <root@gpu-h100-0058.cm.cluster>
Co-authored-by: William Dykas <wdykas@cw-pdx-cs-001-vscode-02.cm.cluster>
Co-authored-by: root <root@gpu-h100-0220.cm.cluster>

* Make `PipelineParallelLayout` always return str from ` __repr__` (NVIDIA#2055)

Signed-off-by: Ananth Subramaniam <ansubramania@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Add flash_attn_3 as first option for FA3 import (NVIDIA#2010)

Signed-off-by: Keshav Santhanam <ksanthanam@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>
Co-authored-by: Teodor-Dumitru Ene <34819528+tdene@users.noreply.github.com>

* Add debugging hint for case when cudagraphs are created but no matching runner is found (NVIDIA#2129)

* ci: LTS container (NVIDIA#2133)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Revert "ci: LTS container (NVIDIA#2133)"

This reverts commit eb48e81.

* Fix param init (NVIDIA#2033)

Signed-off-by: Chen Cui <chcui@nvidia.com>

* Hotfix to unit tests on hopper FA3 (NVIDIA#2143)

* Add BytesIO to safe_globals (NVIDIA#2074)

* add deprecation warning for legacy tokenizer system (NVIDIA#2145)

Signed-off-by: dimapihtar <dpihtar@gmail.com>

* replay: ci: Bump LTS container (NVIDIA#2157)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Hotfix to unit tests on hopper FA3 (bis) (NVIDIA#2179)

* Fix has_modelopt_state() for native Torch checkpoint format (NVIDIA#2160)

Signed-off-by: Asha Anoosheh <aanoosheh@nvidia.com>

* chore: Remove codeowners (NVIDIA#2175)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Fix FP8 inference with sequence parallelism (NVIDIA#2009)

Signed-off-by: Keshav Santhanam <ksanthanam@nvidia.com>
Co-authored-by: Teodor-Dumitru Ene <34819528+tdene@users.noreply.github.com>

* Replace ModelOpt generation server (NVIDIA#2147)

Signed-off-by: Asha Anoosheh <aanoosheh@nvidia.com>

* Add hybrid model support for dynamic inference engine (NVIDIA#1907)

Signed-off-by: Keshav Santhanam <ksanthanam@nvidia.com>
Co-authored-by: Teodor-Dumitru Ene <tene@nvidia.com>

* Async task and event loop safety in Megatron Core (NVIDIA#2025)

Co-authored-by: Robert Kirby <ArEsKay3@users.noreply.github.com>

* Rename skip_prompt_log_probs (NVIDIA#2181)

* Dynamic inference context | UVM only. (NVIDIA#1983)

Co-authored-by: Robert Kirby <rkirby@nvidia.com>
Co-authored-by: Mcore Bot <mcore-bot@nvidia.com>
Co-authored-by: Teodor-Dumitru Ene <tene@nvidia.com>

* Update copy-pr-bot.yaml [skip ci]

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Revert "Dynamic inference context | UVM only. (NVIDIA#1983)"

This reverts commit d6979d6.

* ci: Run `auto-update-copy-pr-bot` only on forks (NVIDIA#2191)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Inference throughput tests: refactor goldens to be in list format (NVIDIA#2072)

* Enable TE custom quantization recipe (NVIDIA#2005)

Signed-off-by: Evgeny <etsykunov@nvidia.com>
Signed-off-by: root <Evgeny>
Co-authored-by: oliver könig <okoenig@nvidia.com>
Co-authored-by: root <Evgeny>

* Remove redundant logits calculations in gpt_model

---------

Signed-off-by: oliver könig <okoenig@nvidia.com>
Signed-off-by: dimapihtar <dpihtar@gmail.com>
Signed-off-by: Youngeun Kwon <youngeunk@nvidia.com>
Signed-off-by: Youngeun <kyeg9404@gmail.com>
Signed-off-by: Maanu Grover <maanug@nvidia.com>
Signed-off-by: ykarnati <ykarnati@nvidia.com>
Signed-off-by: Deepak Narayanan <dnarayanan@nvidia.com>
Signed-off-by: Charlie Truong <chtruong@nvidia.com>
Signed-off-by: Keshav Santhanam <ksanthanam@nvidia.com>
Signed-off-by: Ananth Subramaniam <ansubramania@nvidia.com>
Signed-off-by: Chen Cui <chcui@nvidia.com>
Signed-off-by: Asha Anoosheh <aanoosheh@nvidia.com>
Signed-off-by: Evgeny <etsykunov@nvidia.com>
Signed-off-by: root <Evgeny>
Co-authored-by: oliver könig <okoenig@nvidia.com>
Co-authored-by: Teodor-Dumitru Ene <34819528+tdene@users.noreply.github.com>
Co-authored-by: Dmytro Pykhtar <37850217+dimapihtar@users.noreply.github.com>
Co-authored-by: Youngeun Kwon <youngeunk@nvidia.com>
Co-authored-by: Lawrence McAfee <85179052+lmcafee-nvidia@users.noreply.github.com>
Co-authored-by: Mcore Bot <mcore-bot@nvidia.com>
Co-authored-by: Maanu Grover <109391026+maanug-nv@users.noreply.github.com>
Co-authored-by: Lawrence McAfee <lmcafee@nvidia.com>
Co-authored-by: AJ Schmidt <ajschmidt8@users.noreply.github.com>
Co-authored-by: Yashaswi Karnati <144376261+yashaswikarnati@users.noreply.github.com>
Co-authored-by: Deepak Narayanan <2724038+deepakn94@users.noreply.github.com>
Co-authored-by: helen ngo <helenn@nvidia.com>
Co-authored-by: Robert Kirby <rkirby@nvidia.com>
Co-authored-by: kanz-nv <kanz@nvidia.com>
Co-authored-by: Siddharth Singh <136645615+sidsingh-nvidia@users.noreply.github.com>
Co-authored-by: Charlie Truong <chtruong@nvidia.com>
Co-authored-by: Keshav Santhanam <ksanthanam@nvidia.com>
Co-authored-by: Asha Anoosheh <aanoosheh@nvidia.com>
Co-authored-by: wdykas <73254672+wdykas@users.noreply.github.com>
Co-authored-by: root <root@gpu-h100-0058.cm.cluster>
Co-authored-by: William Dykas <wdykas@cw-pdx-cs-001-vscode-02.cm.cluster>
Co-authored-by: root <root@gpu-h100-0220.cm.cluster>
Co-authored-by: Ananth Subramaniam <ansubramania@nvidia.com>
Co-authored-by: Chen Cui <chcui@nvidia.com>
Co-authored-by: Teodor-Dumitru Ene <tene@nvidia.com>
Co-authored-by: Robert Kirby <ArEsKay3@users.noreply.github.com>
Co-authored-by: Evgeny Tsykunov <e.tsykunov@gmail.com>
Jianbing-D pushed a commit to Jianbing-D/Megatron-LM that referenced this pull request Nov 12, 2025
* ci: Move test optimizer into its own bucket (NVIDIA#1909)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Use matrix for approval-bot

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Update function name

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Adjust approval-bot for copy-pr-bot

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Parametrize workflow

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Parametrize workflow

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Remove attribute

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Update container image tag to use GitHub SHA

* chore: Remove file

* ci: Fix approval bot

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Configure cherrypick bot (NVIDIA#1925)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ci approve dev (NVIDIA#1933)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Update nightly schedule (NVIDIA#1934)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Bump pre-flight for runs on main/dev (NVIDIA#1935)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Allow skipping on main (NVIDIA#1936)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/pr template community bot (NVIDIA#1937)

* ci: More granular unit tests buckets (NVIDIA#1932)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Add sequence packing to RL (NVIDIA#1911)

Add sequence packing to RL

* chore: Update template (NVIDIA#1939)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* chore: Add description about who can merge (NVIDIA#1940)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/fix main on eos (NVIDIA#1938)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/internal mrs (NVIDIA#1942)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Fix branch of approval bot (NVIDIA#1944)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Approvalbot for other branches (NVIDIA#1947)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(fix): Approval bot (NVIDIA#1949)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(fix): Approval gate

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Approval gate rule

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Update golden values nightly

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Approval gate

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Approval bot

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Sync branches

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Smaller image

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Better output

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: sync branches

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Fix sync bot

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Finalize

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Finalize

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/sync branches (NVIDIA#1956)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Increase time limit for main tests

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/add milestone (NVIDIA#1951)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Remove M-FSDP testing under LTS environment (NVIDIA#1959)

* ci: Run on push to release branch (NVIDIA#1960)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Add golden values for inference

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Fix typo in rl section of CODEOWNERS (NVIDIA#1968)

* ci: Update copyright checker (NVIDIA#1973)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/auto reminder GitHub (NVIDIA#1955)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Update secret

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(fix): `Run tests` label (NVIDIA#1970)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Disable tests again

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Add merge-group to copyright check

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Copyright check on merge-queue

Signed-off-by: oliver könig <okoenig@nvidia.com>

* zarr soft deprecation (NVIDIA#2004)

Signed-off-by: dimapihtar <dpihtar@gmail.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Make `get_asyncio_loop` safe to use repeatedly (NVIDIA#1990)

Co-authored-by: oliver könig <okoenig@nvidia.com>

* Update symmetric registration interface to sync-up with upstream pytorch change (NVIDIA#1924)

Signed-off-by: Youngeun Kwon <youngeunk@nvidia.com>
Signed-off-by: Youngeun <kyeg9404@gmail.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* chore: Update codeowners (NVIDIA#2012)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Deduplicate dynamic engine + coordinator. (NVIDIA#1981)

Co-authored-by: Mcore Bot <mcore-bot@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Safely access state dict args in load ckpt (NVIDIA#1957)

Signed-off-by: Maanu Grover <maanug@nvidia.com>

* Allow mixed-batch sampling in dynamic inference (NVIDIA#1927)

* Stop Nemo_CICD_Test from failing in forks (NVIDIA#2024)

* Clean up dynamic inference step (NVIDIA#1992)

Co-authored-by: Lawrence McAfee <lmcafee@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* ci: Auto-update copy-pr-bot vetters (NVIDIA#1850)

Signed-off-by: oliver könig <okoenig@nvidia.com>
Co-authored-by: AJ Schmidt <ajschmidt8@users.noreply.github.com>

* Have datasets account for tokenizers which incorrectly define PAD (NVIDIA#2017)

* ci: Enable integration tests (NVIDIA#2023)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci: Fix build-push-wheel workflow (NVIDIA#2022)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* chore: Update tooling for interactive jobs (NVIDIA#2032)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* revert(hotfix): ci: trustees_override (NVIDIA#2041)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* add missing warnings import in model parallel config (NVIDIA#2039)

Signed-off-by: ykarnati <ykarnati@nvidia.com>

* Reduce-scatter implementation with FP32 accumulation (NVIDIA#1967)

Signed-off-by: Deepak Narayanan <dnarayanan@nvidia.com>

* ci(fix): Workflows on `main` (NVIDIA#2045)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* build: Bump modelopt (NVIDIA#2046)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Remove TestCaptureFreezeGC unit test. (NVIDIA#1978)

* ci: Add multi-approval action (NVIDIA#2051)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Repair codeowners file

* ci(hotfix): Set docs allowed to fail

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/ci/test iteration time (NVIDIA#2067)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Remove performance for ckpt-resume

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Allow inference test throughput to vary by 10% (NVIDIA#2070)

* ci(hotfix): Inference test pipeline

Signed-off-by: oliver könig <okoenig@nvidia.com>

* chore: Fix autoformatter (NVIDIA#2073)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Remove iteration-time from t5

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): disable inference test

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Disable inference test

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Bypass approvalbot in merge-queue (NVIDIA#2082)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Enable merge-group for approval bot

Signed-off-by: oliver könig <okoenig@nvidia.com>

* chore: Update local tooling (NVIDIA#2066)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Add extra RL files (NVIDIA#2077)

Co-authored-by: Robert Kirby <rkirby@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Prevent summary jobs from running in forks (NVIDIA#2083)

Co-authored-by: oliver könig <okoenig@nvidia.com>

* ci: Fix test scope (NVIDIA#2091)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* ci(hotfix): Remove publish workflows

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Refactor the attention metadata into separate classes (NVIDIA#2001)

Co-authored-by: Siddharth Singh <136645615+sidsingh-nvidia@users.noreply.github.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Guard against incorrectly using MoE prefill graphs (NVIDIA#2030)

Co-authored-by: oliver könig <okoenig@nvidia.com>

* Revert "Refactor the attention metadata into separate classes (NVIDIA#2001)"

This reverts commit a652e2c.

* Run mr-slim tests in lightweight-mode (NVIDIA#2106)

Signed-off-by: Charlie Truong <chtruong@nvidia.com>

* Inference | Lazy compile UVM allocator. (NVIDIA#1977)

Co-authored-by: Mcore Bot <mcore-bot@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* chore: Reenable trustees (NVIDIA#2108)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Revert "Inference | Lazy compile UVM allocator. (NVIDIA#1977)"

This reverts commit 7487c53.

* ci(fix): Changeset of copyright checker (NVIDIA#2110)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Ko3n1g/chore/update release settings (NVIDIA#2097)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Remove unnecessary check on rotary_pos_cos (NVIDIA#2003)

Signed-off-by: Keshav Santhanam <ksanthanam@nvidia.com>

* (Reverted) Inference | Lazy compile UVM allocator. (NVIDIA#2125)

Co-authored-by: Mcore Bot <mcore-bot@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Refactor Attention Metadata to Separate Classes (NVIDIA#2112)

Co-authored-by: Siddharth Singh <136645615+sidsingh-nvidia@users.noreply.github.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Refactor model_provider to model_builder format for ModelOpt examples (NVIDIA#2107)

* wandb Inference stats logging (NVIDIA#2026)

Co-authored-by: root <root@gpu-h100-0058.cm.cluster>
Co-authored-by: William Dykas <wdykas@cw-pdx-cs-001-vscode-02.cm.cluster>
Co-authored-by: root <root@gpu-h100-0220.cm.cluster>

* Make `PipelineParallelLayout` always return str from ` __repr__` (NVIDIA#2055)

Signed-off-by: Ananth Subramaniam <ansubramania@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>

* Add flash_attn_3 as first option for FA3 import (NVIDIA#2010)

Signed-off-by: Keshav Santhanam <ksanthanam@nvidia.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>
Co-authored-by: Teodor-Dumitru Ene <34819528+tdene@users.noreply.github.com>

* Add debugging hint for case when cudagraphs are created but no matching runner is found (NVIDIA#2129)

* ci: LTS container (NVIDIA#2133)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Revert "ci: LTS container (NVIDIA#2133)"

This reverts commit eb48e81.

* Fix param init (NVIDIA#2033)

Signed-off-by: Chen Cui <chcui@nvidia.com>

* Hotfix to unit tests on hopper FA3 (NVIDIA#2143)

* Add BytesIO to safe_globals (NVIDIA#2074)

* add deprecation warning for legacy tokenizer system (NVIDIA#2145)

Signed-off-by: dimapihtar <dpihtar@gmail.com>

* replay: ci: Bump LTS container (NVIDIA#2157)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Hotfix to unit tests on hopper FA3 (bis) (NVIDIA#2179)

* Fix has_modelopt_state() for native Torch checkpoint format (NVIDIA#2160)

Signed-off-by: Asha Anoosheh <aanoosheh@nvidia.com>

* chore: Remove codeowners (NVIDIA#2175)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Fix FP8 inference with sequence parallelism (NVIDIA#2009)

Signed-off-by: Keshav Santhanam <ksanthanam@nvidia.com>
Co-authored-by: Teodor-Dumitru Ene <34819528+tdene@users.noreply.github.com>

* Replace ModelOpt generation server (NVIDIA#2147)

Signed-off-by: Asha Anoosheh <aanoosheh@nvidia.com>

* Add hybrid model support for dynamic inference engine (NVIDIA#1907)

Signed-off-by: Keshav Santhanam <ksanthanam@nvidia.com>
Co-authored-by: Teodor-Dumitru Ene <tene@nvidia.com>

* Async task and event loop safety in Megatron Core (NVIDIA#2025)

Co-authored-by: Robert Kirby <ArEsKay3@users.noreply.github.com>

* Rename skip_prompt_log_probs (NVIDIA#2181)

* Dynamic inference context | UVM only. (NVIDIA#1983)

Co-authored-by: Robert Kirby <rkirby@nvidia.com>
Co-authored-by: Mcore Bot <mcore-bot@nvidia.com>
Co-authored-by: Teodor-Dumitru Ene <tene@nvidia.com>

* Update copy-pr-bot.yaml [skip ci]

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Revert "Dynamic inference context | UVM only. (NVIDIA#1983)"

This reverts commit d6979d6.

* ci: Run `auto-update-copy-pr-bot` only on forks (NVIDIA#2191)

Signed-off-by: oliver könig <okoenig@nvidia.com>

* Inference throughput tests: refactor goldens to be in list format (NVIDIA#2072)

* Enable TE custom quantization recipe (NVIDIA#2005)

Signed-off-by: Evgeny <etsykunov@nvidia.com>
Signed-off-by: root <Evgeny>
Co-authored-by: oliver könig <okoenig@nvidia.com>
Co-authored-by: root <Evgeny>

* Add MoE parameters to ModelOpt pruning example + conf fixes (NVIDIA#2205)

Signed-off-by: Keval Morabia <28916987+kevalmorabia97@users.noreply.github.com>

* Add repr to pg collection class (NVIDIA#2089)

Co-authored-by: Jared Casper <155158+jaredcasper@users.noreply.github.com>

* Move `data_samplers.py` from `legacy` to `training.datasets` & add `DistributedSignalHandler` to DataLoader workers (NVIDIA#2068)

* Fix Megatron-FSDP checkpoint save failure (NVIDIA#2138)

---------

Signed-off-by: oliver könig <okoenig@nvidia.com>
Signed-off-by: dimapihtar <dpihtar@gmail.com>
Signed-off-by: Youngeun Kwon <youngeunk@nvidia.com>
Signed-off-by: Youngeun <kyeg9404@gmail.com>
Signed-off-by: Maanu Grover <maanug@nvidia.com>
Signed-off-by: ykarnati <ykarnati@nvidia.com>
Signed-off-by: Deepak Narayanan <dnarayanan@nvidia.com>
Signed-off-by: Charlie Truong <chtruong@nvidia.com>
Signed-off-by: Keshav Santhanam <ksanthanam@nvidia.com>
Signed-off-by: Ananth Subramaniam <ansubramania@nvidia.com>
Signed-off-by: Chen Cui <chcui@nvidia.com>
Signed-off-by: Asha Anoosheh <aanoosheh@nvidia.com>
Signed-off-by: Evgeny <etsykunov@nvidia.com>
Signed-off-by: root <Evgeny>
Signed-off-by: Keval Morabia <28916987+kevalmorabia97@users.noreply.github.com>
Co-authored-by: oliver könig <okoenig@nvidia.com>
Co-authored-by: Teodor-Dumitru Ene <34819528+tdene@users.noreply.github.com>
Co-authored-by: Dmytro Pykhtar <37850217+dimapihtar@users.noreply.github.com>
Co-authored-by: Youngeun Kwon <youngeunk@nvidia.com>
Co-authored-by: Lawrence McAfee <85179052+lmcafee-nvidia@users.noreply.github.com>
Co-authored-by: Mcore Bot <mcore-bot@nvidia.com>
Co-authored-by: Maanu Grover <109391026+maanug-nv@users.noreply.github.com>
Co-authored-by: Lawrence McAfee <lmcafee@nvidia.com>
Co-authored-by: AJ Schmidt <ajschmidt8@users.noreply.github.com>
Co-authored-by: Yashaswi Karnati <144376261+yashaswikarnati@users.noreply.github.com>
Co-authored-by: Deepak Narayanan <2724038+deepakn94@users.noreply.github.com>
Co-authored-by: helen ngo <helenn@nvidia.com>
Co-authored-by: Robert Kirby <rkirby@nvidia.com>
Co-authored-by: kanz-nv <kanz@nvidia.com>
Co-authored-by: Siddharth Singh <136645615+sidsingh-nvidia@users.noreply.github.com>
Co-authored-by: Charlie Truong <chtruong@nvidia.com>
Co-authored-by: Keshav Santhanam <ksanthanam@nvidia.com>
Co-authored-by: Asha Anoosheh <aanoosheh@nvidia.com>
Co-authored-by: wdykas <73254672+wdykas@users.noreply.github.com>
Co-authored-by: root <root@gpu-h100-0058.cm.cluster>
Co-authored-by: William Dykas <wdykas@cw-pdx-cs-001-vscode-02.cm.cluster>
Co-authored-by: root <root@gpu-h100-0220.cm.cluster>
Co-authored-by: Ananth Subramaniam <ansubramania@nvidia.com>
Co-authored-by: Chen Cui <chcui@nvidia.com>
Co-authored-by: Teodor-Dumitru Ene <tene@nvidia.com>
Co-authored-by: Robert Kirby <ArEsKay3@users.noreply.github.com>
Co-authored-by: Evgeny Tsykunov <e.tsykunov@gmail.com>
Co-authored-by: Keval Morabia <28916987+kevalmorabia97@users.noreply.github.com>
Co-authored-by: Jared Casper <155158+jaredcasper@users.noreply.github.com>
Co-authored-by: Antoni-Joan Solergibert <asolergibert@nvidia.com>
cspades pushed a commit to cspades/Megatron-LM that referenced this pull request Jan 7, 2026
yangbofun pushed a commit to xlm-research/Megatron-LM that referenced this pull request May 22, 2026
terminator123 pushed a commit to 021ai/Megatron-LM that referenced this pull request Aug 3, 2026
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

Final Review PR is in the "final review" stage

Projects

None yet

Development

Successfully merging this pull request may close these issues.

2 participants