Skip to content

[None][feat] Don't review Stack PR to support Qwen3.8-2.4T-A95B-FP8 best perf - #17537

Closed
Wanli-Jiang wants to merge 18 commits into
NVIDIA:mainfrom
Wanli-Jiang:user/williamj/support-new-model-pr-stacks
Closed

[None][feat] Don't review Stack PR to support Qwen3.8-2.4T-A95B-FP8 best perf#17537
Wanli-Jiang wants to merge 18 commits into
NVIDIA:mainfrom
Wanli-Jiang:user/williamj/support-new-model-pr-stacks

Conversation

@Wanli-Jiang

@Wanli-Jiang Wanli-Jiang commented Aug 12, 2026

Copy link
Copy Markdown
Collaborator

Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Add an opt-in, offline-cache dispatcher for Blackwell BF16 GEMMs with M <= 32. Route exact graph/eager shapes to FlashInfer direct or split-K tactics, or preserve the existing TensorRT-LLM path, while validating cache and runtime provenance.

Initialize the dispatcher with the model, retain an explicit rollback path, and support debug-only hot-shape collection with focused unit coverage.

Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
Signed-off-by: Wanli Jiang <35160485+Wanli-Jiang@users.noreply.github.com>
@Wanli-Jiang Wanli-Jiang changed the title [None][feat] Don't review PR stacks to support new model [None][feat] Don't review Stack PR to support Qwen3.8-2.4T-A95B-FP8 best perf Aug 13, 2026
@Wanli-Jiang

Wanli-Jiang commented Aug 18, 2026

Copy link
Copy Markdown
Collaborator Author

@NVIDIA NVIDIA deleted a comment from tensorrt-cicd Aug 18, 2026
@NVIDIA NVIDIA deleted a comment from tensorrt-cicd Aug 18, 2026
@NVIDIA NVIDIA deleted a comment from tensorrt-cicd Aug 18, 2026
@NVIDIA NVIDIA deleted a comment from tensorrt-cicd Aug 18, 2026
@Wanli-Jiang

Copy link
Copy Markdown
Collaborator Author

Close since all PRs (except the online EPLB one) were merged.

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant