From f46a7a7cf0349f4d50663e3ca14ccf207c4a2bef Mon Sep 17 00:00:00 2001 From: Alex Date: Sun, 19 Jul 2026 10:55:10 -0400 Subject: [PATCH] Fix onnxruntime-gpu churn in Docker TensorRT FP8 install step MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit nvidia-modelopt[onnx] (unbounded, floats to 0.45.0) hard-pins onnxruntime-gpu==1.22.0 on Windows and force-upgrades onnx to 1.21.0, which breaks FP8 quant (external-data loading -> negative QDQ scale). Pin modelopt==0.43.0 (the proven pin used by the installer's TD path) and drop the [onnx] extra, enumerating its deterministic deps explicitly instead — modelopt core has no onnx requirement, so the onnx==1.19.1/onnxruntime-gpu==1.24.4 pins installed just above are never perturbed. Mirrors the same fix landed in forkni/StreamDiffusion-installer#4. Co-Authored-By: Claude Opus 5 --- src/streamdiffusion/tools/install-tensorrt.py | 13 ++++++++++--- 1 file changed, 10 insertions(+), 3 deletions(-) diff --git a/src/streamdiffusion/tools/install-tensorrt.py b/src/streamdiffusion/tools/install-tensorrt.py index 2aa61df64..41a304007 100644 --- a/src/streamdiffusion/tools/install-tensorrt.py +++ b/src/streamdiffusion/tools/install-tensorrt.py @@ -45,10 +45,17 @@ def install(cu: Optional[Literal["11", "12"]] = get_cuda_major()): "install onnx==1.19.1 onnxruntime-gpu==1.24.4 onnxoptimizer==0.4.2 onnxslim==0.1.91 onnxscript==0.6.2 --no-cache-dir" ) - # FP8 quantization dependencies (CUDA 12 only) - # nvidia-modelopt requires cupy; pin cupy 13.x + numpy<2 for mediapipe compat + # FP8 quantization dependencies (CUDA 12 only). Pin modelopt==0.43.0 and skip its [onnx] extra: + # an unbounded modelopt floats to 0.45.0 (force-upgrades onnx to 1.21.0 -> breaks FP8 quant), and + # the [onnx] extra downgrades onnxruntime-gpu off our onnx==1.19.1 / onnxruntime-gpu==1.24.4 pins + # (installed just above). Enumerate the extra's remaining deps; onnxslim/onnxscript (above), + # onnx-graphsurgeon/polygraphy (above) are already satisfied. if cu == "12": - run_pip("install nvidia-modelopt[onnx] cupy-cuda12x==13.6.0 numpy==1.26.4 --no-cache-dir") + run_pip( + "install nvidia-modelopt==0.43.0 " + "cppimport lief ml_dtypes onnxconverter-common~=1.16.0 " + "cupy-cuda12x==13.6.0 numpy==1.26.4 --no-cache-dir" + ) if __name__ == "__main__":