perf(ggml-cuda): skip shared reduction and barrier for single-wave mu… #1510
ci.yml
on: push
uv workspace (lock + sync + import smoke)
48s
Build (cmake + uv sync --extra megakernel)
19m 41s
GPU tests (self-hosted Radeon 8060S, gfx1151 / ROCm)
9s