whisper.cpp/ggml
ynankani 51319a2cd9 CUDA: MMVQ nwarps=8 for bs=1 for dense models on DGX Spark (llama/26843)
* CUDA: MMVQ nwarps=8 for bs=1 for dense models on DGX Spark

Signed-off-by: ynankani <ynankani@nvidia.com>

* skip moe experts and allow others based on k geometry (allow only small idle tail)

Signed-off-by: ynankani <ynankani@nvidia.com>

* rename MMVQ DGX Spark params to GB10 and fix MSVC constexpr lambda capture

Signed-off-by: ynankani <ynankani@nvidia.com>

---------

Signed-off-by: ynankani <ynankani@nvidia.com>
2026-08-18 15:33:21 +03:00
..
cmake cmake : add config version support (ggml/1582) 2026-08-14 22:16:06 +03:00
include ggml : recurrent state rollback for ggml_ssm_scan (llama/26623) 2026-08-14 22:16:06 +03:00
src CUDA: MMVQ nwarps=8 for bs=1 for dense models on DGX Spark (llama/26843) 2026-08-18 15:33:21 +03:00
.gitignore whisper : reorganize source code + improve CMake (#2256) 2024-06-26 19:34:09 +03:00
CMakeLists.txt ggml : bump version to 0.20.1 (ggml/1587) 2026-08-18 15:33:21 +03:00