whisper.cpp/ggml/src/ggml-metal
Sam/Samuel d8a146b0f9 metal: optimise `GGML_OP_SUM` (llama/16559)
* optimise GGML_OP_SUM

* add non-contiguous tests by permuting the input

* change tests to require full contiguity of OP_SUM

* cuda : add check GGML_OP_SUM

---------

Co-authored-by: Georgi Gerganov <ggerganov@gmail.com>
2025-10-22 12:58:11 +03:00
..
CMakeLists.txt metal : refactor + optimize v2 (llama/15995) 2025-09-20 13:46:10 +03:00
ggml-metal-common.cpp metal : fix loop bound in ggml_mem_ranges (llama/16412) 2025-10-12 11:16:23 +03:00
ggml-metal-common.h metal : refactor + optimize v2 (llama/15995) 2025-09-20 13:46:10 +03:00
ggml-metal-context.h metal : refactor + optimize v2 (llama/15995) 2025-09-20 13:46:10 +03:00
ggml-metal-context.m metal : fuse non-sequential nodes (llama/16102) 2025-09-29 15:18:12 +03:00
ggml-metal-device.cpp metal: add support for opt_step_sgd (llama/16539) 2025-10-15 09:29:17 +03:00
ggml-metal-device.h metal: add support for opt_step_sgd (llama/16539) 2025-10-15 09:29:17 +03:00
ggml-metal-device.m metal: optimise `GGML_OP_SUM` (llama/16559) 2025-10-22 12:58:11 +03:00
ggml-metal-impl.h metal : avoid using Metal's gpuAddress property (llama/16576) 2025-10-22 12:58:11 +03:00
ggml-metal-ops.cpp metal: optimise `GGML_OP_SUM` (llama/16559) 2025-10-22 12:58:11 +03:00
ggml-metal-ops.h metal: add support for opt_step_sgd (llama/16539) 2025-10-15 09:29:17 +03:00
ggml-metal.cpp metal : mark FA blocks (llama/16372) 2025-10-12 11:16:23 +03:00
ggml-metal.metal metal: optimise `GGML_OP_SUM` (llama/16559) 2025-10-22 12:58:11 +03:00