Aleksei Nikiforov
55927d42ef
ggml-zdnn : mark zDNN buffers as non-host (llama/18967)
...
While buffers reside in host memory,
additional transformation is needed to use buffers with zDNN.
Fixes #18848
2026-01-30 15:56:40 +02:00
Georgi Gerganov
47f3e3b927
ggml : add ggml_build_forward_select (llama/18550)
...
* ggml : add ggml_build_forward_select
* cuda : adapt CUDA graph compat to new feature
* vulkan : update logic to handle command buffer closing
* ggml : check compute for fusion
* ggml : add comment
2026-01-30 15:56:40 +02:00
Aaron Teo
c706a50746
zdnn: refactor codebase + add docs (llama/16178)
...
* zdnn: initial matmul refactor
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
* ggml-zdnn: rm static from funcs
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
* ggml-zdnn: update ggml-zdnn.h
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
* ggml-zdnn: change header files to hpp
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
* ggml-zdnn: switch to common.hpp
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
* ggml-zdnn: move mulmat forward around
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
* ggml-zdnn: rm inline from utils
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
* ggml-zdnn: code cleanup
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
* docs: add zDNN docs
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
---------
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
2025-09-29 15:18:09 +03:00
Jeff Bolz
7fcb7e83ec
rename optimize_graph to graph_optimize (llama/16082)
2025-09-20 13:46:39 +03:00
Aaron Teo
7dca05ca77
ggml-zdnn: rm user mapped buffers (llama/15965)
...
* ggml-zdnn: rm user mapped buffers
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
* ggml-zdnn: rm dead code
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
* ggml-zdnn: attempt to fix missing extra data buffer free
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
---------
Signed-off-by: Aaron Teo <aaron.teo1@ibm.com>
2025-09-20 13:45:29 +03:00
Aaron Teo
e902731ccc
ggml-zdnn: fix #15414 , activate FP16 and BF16 acceleration and incorrect zTensor free (llama/15839)
2025-09-20 13:45:28 +03:00
Jeff Bolz
c29cd54818
vulkan: sort graph to allow more parallel execution (llama/15850)
...
* vulkan: sort graph to allow more parallel execution
Add a backend proc to allow the backend to modify the graph. The
vulkan implementation looks at which nodes depend on each other
and greedily reorders them to group together nodes that don't
depend on each other. It only reorders the nodes, doesn't change
the contents of any of them.
With #15489 , this reduces the number of synchronizations needed.
* call optimize_graph per-split
2025-09-20 13:42:52 +03:00
Aaron Teo
03d6607691
ggml : initial zDNN backend (llama/14975)
2025-08-18 20:30:45 +03:00