mirror of
https://github.com/ggml-org/whisper.cpp.git
synced 2026-10-09 07:45:39 +02:00
+67









Georgi Gerganov
Aparna M P
Max Krasnyansky
fairydreaming
Stanisław Szymczyk
Johannes Gäßler
Hongqiang Wang
Martin Chang
Vidas
Gianluca Guida
Gianluca Guida
ubergarm
SaqibAkram-10xE
Rehan Qasim
Li He
Raman Shinde
cphlipot
Rohit Mahesh
Todd Malsbary
Frosty40
Claude Fable 5
QuintinShaw
Jeff Bolz
Pasha Khosravi
Titaniumtown
Charles Xu
JusteLeo
Chyan
hmscider
scientist3
hmscider
maxious
Francois Dugast
Andrew Smith
Neo Zhang
Michael Lamothe
Pascal
leonardHONG
David Friehs
Pranesh Gonegandla
praneshgo
liminfei-amd
Alexander Heisler
Anav Prasad
Ruben Ortlam
Rajendra Matcha
Aman Gupta
akleine
Gezahegne
Aaron Teo
Todor Boinovski
Piotr Wilkin
Markus Ebner
Winston Ma
Kamalesh VS
Wei Wang
m1el
shalinib-ibm
Oliver Simons
Ilia Ilmer
adgup-qti
kumaal
Yongmin Yoo 유용민
yzyyzyhhh
Beinsezii
Nick Lafleur
YiChen Lv
meatposes
Bhavik Sharda
Gaurav Garg
Reese Levine
Geramy Loveless
Kakaru
KakaruHayate
Jonathan Clohessy
Niklas Wenzel
Daniel Bevenius
2ca53bb45e
* hexagon: tiling, tracing and optimizations for unary ops (llama/25474) * hexagon: tile wide rows in pointwise unary ops to avoid VTCM overflow * unary: reject permuted tensors for now (not used by models) * hex-unary: replace divs with fastdiv * hex-unary: add vtcm layout and host computed kernel params * hex-unary: move fastdiv init into kernel params * hex-unary: add specialized thread functions to improve generated code * hex-unary: tracing instrumentation for unary ops * hex-unary: factor out hvx kernels, streamline and remove more duplication * ggml-hexagon: fix std::min collision with Windows min macro * hex-cmake: make lto build happy --------- Co-authored-by: Max Krasnyansky <maxk@qti.qualcomm.com> * ggml : process data in smaller chunks in CUDA ggml_top_k() and ggml_argsort() to reduce temporary buffers memory usage (llama/24776) * ggml : process data in smaller chunks in CUDA ggml_top_k() implementation to reduce temporary buffers memory usage * ggml : allocate tmp_dst only only once before the loop * chore : whitespaces Co-authored-by: Georgi Gerganov <ggerganov@gmail.com> * ggml : use chunked processing in both CUDA CUB top-k and argsort implementations * chore : separate argsort_f32_i32_cuda_bitonic() call from return statement Co-authored-by: Johannes Gäßler <johannesg@5d6.de> * chore : replace ternary operators with min/max --------- Co-authored-by: Stanisław Szymczyk <sszymczy@gmail.com> Co-authored-by: Georgi Gerganov <ggerganov@gmail.com> Co-authored-by: Johannes Gäßler <johannesg@5d6.de> * opencl: cluster-parallel decode FA for Adreno (llama/25473) * ggml-et: Initial ET backend (llama/24179) * ggml-et: Add performance logging * ggml-et: Quants helpers * ggml-et: Add MUL_MAT kernel * ggml-et: Add ROPE kernel * ggml-et: Add RMS_NORM kernel * ggml-et: Add GLU kernel * ggml-et: Add SOFT_MAX kernel * ggml-et: Add GET_ROWS kernel * ggml-et: Add CONT kernel * ggml-et: Add SET_ROWS kernel * ggml-et: Add MUL_MAT_ID kernel * ggml-et: Build et kernels as part of ggml * ggml-et: Embed kernels with fs fallback * ggml-et: Build fixes * ggml-et: Add MUL_MAT F32xF32 op * ggml_et: Add MUL_MAT_ID op * ggml-et: Disable offloading for debug * ggml-et: Refactor out block ops * ggml-et: ggml backend API changes * ggml-et: Add RESHAPE/TRANSPOSE to supported * ggml-et: Add CONT_F16 * ggml-et: Add supported ops doc * gglm-et: Initial doc * ggml-et: Remove runtime import hacks We can now import the runtime by a simple find_package(), so we can cleanup the CMakeLists.txt. * ggml-et: Fix GET_ROWS kernel Fix lost batch dimension. Also clean vibe-comments. * ggml-et: Fix SET_ROWS kernel Remove incorrect broadcasting guard. * ggml-et: Use custom instruction for fp32->fp16 * ggml-et: Vectorize set_rows fp32->fp16 * ggml-et: Fix ROPE kernel (yarn) ggml-et: fix et_logf WIP: Fix ramp WIP: fix ROPE! * ggml-et: Better sinf * ggml-et: Fix SOFT_MAX Add `max_bias` and `sink` support. * ggml-et: Fix CONT Reorder from contiguous write to read with atomic stores. * ggml-et: Fix elmap kernel Remainder handlin * ggml-et: Fix MUL_MAT MUL_MAT_ID remainders * ggml-et: Fix ET-SOC reference * ggml-et: Fix embed kernels scripts for old python This allows GGML-ET to build on pre-3.8 python. * Add sysemu support with compile time flag `-DGGML_ET_SYSEMU=ON` (llama/6) * Example using ET-Soc-1 emulator configuration Example usage: ```bash cmake -B build -DGGML_CUDA=OFF -DGGML_ET=ON -DLLAMA_CURL=OFF -DGGML_CCACHE=ON cmake --build build --config Release -j $(nproc) time ./build/bin/test-backend-ops ./build/bin/llama-server \ --model Qwen3-0.6B-Q8_0.gguf \ --alias Qwen3-0.6B-Q8_0 \ -fa 0 \ --ctx-size 1024 \ --no-warmup \ --host 127.0.0.1 \ --port 8080 ``` * build: proper dep tracking for kernels * support host using MOLD linker * initial multi core GET_ROW F32 implementation * vectorized q8 dequant * wip: cland warning clenaups and initial logging refactor * wip: message default message cleanup * chore: message cleanups * cmake cleanup * migrate to use platform provided functions * cmake back into subdir * support et_print() in kernels * fix: repair kernel building * perf: operations run async by default * debug: proper kernel dep tracking and error detection on kenrel launch * fix: kernel binary dep tracking and fixing get_rows_f32 erroring * perf: back to doing async kernel runs by default * perf: vectorize and parallel device memset * merge matmul work * misc: align allocation and enable all offload * misc: delete deadcode and respect memory limits * fix: repair tensor debug print * fix: loosen RMS_NORM op percision * feat: Q4_0 GET_ROWS * perf: FP32 MUL_MAT using TensorFMA * update limitations * perf: redue L1 load in compute_block_dot_product_q8_0 * feat: save kernel mapping (name to id) when profiling is enabled * chore: memops cleanup * perf: parallelize softmax by rows * perf: vectorize 2nd phase of softmax * perf: ban GET_ROWS from offloaded * perf: vectorize and non-atomic for eltwise ops and sub support * perf: vectorize normal rope * perf: glu runs in parallel * merge: manually merge saqib's work on kernel fixes * perf: more vectorized RoPE * perf: parallelize mul_mat_id * perf: parallelize set_rows_f32 * perf: vectorize softmax * feat: support kernel fusion and fuse RMS_NORM + MUL * fix: mostly resolve test-backend-ops failure in SOFT_MAX and ROPE * fix: bump max rope dims for gemma * feat: GeGLU and SCALE support to fully offload Gemma * perf: faster device memset * feat: get_rows supporting Q4_K and avoid cont cache coherent issues * better F32 MM * feat: NORM for ET backend * feat: SQR for ET backend * feat: UNARY on ET * feat: el_map support broadcasting for ET * feat: SUM_ROWS in ET backend * feat: more ops in ET backend * feat: WKV* operators in ET backend * perf: parallelize operators across cacheline instead of row * perf: parallelize get_rows on cacheline * wip: baseline FlashAttention for ET backend * wip: enough FA and CPY f32->f16 to run llama 3.1 fully offloaded with FA on * feat: f16 x f16 -> f32 MM using matrix engine * wip: f16 FlashAttention using matrix engine * wip: clean up * feat: barriers * perf: optimize FA_F16 in ET * perf: vectorize pack_k_for_transpose16 * perf: prefetch next loop matrix tile * perf: FlashAttention 2nd MM uses TensorFMA and optimizations * cleanup: flashattention reorg * perf: optimizations and fixes * feat: L2SCP API and make FlashAttention support DV = 256 for gemma * perf: parallelize norms beyond single row * feat: GATED_DELTA_NET support and relaxed L2_NORM requirment * feat: loosen RMS_NORM, NORM, ROPE contingous req too * feat: repeat supports brocasting on dim 0 and loosen cont check * feat: FILL and DIAG operator * feat: loosen UNARY support chcek * feat: TRI support * feat: SOLVE_TRI support * feat: basic SET support * feat: loosen CONT req * perf: fp16_to_fp32 use ASM * feat: IMROPE support * feat: PAD support * feat: global barrier * fix: view must live on the same backend as backing tensor * feat: relax CONCAT in ET backend * feat: dead simple CUMSUM implementation * feat: basic SSM_CONV support * feat: loosen CONCAT req * feat: relax GATED_DELTA_NET and add SET support proper * cleanup: cleanup LCM math * feat: SWIGLU single input * feat: SSM_SCAN support * feat: el_map supports non aligned tensors in best effort * feat: basic GROUP_NORM support * feat: loosen MUL_MAT capablities slightly * feat: loosen MUL_MAT and GET_ROWS and add IM2COL * feat: special case for softmax 1x1x1x1 * feat: loosen SOFT_MAX req in ET backend * fix: el_map unaligned acse fixes * perf: optimize zero_acc_vec in flash_attn_ext_f16_me * perf: use hart 1 for packing in MM and FA for FP16 * feat: kernel semaphore * perf: better instruction sequence in FlashAttention * fix: gated_delta_net with proper masking * perf: better parallelization for GATED_DELTA_NET * perf: parallelize SSM_CONV over nr * perf: vectorize SSM_CONV * perf: optimize MUL_MAT for q8 * feat: support Gemma 4 * fix: support multi-device * feat: broader GLU support * feat: unary ops supports view * fix: repair fp16 MM using matrix engine * perf: handle large N GEMV better * perf: better q8_0 MM * perf: better set_rows * add back deleted files * fix: repair after merge * feat: POC version of uberkernel * feat: RMS_NORM in uberkernel * feat: add more kernels into usage * chore: clean up uberkernel compilation * perf: faster flash attention * perf: opt flash attention for large seq length * feat: loosen op bounds. clamp and mean support * perf: vectorize ssm_scan * perf: slightly faster FA * perf: FlashAttention parallel MM and load * perf: fuse Q8 MM and ADD * feat: basic conv kernel for ET * softMAx_test * set_rows_f32 * get_rows and cont * testing * set_rows_exp * Junk addition * Narrowing the issue * Update flash_attn_ext_f16_me.c Focusing FA_ext_f16_me * test * Eviction updated * Detailed cache eviction debug * mulmat * removeal of `BUILD_FOR_UBERKERNEL` flag * cleaning... * fix: balance FCC0 count * feat: implement mul_mat and mul_mat_id for Q4_0 type * optimize uberkernel plan upload * add mul_mat q4 into uberkernel * enable gating flush to just uberkernel * update docs for ET * update op support for ET * et-backend: optimize Q4_0 and Q8_0 mul_mat_id row accumulations * et-backend: specialize mul_mat_id kernels for Q4_0 and Q8_0 * et-backend: fix RoPE YaRN corr_dim formula and handle degenerate inputs * test-backend-ops: add DeepSeek-V2-Lite RoPE test coverage * et-backend: add Q4_0 mul_mat matrix-engine kernel using TensorFMA32 * et-backend: vectorize Q4_0 matrix-engine dequantization * et-backend: support hybrid matrix/vector engine execution for Q4_0 mul_mat tail * et-backend: run partial-N tiles on matrix engine for Q4_0 mul_mat * et-backend: route Q4_0 mul_mat N < 53 to vecdot for better prefill latency * Update uberkernel.c * Update unary_f32.c * gemma 4 * bisect gemma4: enable scale_f32 only * bisect gemma4: +rms_norm_f32 * bisect gemma4: +rms_norm_mul_f32 * bisect gemma4: disable rms_norm_mul_f32 -- BREAKS OUTPUT * bisect gemma4: +rope_f32 (skip rms_norm_mul) * bisect gemma4: +el_map_f32 * bisect gemma4: +softmax_f32 * bisect gemma4: +get_rows_f32 * bisect gemma4: +glu_f32 * bisect gemma4: +mul_mat_f32 +mul_mat_f32_matrix_engine * bisect gemma4: +mul_mat_f16 +mul_mat_f16_matrix_engine * bisect gemma4: +mul_mat_Q8_0 +mul_mat_Q4_0 * bisect gemma4: +flash_attn_ext_f32 +flash_attn_ext_f16_me * bisect gemma4: +mul_mat_id_f32 * bisect gemma4: +sum_rows_f32 * bisect gemma4: +cont_f16 * bisect gemma4: +fill_f32 * bisect gemma4: +unary_f32 (all ops re-enabled except rms_norm_mul) * Update rms_norm_mul_f32.c * bisect2 gemma4 n64: +scale_f32 only * bisect2 gemma4 n64: +rms_norm_f32 +rope_f32 * bisect2 gemma4 n64: +rms_norm_mul_f32 (with ET_UBERKERNEL eviction fix) * bisect2 gemma4 n64: +el_map +get_rows +glu +softmax (skip rms_norm_mul) * bisect2 gemma4 n64: all ops enabled except rms_norm_mul * bisect2 n64: test unary+cont+fill+sum_rows (no mul_mat/flash_attn) * bisect2 n64: +mul_mat_f32 +mul_mat_f32_matrix_engine * bisect2 n64: +mul_mat_f16 +mul_mat_f16_matrix_engine * bisect2 n64: +mul_mat_Q8_0 +mul_mat_Q4_0 * bisect2 n64: +mul_mat_Q8_0 only (disable Q4_0) * bisect2 n64: +mul_mat_Q4_0 only (Q8_0 breaks) * bisect2 n64: +mul_mat_id +flash_attn_ext (skip Q8_0) * run-3: matmul + rms_norm_mul * run-4 * Revert "run-4" * run5 * changes after cleanup * cleanup before upstream * restrict changes into ET backend * move kernel embedding from Python to CMake * move uberkernel gen into CMake * apply clang format * update CMake style * update to match C and C++ style * use source ggml and quant headers instead of ET's * MROPE support * absorb view ops into same branch as none * fix bad rebase * add marty1885 to codeowners * oops * remove redundant newline * fix CI editor warnings --------- Co-authored-by: Vidas <vidas@nuolat.lt> Co-authored-by: Gianluca Guida <glguida@tlbflush.org> Co-authored-by: Gianluca Guida <gianluca@nekko.ai> Co-authored-by: ubergarm <leimgrub@gmail.com> Co-authored-by: SaqibAkram-10xE <saqib.akram@10xengineers.ai> Co-authored-by: Rehan Qasim <rehan.qasim@10xengineers.ai> * hexagon: improve ARGSORT performance for small tensors (llama/25512) * hex-sort: add efficient bitomic sort in hvx regs up to 1024 elements * hex-sort: fix inverted vrors * hex-sort: specialize sort functions for the common cases * hex-sort: add tracing and local context * opencl: add int8 dp4 dense and MoE prefill optimization for Adreno GPUs (llama/25537) * opencl: add int8 dp4 dense and moe GEMM * opencl: refactor --------- Co-authored-by: Li He <lih@qti.qualcomm.com> * Vulkan: route large matmuls to medium tile on Adreno (llama/24877) * [Vulkan] Fixes llama-cli breaking over longer promts sizes The llama-cli was breaking for longer promts sizes for q4_0 quantized networks. Causing due to insufficient shared memory. * Removed the un-used Adreno device * Updated matmul for small pipeline. * ggml : add GGML_OP_LIGHTNING_INDEXER that implements DeepSeek V3.2/V4 lightning indexer (llama/24231) * ggml : add GGML_OP_LIGHTNING_INDEXER that implements DeepSeek V3.2/V4 lightning indexer * ggml : remove scale parameters from lightning indexer OP, add f16 mask parameter * tests : add GGML_OP_LIGHTNING_INDEXER tests * ggml : bump RPC version * chore : check if lightning indexer input tensors are not transposed * tests : count flops instead of bandwidth in lightning indexer test * chore : add missing const * chore : whitespace * ggml : renamed variables in CPU lightning indexer implementation * ggml : fix lightning indexer mask broadcasting * tests : tests for lightning indexer mask broadcasting * chore : whitespace * llama : use GGML_OP_LIGHTNING_INDEXER in DeepSeek V3.2 and DeepSeek V4 models --------- Co-authored-by: Stanisław Szymczyk <sszymczy@gmail.com> * cuda: Don't crash when querying memory on device with no free memory. (llama/25157) If a Cuda device has no or limited available memory, the actual call to cudaMemGetInfo() itself can cause a fatal crash due to a cuda out of memory error (there is not enough memory to actually query memory) This causes an issue because we query memory for all devices at startup even if the user isn't trying to use the device for inference. Fix this by making the error non-fatal and assigning zero total/free memory to the device. This will have the downstream effect of the fit algorithm not trying to put any layers on it, which is desired outcome vs hard crashing. this also prevents crashes in cuda enabled builds when user explicitly passes '-dev none' * gguf : reject empty metadata keys (llama/24917) * sycl: add Q2_K to DMMV reorder path (llama/25064) Signed-off-by: Todd Malsbary <todd.malsbary@intel.com> * sycl: add fused top-k MoE (llama/25217) * sycl: add fused top-k MoE * sycl: address review: GGML_SYCL_ENABLE_FUSION env, move fusion dispatch to topk-moe * sycl: print GGML_SYCL_ENABLE_FUSION at startup like other env vars Co-Authored-By: Claude Fable 5 <noreply@anthropic.com> --------- Co-authored-by: Claude Fable 5 <noreply@anthropic.com> * gguf : add tensor shape accessor (llama/24405) * gguf : add tensor shape accessors * gguf : return tensor shape as const int64_t * * gguf : remove n_dims accessor, keep only gguf_get_tensor_ne * vulkan: Use native e2m1 and e4m3 conversions for mxfp4/nvfp4 (llama/25338) This uses the new VK_EXT_shader_ocp_microscaling_types extension to do fp4 type promotions, and also uses the float8 extension to do ue4m3 promotions for nvfp4. It's reasonable to assume that an implementation that supports fp4 will also support fp8, so we don't need to handle all possible combinations of support. * CUDA: refactor MMQ kernel configuration (llama/24127) * CUDA: refactor MMQ kernel configuration * fix Blackwell config * remove legacy code * metal : add Q2_0 support (llama/25419) * sycl: set fattn_vec_nthreads to 256 for Battlemage (llama/25205) Currently detects lunarlake + battlemage / xe2 and sets the value to 256. Keeps default at 128, Intel's ARC Alchemist's prefered value. * kleidiai : add SME2 f32 kernel (llama/24414) * kleidiai : add SME2 f32 kernel * enable dynamic scheduling for SME2 f32 kernel * ggml: uniformize im2col dst_type for all conv ops (llama/23660) * ggml: uniformize im2col dst_type for all conv ops * Update ggml/src/ggml.c Co-authored-by: Georgi Gerganov <ggerganov@gmail.com> * ggml : uniformize im2col casting logic across all conv ops * fix : allow im2col_f16 to accept any kernel type --------- Co-authored-by: Georgi Gerganov <ggerganov@gmail.com> * ggml : add a set of functions for checking contiguity of inner tensor dimensions (llama/25650) Co-authored-by: Stanisław Szymczyk <sszymczy@gmail.com> * vulkan/cpu: Support f16 as SET_ROWS src. (llama/25432) * vulkan/cpu: Support f16 as SET_ROWS src. This adds full support for f16 SET_ROWS (equivalent to f32) to vulkan and CPU backends, and adds more backend tests. * Set DenormPreserve 16 when supported, to try to fix failures on Intel * tune error threshold * update metal supports_op * opencl: fix a dp4a bug for devices where cl_khr_integer_dot_product is unavailable (llama/25639) * opencl: do not fail backend init on devices without cl_khr_integer_dot_product * opencl: do not call dp4 kernels when dp is unavailable --------- Co-authored-by: Li He <lih@qti.qualcomm.com> * hexagon: fix hmx-queue signal enum-narrowing problem (llama/25677) * opencl: avoid the vec path in GEMV for unaligned row stride (llama/25671) The f16 GEMV kernels take a vectorized path for ne00 >= 128 that casts the row pointers to half4 or float4. When the row stride is not aligned, the wide load becomes misaligned. On devices that require natural alignment for vector loads, the kernel reads garbage. This is the case Intel GPUs and the kernels produce incorrect results there. Adreno happpens to be byte addressable and the kernels happen to work. * opencl: handle OOB write in noshuffle GEMV kernels (odd ne01) (llama/25640) * opencl: do not use `clCreateBufferWithProperties` when targeting CL 2.x (llama/25673) * Flash Attention with XMX engine via oneDNN (llama/25222) * [SYCL] F16 (default) Flash Attention with XMX engine via oneDNN graph API; Qwen3.6-27b-Q8_0 prefill speed up x1.21 at p=512 and x4.26 at p=80k * [SYCL] Address review on FA oneDNN path. Result: llama-bench---pp512; 32% increase with fa1; llama-perplexity---0.11% difference; tested model: mradermacher/Meta-Llama-3.1-8B-Instruct-Q8_0.gguf * PR-25222 revision v2: addressed audits * [SYCL] flash-attn oneDNN SDPA KV F16 rev 3.0: add BMG gate + multi-device sync. Narrow the scrope of this PR to Battlemage only (bmg; Xe2). Other archs (e.g., alchemist) fall back to existing FA kernel. When device_count >1, apply stream -> wait_and_throw(), validated working path for multi-gpu sync fix by @maxious. Co-authored-by: maxious <81432+maxious@users.noreply.github.com> * updated comment on bmg gate, noted the issue --------- Co-authored-by: scientist3 <scientist.3@users.noreply.github.com> Co-authored-by: hmscider <hmscider@users.noreply.github.com> Co-authored-by: maxious <81432+maxious@users.noreply.github.com> * sycl: Increase minimum buffer size for USM system allocations (llama/25525) Raise the threshold for minimum buffer size from 1 GiB to 4 GiB, based on real-world experiments of overcommitting device memory with model weights larger than available VRAM, for example Qwen3.5-35B-A3B-Q8 running on a B70. Also add a debug message to better track USM system allocations. Signed-off-by: Francois Dugast <francois.dugast@intel.com> * sycl : implement xielu op (llama/25550) * sycl : support kernel type fp16 for conv2d_dw (llama/25653) * sycl : fix get_rows Q2_K, Q4_K, Q5_K (llama/25656) * ggml: add f16 out_prod support for CPU and out_prod op for Vulkan (llama/23997) * metal: fuse snake activation (mul, sin, sqr, mul, add) (llama/25459) * metal: fuse snake activation (mul, sin, sqr, mul, add) Mirror the CUDA, Vulkan and CPU snake fusion: same matcher on the naive 5-op chain, same F32 contract on a and inv_b, same F32/F16/BF16 kernel with F32 compute. Follows the Metal backend idioms: bf16 instantiation gated behind GGML_METAL_HAS_BF16 and concurrency ranges checked on the remaining chain nodes before encoding, as done by the bin fusion. Covered by the existing backend-agnostic SNAKE_FUSE tests. * metal: absorb snake fusion into ggml_metal_op_bin Extract the matcher to ggml_metal_op_can_fuse_snake, mirroring the Vulkan naming, and dispatch the fused path from ggml_metal_op_bin. The encode loop switch is back to a single call per case. Address review from ggerganov * metal: fix indentation in ggml_metal_op_can_fuse_snake * cuda : relax tensor contiguity requirements for quantized concat (llama/25678) * cuda : relax tensor contiguity requirements for quantized concat * tests : add test cases for non-contiguous quantized concat * ggml : relax contiguity requirements for quantized concat --------- Co-authored-by: Stanisław Szymczyk <sszymczy@gmail.com> * CUDA: tighter MMQ src1 buffer size for native fp4 (llama/25613) * opencl: fix two issues on flash attention for Adreno a7x (llama/25697) * opencl: route `sub_group_shuffle_xor` to qcom ext when KHR ext is unavailable KHR `sub_group_shuffle_xor` is not defined by compiler when `cl_qcom_subgroup_shuffle` is present, causing certain FA kernels fail to build. Define the KHR shuffle_xor using the qcom extension. * opencl: skip FA kernels with mixed and quant types for A7x to avoid compiler crash * cuda : CUDA GGML_OP_LIGHTNING_INDEXER implementation (generic vector kernel + wmma kernel) (llama/25545) * cuda : CUDA GGML_OP_LIGHTNING_INDEXER implementation (generic vector kernel + wmma kernel) * chore : remove indentation of #pragma unroll * cuda : remove unnecessary kernel template declarations * cuda : add WARPS_PER_BLOCK and K_VECS_PER_BLOCK template parameters in lightning indexer kernels to avoid duplication of constants. * cuda : relax MMA architecture requirements to Turing in lightning indexer implementation * chore : renamed variables * chore : rename ggml_cuda_op_lightning_indexer() to ggml_cuda_lightning_indexer() * chore : TODO for AMD rocWMMA * chore : whitespace formatting * chore : another variable rename to fix problems caused by shadowing * chore : yet another rename, this time uppercased all constants * cuda : added alignment checks for Q and K tensors in lightning indexer implementation --------- Co-authored-by: Stanisław Szymczyk <sszymczy@gmail.com> * opencl: exclude some moe kernels on Adreno a7x (llama/25698) * opencl: exclude Adreno A7x from using Adreno MoE kernels Some compilers for A7x devices miscompile the repack kernels, corrupting the weights and causing MoE models to generate garbage output * opencl: exclude A6x and unknown Adreno from MoE weights repack * cuda: extract Q1_0 elements via __byte_perm (llama/25628) * opencl: disable FA and MoE weights repack to work around compiler issues for Adreno 850 GPU (llama/25745) * opencl: workaround for A850 compiler compat * opencl: fix DX compiler version parsing and cleanup --------- Co-authored-by: Li He <lih@qti.qualcomm.com> * CUDA: dedup MoE gate/up activation quantization (llama/25441) * CUDA: dedup MoE gate/up activation quantization (fp4) For MoE gate/up projections the src1 activation is broadcast across the routed experts (ne11 == 1), so ids_src1 maps every one of a token's n_expert_used slots to the same physical row. The MMQ path therefore re-quantized each token's activation n_expert_used times. For fp4 (NVFP4/MXFP4) src0, quantize each unique token row once instead of once per expert. For NVFP4 a single quantize+scatter kernel (quantize_scatter_mmq_nvfp4) quantizes each token once and writes the resulting block_fp4_mmq straight to all n_expert_used slots, using an inverse token->compact-row map (build_tok2c). MXFP4, and GGML_CUDA_MOE_QUANT_GATHER=1, use a two-kernel variant: quantize unique rows then gather into the expert-sorted layout (gather_mmq_fp4_blocks). Both are bit-identical to the previous gather-then-quantize path (identical source data, deterministic per-block quantization), verified by test-backend-ops MUL_MAT_ID (type_a=nvfp4, broadcast b=1; 790/790 for the default, gather, and per-expert paths) and by coherent end-to-end generation. Set GGML_CUDA_NO_MOE_QUANT_DEDUP=1 to force the original per-expert path. Same-binary A/B on RTX 5090 (sm_120), Qwen3.6-35B-A3B-NVFP4 prefill @8192 (nsys, graphs-off; the unchanged mul_mat_q GEMM confirms stable clocks): activation-quant GPU-busy drops 61% (78.2 -> 30.4 ms) with the fused quantize+scatter, vs 33% (78.2 -> 52.8 ms) for the two-kernel gather. The fused path avoids materializing and re-reading the 8x compact buffer, writing the expert copies directly from registers. * CUDA: bounds-check token ids in build_tok2c_kernel Guard against malformed ids_src1: skip out-of-range token ids (t < 0 or t >= n_tokens) and drop entries beyond n_expert_used per token instead of writing past the token's tok2c region. No behavior change for valid MoE routing data; test-backend-ops MUL_MAT_ID 790/790. * Refactor the code based on review comments - Removed previously added kernels that were not necessary anymore\ - Added an inverse mapping from (token, slot) to compact row. Each token is quantized once and scattered to its compact rows. * Adding q8_1 support for dedup and addressing review comments * Add pragma unrolls * Remove redundant cudaMemsetAsync call * Removing follow up redundancies --------- Co-authored-by: praneshgo <227579474+praneshgo@users.noreply.github.com> * ggml-cuda : restore prop.integrated on HIP builds (llama/24233) PR #16308 set info.devices[id].integrated = false unconditionally for all CUDA/HIP devices as a workaround for corrupted output on Jetson Orin (#15034). On HIP/ROCm the device's real hipDeviceProp_t.integrated flag is needed: with the cached field forced to false, supports_buft() refuses CUDA host buffers on AMD APU/UMA parts, while get_type() already reads prop.integrated (#23007) — an inconsistency that breaks integrated-GPU host-buffer use on ROCm. Guard the workaround so it only applies to non-HIP (CUDA) builds and restore prop.integrated for HIP, keeping the Jetson workaround intact for CUDA. Fixes #23977 Signed-off-by: liminfei-amd <91481003+liminfei-amd@users.noreply.github.com> * Enable CUDA graphs on volta+turing (llama/25749) * CUDA: Support CUDA Virtual Devices (llama/25228) * support cuda virtual devices * disable NCCL path when virtual devices are used * label virtual devices in description; add GPUx2 server CI jobs * code refactor * vulkan: when using transfer queue for async copies, sync on event_wait to avoid race (llama/25229) * kleidiai: Add SME vs SME2 distinction in kernel dispatch (llama/25478) The current integration treats SME as a single capability (CPU_FEATURE_SME) with no distinction between SME(v1) and SME2. The kernels dispatched under CPU_FEATURE_SME use SME2-specific instructions, making dispatch incorrect on SME(v1)-only hardware. We introduce build-time and runtime distinction between SME and SME2, and wire SME(v1) and SME2 kernels based on actual hardware support. * hexagon: L2 cache handling rework (dirty bit tracking with lazy flushing) and more MUL_MAT updates (llama/25762) * hex-mm: fix artificial limit in the solver that restricted number of act-prep threads * hex-mm: fix warning * hex-prof: do not apply --top to the timeline report * hmx-mm: add suport for tiled act-processing to better distribute hvx work * hex-l2: add tracing for l2flush events * workqueue: redo the legacy workpool api to match hmx-queue and dma-queue * hmx-mm: fix f32 activation buffer alignmnet for nhvx=5,6,7 * hex-work: minor cleanup for work-queue apis * hex-work: further cleanup of the work-queue api * hex-l2: optimize l2flushes at the opbatch level * hex-work: remove unused mask * hex-work: no need to drop hvx ctx in the work-queue * hex-work: add explicit wakeup/suspend and make threads spin * hex-bufs: mark any non-weight tensor as compute * hex-dma: dma-queue support for alias queues and cached dma * hex-l2: track tensor aliases and delay or skip flushes as much as possible * hex-l2: simplify tensor alias handling * hex-l2: handle overlapping views as a circular list of aliases * hex-tens: add flags helper * hex-l2: add helper for marking tensors clearn/dirty * hex-l2: mark binary and rope outputs as l2-clean and keep the rest as is for now * hex-l2: proper support for handling all tensor overlap scenarios * hex-trace: instrument matmul init code and cleanup trace checks * hex-thread: introduce dedicated main thread with explicit stack and priority * hex-l2: track dirty state as bitmap and introduce threaded flush * hex-trace: remove redundant checks for ctx != null * hex-l2: allocate entire context as one buffer and l2fetch it after big flushes * hex-l2: disable tensor clearing in binary and rope for now seems to cause issues with fusion * hmx-mm: update act proc to use fastdivs and fix DMA overflow * hmx-mm: make MUL_MAT_ID kernels robust to multi-chunk cases (start_row>0) * hex-queue: remove obsolete queue interfaces and flush hmx-queue at the end of the op-batch * hex-queue: dont use early wakeup for small op-batches * hex-tensors: properly cap max_tensors in op-batches and dirty_map * hex-l2: make sure threaded l2flush does proper rounding * hex-l2: factor out htp_tensor_flush for reuse (if needed) * hex-l2: optimize tensor flushes by coalescing flush-all * hex-l2: optimize multi-threaded flush * hex-drv: futureproof version checks * hexagon: fix errors and warnings on windows * hex-main: update main thread to only use dspqueue_read, dspqueue_peek is not available on some platforms * hex-main: add fallback mode for dspqueue with callbacks * hex-main: introduce fallback mode for using dspqueue callbacks for full op processing * hex-main: remove early wakeup, not helping and seems to cause some errors with certain batch sizes * hex-l2: make sure to use invalidate version of flushall * hex-l2: dont try to trace early l2flush at the start of op-batch * hex-main: remove offset_ctx that must be zero anyway * hex-hmx: fix hmx_queue_depth to use idx_write - idx_read * hex-hmx: use atomic_load for idx_read/write * hex-main: add static assert to make sure n_threads are aligned * DeepseekV4: Add fused hyper-connection ops (llama/25585) * dsv4 hc-ops * add missing files; * add cparams * update rpc version * address review comments * address review comments * docs: added a note about using OpenCl with Adreno 810 (llama/25786) * opencl: loads quants as uint for q4_K and q5_K flat mv (optimization for Adreno A7x GPUs) (llama/25780) * opencl: load quant as uint in mv_q4_k_f32_flat helps older compilers (e.g., E031.41, boosts 2x), no impact on newer compilers (e.g., E031.45 or newer) * opencl: load quant as uint in mv_q5_K_f32_flat helps older compilers (e.g., E031.41) * opencl: format --------- Co-authored-by: Li He <lih@qti.qualcomm.com> * opencl: add ABS op (llama/25115) * sycl: fix row calculation when K_QUANTS_PER_ITERATION is 1 (llama/25690) * sycl: fix incorrect row calculation when K_QUANTS_PER_ITERATION=1 Signed-off-by: Todd Malsbary <todd.malsbary@intel.com> * sycl: use K_QUANTS_PER_ITERATION for non-reordered Q5_K kernel This is the only Q5_K kernel that was not using KQPI. Signed-off-by: Todd Malsbary <todd.malsbary@intel.com> * sycl: add missing second half processing to reordered q5_k Error found while running GGML_SYCL_PRIORITIZE_DMMV=1 \ build/bin/test-backend-ops test -o MUL_MAT Signed-off-by: Todd Malsbary <todd.malsbary@intel.com> * sycl: fix potential off-by-one error Signed-off-by: Todd Malsbary <todd.malsbary@intel.com> * sycl: fix missing row > nrows check Signed-off-by: Todd Malsbary <todd.malsbary@intel.com> --------- Signed-off-by: Todd Malsbary <todd.malsbary@intel.com> * vulkan: Support Q2_0 (llama/25430) * vulkan: Support Q2_0 The backend perf tests for mat-vec-mul weren't very good at first (worse than q2_k), doubling the rows per workgroup made a big difference. * reorder * resolve merge conflict, adjust err threshold for f16->q2_0 set_rows * ggml-blas: default hadamard mul_mat to cpu routine (llama/25710) Signed-off-by: Aaron Teo <aaron.teo1@ibm.com> * ggml : bump version to 0.17.0 (ggml/1568) * opencl: transpose q4_K noshuffle scales for coalesced reads (llama/25805) * opencl: read/write MoE dp4a activation tiles to local memory as 128-bit (vectorized LD/ST perf opt) for Adreno GPUs (llama/25810) * opencl: read MoE dp4a activation tile as 128-bit local loads * opencl: vectorize MoE dp4a activation staging as 128-bit loads * opencl: load and use `kernel_gemm_moe_q6_k_f32_ns` from bin kernel lib (llama/25797) * opencl: Support broadcast for Adreno MUL_MAT and honor `view_offs` for Adreno Q8_0 MUL_MAT for llama-server multi-stream (llama/25910) * opencl: handle broadcast for adreno gemm/gemv_noshuffle * opencl: honor view_offs for adreno noshuffle gemm/gemv * opencl: general GEMM/GEMV support broadcast * opencl: remove unnecessary tests * opencl: remove unnecessary comments --------- Co-authored-by: Li He <lih@qti.qualcomm.com> * hexagon: add CLAMP op (llama/25934) * CUDA: vectorize same-type get_rows with int4 copy (llama/25929) k_get_rows_float did a scalar one-element-per-thread copy and recomputed the row-invariant work (index load, fast_div_modulo, src/dst row pointers) for every element. Hoist that out of the per-element loop, and add a vectorized path (k_get_rows_float_vec) that copies one int4 (16 B) per thread for the contiguous same-type (no-cast) case. The vectorized path is gated at compile time (is_same<src0_t, dst_t>) and at runtime on 16-byte alignment of the base pointers and all row strides and on ne00 % VEC == 0. Vectorizing divides the block count by VEC, so a small single-row gather can drop below the device CU count and regress; an occupancy gate keeps those on the block-rich scalar path. On Strix Halo (gfx1151) the DeltaNet recurrent-state gather (ne00=524288) drops 18.6us -> 13.0us (rocprofv3 HW timestamps), faster than the Vulkan backend, with no regression on the small conv-state gather; total get_rows -27%. test-backend-ops GET_ROWS passes (47/47). Assisted-by: Claude Opus 4.8 * ggml-openvino: Add GGML_BACKEND_DL_IMPL invocation for OpenVINO backend (llama/25795) This adds the missing `GGML_BACKEND_DL_IMPL()` macro invocation, that other backends have. Fixes #25586 for me * vulkan: Refactor vk_queue to use per-instance mutexes and unique handles (llama/23570) * Refactor vk_queue to use per-instance mutexes and unique handles * integrates VK_KHR_internally_synchronized_queues, abstracting the queue submission into a polymorphic interface that completely bypasses host-side mutex locking when driver-side synchronization is supported * fix compilation error * fix duplicate pNext chain for VkPhysicalDeviceInternallySynchronizedQueuesFeaturesKHR * add fallback defines for VK_KHR_internally_synchronized_queues * add null checks for queues in vk_device_struct destructor * use unique_ptr for outer queues to enforce exclusive ownership and optimize lifetime * use static constexpr for eInternallySynchronizedKHR * add lock guard to ggml_vk_create_aliased_queue for thread safety * initialize sync_query_features.internallySynchronizedQueues to VK_FALSE * reuse sync_query_features for internallySynchronizedQueues and simplify chaining * refactor internallySynchronizedQueues detection * fix internallySynchronizedQueues query guard * use eInternallySynchronizedKHR constant * fix self-referential alias for eInternallySynchronizedKHR * use macro for eInternallySynchronizedKHR fallback * fix internallySynchronizedQueues query timing in ggml-vulkan.cpp to prevent device creation mismatch * reset sync_query_features.pNext before reusing in device creation chain, also removed the redundant second probe call * refactor internally synchronized queues detection to use chained feature query and avoid redundant API calls * Update ggml/src/ggml-vulkan/ggml-vulkan.cpp Co-authored-by: Jeff Bolz <jbolz@nvidia.com> * Update ggml/src/ggml-vulkan/ggml-vulkan.cpp Co-authored-by: Jeff Bolz <jbolz@nvidia.com> * Update ggml/src/ggml-vulkan/ggml-vulkan.cpp Co-authored-by: Jeff Bolz <jbolz@nvidia.com> * Update ggml/src/ggml-vulkan/ggml-vulkan.cpp Co-authored-by: Jeff Bolz <jbolz@nvidia.com> * Update ggml/src/ggml-vulkan/ggml-vulkan.cpp Co-authored-by: Jeff Bolz <jbolz@nvidia.com> * Update ggml/src/ggml-vulkan/ggml-vulkan.cpp Co-authored-by: Jeff Bolz <jbolz@nvidia.com> * rename sync_enable_features to internally_synchronized_queues_features * queue_flags is still computed before has_internally_synchronized_queues is set * fix trailing whitespace * replace eInternallySynchronizedKHR macro with static constexpr * preserve source queue semantics in single-queue aliased transfer queue * vulkan: fix cmd_pool access via pointer for compute_queue unique_ptr * vulkan: lock queue during debug label emission when not internally synchronized --------- Co-authored-by: Jeff Bolz <jbolz@nvidia.com> * kleidiai : warn once when a weight type has no KleidiAI kernel (llama/25701) * cuda: add sqrt_softplus in topk-moe for dsv4 (llama/25896) * hexagon: check tensor type when reusing descriptors (llama/25968) * cuda: GET_ROWS quants (llama/25962) * cuda: add k-quant support to GET_ROWS Device-side embedding lookups require GET_ROWS to handle the k-quants used by common GGUF recipes (Q4_K_M stores token_embd as q6_K). Without it the backend rejects the op and the scheduler falls back to the host, copying the full embedding matrix back on every token in single-device graphs. Factor the super-block dequantizers out of the dequantize_block kernels in convert.cu into shared device functions in dequantize.cuh and reuse them from a new k_get_rows_kq kernel : one thread block dequantizes one (dst row, super-block) pair with the existing thread layouts, 32 threads for q4_K and 64 for the other k-quants. Covers q2_K to q6_K in get_rows_cuda and supports_op. i-quants are left as a TODO. * cuda: add i-quant support to GET_ROWS Extends the shared super-block dequantizers to the nine i-quants and reuses them from k_get_rows_kq with the 32-thread layout of the matching convert.cu kernels. supports_op gates the k-quant and i-quant path on ne0 being a multiple of QK_K, which iq4_nl does not guarantee on its own (QK4_NL sub-blocks). mxfp4 is left as a TODO. * cuda: add mxfp4 support to GET_ROWS Moves the mxfp4 dequantizer into the shared super-block helpers and reuses it from k_get_rows_kq with the 32-thread layout of the matching convert.cu kernel. mxfp4 joins the ne0 % QK_K gate in supports_op since its 32-value sub-blocks do not guarantee QK_K-aligned rows on their own. This closes GET_ROWS type coverage on CUDA: every quantized GGML type now takes the direct device path. * cuda: gate the GET_ROWS row size only for 32-value sub-block types Address review from @pwilkin: the i-quant commit replaced the return shared by the whole supported type cascade, so f16/f32/bf16/i32 and the legacy quants also inherited the ne0 % QK_K == 0 gate and any row size that is not a multiple of 256 fell back to the scheduler. Split the cascade: unconditional support is restored everywhere, the gate stays only on iq4_nl and mxfp4 whose 32-value sub-blocks do not guarantee the QK_K super-blocks the kernel iterates on. * webgpu : add CONV_2D_DW (depthwise conv2d) kernel (llama/25847) * webgpu : add CONV_2D_DW (depthwise conv2d) kernel Implement GGML_OP_CONV_2D_DW for the WebGPU backend, ported from the Vulkan backend's conv2d_dw.comp. Assisted-by: Claude Opus-4.8 * Remove unnecessary comments in webgpu support * update supported ops tables, triggered by adding webgpu CONV_2D_DW * ggml: enable PowerPC backend variants on AIX (llama/25983) * ggml: enable PowerPC backend variants on AIX Allow the PowerPC CPU backend variants to be built on AIX by extending the platform check in the CMake configuration. This reuses the existing PowerPC backend implementations without changing their behavior. Also fix a missing semicolon in the PowerPC Q0 matmul implementation. * Fix missing semicolon in sgemm.cpp * hexagon: activation ops update (llama/25974) * hex-geglu: optimized all-in-one geglu microkernel * hex-geglu: enable non-contiguous src and strided DMA * hex-act: enable non-contiguous srs and strided DMA for rest of ACT ops * hex-act: generalize GLU per-thread functions via DEFINE_GLU_PER_THREAD macro * hexagon: move UNARY_SILU and UNARY_GELU to unary-ops * hex-act: replace the generic ops_context scratchpad usage with a local htp_vtcm_layout computation per act op. --------- Co-authored-by: Max Krasnyansky <maxk@qti.qualcomm.com> * CUDA: Improve NVFP4 W4A4 activation quantization (llama/25730) * Squash history before conflict-resolution during rebase on master WIP commit Add 32-byte loads, restore per-block amax Use nvfp4x4 intrinsic when available Fuse per-channel amax and quantization kernels Do pointer arithmetic only once on x Remove unnecessary ternary in the load We assert on host side that ne00 is 64-aligned Add back scale-search, but optimize it with intrinsics Code cleanup Make scale in MMQ-epilogue NVFP4-specific/restrictive for now Remove unneeded include, add comment Fix trailing whitespace Guard __builtin_align__(32) struct to NVIDIA Seems like HIP doesn't have this available, see https://github.com/ggml-org/llama.cpp/actions/runs/29438651734/job/87431623001 * compiler massaging to avoid unnecessary LDCs * kvalues_mxfp4 -> kvalues_nvfp4 in quantize_mmq_nvfp4 * Always pass in src1_scale.ptr * Extract ggml_cuda_is_aligned helper * metal : add f16 type support to leaky relu (llama/25981) * CUDA: fix external compilation of q1_0 MMQ (llama/25778) * hexagon: fix Windows crash when op_poll is enabled (llama/26029) * hexagon: further improved pipeline of the core bits (L2, DMA, MM, FA) (llama/26049) * hex-l2: use dirty ranges for flushing * hex-l2: simplify range based flush logic * hex-l2: optimize dirty range scans * hex-hvx: support for reduce_max_i32 * hex-mm: optimize fused MUL_MAT+ADD to use vtcm for bias when it fits * hex-mmid: optimize mmid row-mapping generation * hex-mmid: optimize mmid row-mapping generation * hex-mmid: optimize mmid row-mapping generation (round2) * hmx-mm: optimize output proc by tiling (col-chunking) * hex-fa: start the next q dmas a bit earlier * hex-fa: prefetch Q even earlier * hvx-fa: optimize softmax to keep things in hvx registers * hex-fa: hoist const register init in softmax loop * hmx-fa: kick off next-qkv DMAs before o-proc * hmx-fa: hoist various checks out of the inner loop * hmx-fa: adjust the cost model to better balance softmax work across hvx threads * hmx-fa: overlap diag rescale build with last HMX task * hmx-fa: optimize idx update in output proc * hmx-fa: unroll the softmax loops for improved perf * hmx-fa: overlap qk-dot with softmax, double-buffer p and s tiles * hex-trace: double the default number of trace entries * hex-trace: add trace events for opbatch and buffer mgmt * hex-trace: overhaul tracing to simplify runtime event handling and support opbatch stats * hex-trace: replace ascii timeline diagram with pipeline bubbles detector * hex-trace: handle missing start/stop events * hex-dma: always log stop/start trace events even for dummy dmas * hex-scripts: fix flake warnings * opencl: do not treat NULL-mask flash attention as causal (llama/25771) * opencl: cache compiled cl_program binaries on disk (llama/26050) * HIP: remove rocWMMA FlashAttention (llama/26046) * Update ggml/src/gguf.cpp : Defined virtual keyword for destructor of gguf_writer_base (llama/25867) Without a virtual destructor, deleting a derived object through a base-class pointer only invokes the base destructor, skipping the derived one. * hexagon: partial im2col support (llama/26007) * hexagon: add IM2COL op Add Hexagon IM2COL support targeting only patch-embedding convolutions. * hexagon: im2col refactor and cleanup * hex-im2col: instrument and update im2col. * hex-im2col: add local htp_vtcm_layout computation. * opencl: fix fused RMS norm mul view offset (llama/26085) * ggml-cpu: Enable BF16 tiled gemm optimization on PowerPC (llama/26068) * ggml : adjust logic for offloading ops to weight's backend (llama/25832) * ggml : adjust logic for offloading ops to weight's backend * llama : dsv4 graph fixes * sycl(build): parallelize ocloc invocations (llama/25903) * Disable -ffast-math on HIP (llama/25495) * ggml-metal: FWHT kernel for metal backend (llama/25924) * metal fwht wip * shape guard and formatting * formatting * Formatting and typos Co-authored-by: YiChen Lv <63285796+forforever73@users.noreply.github.com> * fix narrowing issue Co-authored-by: YiChen Lv <63285796+forforever73@users.noreply.github.com> * cont : minor style --------- Co-authored-by: YiChen Lv <63285796+forforever73@users.noreply.github.com> Co-authored-by: Georgi Gerganov <ggerganov@gmail.com> * sycl: fix use-after-return of the SDPA scale in the oneDNN flash-attention path (llama/25880) * sycl: fix use-after-return of the SDPA scale in the oneDNN flash-attention path The scale was uploaded with an async memcpy sourced from a stack local. On the in-order queue that copy is ordered behind the K/V staging kernels; once n_kv is large enough (>= ~26k observed on Arc Pro B70) the staging outlives the host stack frame and the copy reads recycled memory, feeding the SDPA a garbage scale. Output then collapses to a single repeated token and the KV cache is poisoned for the rest of the session. Short contexts win the race by accident, and test-backend-ops caps FLASH_ATTN_EXT at kv=1024, which is why CI never caught it. The previous device_count > 1 wait_and_throw() gate (and reverting it, PR #25741) fixes the symptom only by keeping the frame alive across the copy at the cost of a host sync on every FA call. Fix: cache one device scalar per (device, value) -- the scale is constant per model -- and upload it synchronously once. The single-device fast path (no per-call host sync) is then safe: every device-side hazard already serializes on the in-order queue. The multi-GPU conservative wait is kept unchanged. Also: - GGML_SYCL_FA_ONEDNN_MAX_KV env (0 = unlimited): optional n_kv ceiling that routes very long sequences to the native FA kernel. - test-backend-ops: FLASH_ATTN_EXT F16 cases up to kv=65536 (Qwen3.6-27B geometry hsk=hsv=256 GQA 6, and hsk=128 GQA 4), closing the kv=1024 blind spot. Note the race itself needs a live multi-op pipeline to reproduce; single-op runs pass even on broken builds. Verified on Arc Pro B70 (bmg_g31), Qwen3.6-27B Q4_K, -c 131072: output byte-identical at temp 0 to the native FA path through 32k-deep prefill, with prefill depth-flat at 820-840 t/s (vs 340-350 native at 32k depth). Assisted-by: Claude Fable 5 * sycl: handle GGML_SYCL_FA_ONEDNN_MAX_KV like the other runtime env vars and document it Review feedback on #25880: - read the variable once at backend init into g_ggml_sycl_fa_onednn_max_kv via ggml_sycl_get_env, and print it in the startup env listing (-lv 4 shows it) - document GGML_SYCL_FA_ONEDNN and GGML_SYCL_FA_ONEDNN_MAX_KV in the SYCL.md runtime table Also trim the added FLASH_ATTN_EXT cases to kv={4096,16384}: the 32768/65536 shapes exceed the legacy NMSE threshold on both the oneDNN and native kernels (long-sequence fp16 accumulation drift, present before this PR) and would fail CI for an unrelated reason. Assisted-by: Claude Fable 5 * sycl: clarify GGML_SYCL_FA_ONEDNN_MAX_KV default is disabled Assisted-by: Claude Fable 5 * sycl: state default behavior of GGML_SYCL_FA_ONEDNN_MAX_KV explicitly Assisted-by: Claude Fable 5 * Update ggml/src/ggml-sycl/fattn-onednn.cpp Co-authored-by: Neo Zhang <zhang.jianyu@outlook.com> * sycl: write the SDPA scale from a kernel instead of caching it The per-(device, value) scale cache was a function-local static unordered_map with no synchronization, so concurrent backend instances could access and rehash it at the same time. Write the scalar with a single_task instead. The value is captured into the command, so no host memory has to outlive the call -- which is what the use-after-return fix needed in the first place. That removes the shared container, the leaked device allocation and the string key, and it also closes the remaining async-memcpy-from-a-stack-local on the first flash-attention call. Ordering does not rely on timing: the queue is created with sycl::property::queue::in_order and the dnnl stream wraps that same queue, so the write completes before the SDPA reads the scalar. The multi-GPU wait_and_throw() branch is unchanged. Also drop the <cstdlib> include, which is unused. Assisted-by: Claude Opus 5 --------- Co-authored-by: Neo Zhang <zhang.jianyu@outlook.com> * ggml-cuda: add chunked SSD matmul for Mamba-2 prefill acceleration (llama/22675) * ggml-cuda: add chunked SSD matmul for Mamba-2 prefill acceleration * cuda: added SSD CICD fixes for CUDA / HIP / MUSA / MSVC. * ggml-cuda: review comments fixed. * ggml-cuda: Fuse M matrix materialization into pre_matmul kernel and enabled test. * ggml-cuda: test updates and fixes * ggml-cuda: test updates to remove hardcoding of tensor initialise data limits. * ggml-cuda: ssd minor review comment fixed. * ggml-cuda: ssd minor CICD fixed. * CUDA SSD: Fixes correctness by promoting s0_stride_seq to int64_t, improves memory coalescing in ssm_ssd_prepare_dt_kernel, and boosts efficiency by merging B_weighted and C_scaled; also addresses prior review comments. * cuda: fix sdata read-write race in prepare_dt fallback scan loop * vulkan: add iq4_nl support back to FA (llama/24585) * vulkan: add iq4_nl support back to FA I was originally concerned about wasting shared memory on the LUT, but it's small and unlikely to matter in practice. Also support q1_0 for non-coopmat2. Fixes #23681 * remove q1_0 FA support * ggml : set output of view src (llama/25729) * llama-graph: set_outputs to t->view_src * change set_output to GGML_ASSERT about views not being outputs * sampler : avoid views in outputs * cont : fix dist sampler * cont : consistent logits handling * ggml : set output of view src * graph : simplify set_outputs() * cont : cleanup Co-authored-by: Gaurav Garg <gaugarg@nvidia.com> --------- Co-authored-by: Georgi Gerganov <ggerganov@gmail.com> Co-authored-by: Gaurav Garg <gaugarg@nvidia.com> * opencl: skip the Adreno KQ/KQV image kernels for multi-stream batches (llama/26189) The Adreno KQ/KQV image1d kernels (ggml_cl_mul_mat_kq_kqv_adreno) ignore dim 3 entirely: the sub-buffer covers only nb02*ne02 bytes and the kernel receives no ne03/ne13/nb03/nb13 arguments. With the unified KV cache, multi-sequence batches (e.g. llama-perplexity with its default -b 2048, n_seq=4, or a multi-slot llama-server) present KQ/KQV as 4D tensors with ne3 = n_stream, so every stream past the first reads the first stream's K/V and produces garbage. Flash attention masks the bug where it is enabled; devices where FA is declined (e.g. Adreno 740) hit it with default settings. Route ne03/ne13 > 1 to the general path, which handles dim 3, and honor view_offs when creating the sub-buffers (currently always 0 for tensors reaching this function, but the function would silently misread any future view). Llama-3.2-1B-Instruct Q4_0, wiki.test.raw, 8 chunks, -ngl 99: - Adreno 740, default: PPL 1817.64 -> 15.61 - Adreno 740, -fa 0: PPL 1941.64 -> 15.61 - Adreno 840, -fa 0: PPL 1943.90 -> 15.50 - single-stream (-b 512) results unchanged (15.6090) - test-backend-ops -o MUL_MAT on 740: identical before/after (909 OK, 12 pre-existing q6_K failures) * ggml-webgpu: Fix some binding alias issues to support all archs, fix recurrent-state-rollback test (llama/25931) * Add overlap glu variant to support all archs, fix recurrent-state-rollback test * format * Fix all arch overlapped ranges * format * diagnose bus error on apple ci * More testing * more testing * more targeted testing * Fix bug in alignment for > 4gb buffer offsets * Fix bug in view offsets * Try avoiding multi_buffers * not fixed yet, more logging :( * Handle edge case in set_rows * Try looking at view source * Skip deepseek32 for now and clean up trace infrastructure * simplify skipping * last cleanup * actually final cleanup * update handling of overlap * format * try skipping other failing model * add rdna3.5, and 3 to mmq configs so they can be tuned independently. (llama/26199) * RPC: add tensor_memset (llama/25912) * sycl: contiguous fast path + 32-bit index math for unary elementwise ops (llama/25946) * sycl: contiguous fast path + 32-bit index math for unary elementwise ops * sycl: use fastdiv for elementwise index math * ggml-cuda : disable MMQ on devices with less than 48 KiB shared memory (llama/26141) ggml_cuda_should_use_mmq() selects MMQ purely from the quantization type. The current MMQ configurations are designed and maintained against a minimum of 48 KiB per-block shared memory, the limit provided by NVIDIA Pascal GPUs and later. On devices that report less, no supported MMQ tile fits and mul_mat_q_switch_J() aborts when every tile size exceeds the device's per-block shared memory budget. Disable MMQ when smpbo < 48 KiB so the caller falls back to the BLAS path instead of hitting GGML_ABORT. Some current MUSA QY1 devices report only 28 KiB and are covered by this guard. Reproduced on a Moore Threads MTT S70 (arch mp_21, 28 KiB shared memory per block) with an RWKV-7 0.1B Q8_0 model: $ llama-bench -m rwkv7-g1d-0.1b-Q8_0.gguf -p 128 -n 0 J_best=0 ggml/src/ggml-cuda/template-instances/../mmq.cuh:1521: fatal error (core dumped) Only prefill (batch > 1) is affected; token generation is fine. After the fix the same device falls back to the BLAS path: Q8_0 pp128 1470.7 t/s, tg8 55.3 t/s (was: abort) FP16 unchanged Q4_K_M unchanged This matches a -DGGML_CUDA_FORCE_CUBLAS=ON build (pp128 1464.2 t/s), which confirms the fallback path is the one being taken. This is not MUSA-specific: any device with less than 48 KiB per-block shared memory is affected. Co-authored-by: KakaruHayate <KakaruHayate@users.noreply.github.com> * ggml : Fix issue with kleidiai ci and stringop overflow warning (llama/26277) Signed-off-by: Jonathan Clohessy <Jonathan.Clohessy@arm.com> * metal: fix memory unwire if model is freed without any GPU operations (llama/26082) * metal: fix memory leak if model is freed without any GPU operations * metal: run dummy work only if residency sets are used * metal: wrap function in #if defined * metal: measure system-wide wired memory in test * metal: always build regression test Co-authored-by: YiChen Lv <63285796+forforever73@users.noreply.github.com> --------- Co-authored-by: YiChen Lv <63285796+forforever73@users.noreply.github.com> * CUDA: add Q2_0 support (llama/25707) * ggml : bump version to 0.18.0 (ggml/1576) * sync : ggml * parakeet : update parakeet test models generation This commit updates the parakeet test models to ensure that the random values generated for mel filters are not negative. This will otherwise cause a debug assertion and fail the parakeet-test. Refs: https://github.com/ggml-org/whisper.cpp/actions/runs/30547589734/job/90887624319?pr=3962 --------- Signed-off-by: Todd Malsbary <todd.malsbary@intel.com> Signed-off-by: Francois Dugast <francois.dugast@intel.com> Signed-off-by: liminfei-amd <91481003+liminfei-amd@users.noreply.github.com> Signed-off-by: Aaron Teo <aaron.teo1@ibm.com> Signed-off-by: Jonathan Clohessy <Jonathan.Clohessy@arm.com> Co-authored-by: Aparna M P <aparmp@qti.qualcomm.com> Co-authored-by: Max Krasnyansky <maxk@qti.qualcomm.com> Co-authored-by: fairydreaming <166155368+fairydreaming@users.noreply.github.com> Co-authored-by: Stanisław Szymczyk <sszymczy@gmail.com> Co-authored-by: Johannes Gäßler <johannesg@5d6.de> Co-authored-by: Hongqiang Wang <wangh@qti.qualcomm.com> Co-authored-by: Martin Chang <marty1885@users.noreply.github.com> Co-authored-by: Vidas <vidas@nuolat.lt> Co-authored-by: Gianluca Guida <glguida@tlbflush.org> Co-authored-by: Gianluca Guida <gianluca@nekko.ai> Co-authored-by: ubergarm <leimgrub@gmail.com> Co-authored-by: SaqibAkram-10xE <saqib.akram@10xengineers.ai> Co-authored-by: Rehan Qasim <rehan.qasim@10xengineers.ai> Co-authored-by: Li He <lih@qti.qualcomm.com> Co-authored-by: Raman Shinde <raman.shinde15@gmail.com> Co-authored-by: cphlipot <9103367+cphlipot@users.noreply.github.com> Co-authored-by: Rohit Mahesh <74331568+rohitmahesh1@users.noreply.github.com> Co-authored-by: Todd Malsbary <todd.malsbary@intel.com> Co-authored-by: Frosty40 <newjordan@gmail.com> Co-authored-by: Claude Fable 5 <noreply@anthropic.com> Co-authored-by: QuintinShaw <yx6f20@soton.ac.uk> Co-authored-by: Jeff Bolz <jbolz@nvidia.com> Co-authored-by: Pasha Khosravi <khosravipasha@users.noreply.github.com> Co-authored-by: Titaniumtown <titaniumtown@proton.me> Co-authored-by: Charles Xu <charles.xu@arm.com> Co-authored-by: JusteLeo <leonard.adamo66@gmail.com> Co-authored-by: Chyan <163109379+chyan8@users.noreply.github.com> Co-authored-by: hmscider <201289679+hmscider@users.noreply.github.com> Co-authored-by: scientist3 <scientist.3@users.noreply.github.com> Co-authored-by: hmscider <hmscider@users.noreply.github.com> Co-authored-by: maxious <81432+maxious@users.noreply.github.com> Co-authored-by: Francois Dugast <francois.dugast@intel.com> Co-authored-by: Andrew Smith <atsmith19@comcast.net> Co-authored-by: Neo Zhang <zhang.jianyu@outlook.com> Co-authored-by: Michael Lamothe <michael.lamothe@gmail.com> Co-authored-by: Pascal <admin@serveurperso.com> Co-authored-by: leonardHONG <2695316095@qq.com> Co-authored-by: David Friehs <david@friehs.info> Co-authored-by: Pranesh Gonegandla <pranesh.iitp@gmail.com> Co-authored-by: praneshgo <227579474+praneshgo@users.noreply.github.com> Co-authored-by: liminfei-amd <91481003+liminfei-amd@users.noreply.github.com> Co-authored-by: Alexander Heisler <126129661+heislera763@users.noreply.github.com> Co-authored-by: Anav Prasad <anavp@nvidia.com> Co-authored-by: Ruben Ortlam <rortlam@redhat.com> Co-authored-by: Rajendra Matcha <matcraje@qti.qualcomm.com> Co-authored-by: Aman Gupta <amangupta052@gmail.com> Co-authored-by: akleine <alb.kleine@gmx.de> Co-authored-by: Gezahegne <gezahegne.yirefu@gmail.com> Co-authored-by: Aaron Teo <aaron.teo1@ibm.com> Co-authored-by: Todor Boinovski <todorb@qti.qualcomm.com> Co-authored-by: Piotr Wilkin (ilintar) <piotr.wilkin@syndatis.com> Co-authored-by: Markus Ebner <seijikun@users.noreply.github.com> Co-authored-by: Winston Ma <winstonma@ymail.com> Co-authored-by: Kamalesh VS <76260512+kkjjkamal123@users.noreply.github.com> Co-authored-by: Wei Wang <w10493wang@163.com> Co-authored-by: m1el <m1el@ya.ru> Co-authored-by: shalinib-ibm <Shalini.Salomi.Bodapati@ibm.com> Co-authored-by: Oliver Simons <osimons@nvidia.com> Co-authored-by: Ilia Ilmer <iliailmer@users.noreply.github.com> Co-authored-by: adgup-qti <adgup@qti.qualcomm.com> Co-authored-by: kumaal <44551860+kumaal@users.noreply.github.com> Co-authored-by: Yongmin Yoo 유용민 <yymin1022@gmail.com> Co-authored-by: yzyyzyhhh <96101183+happyyzy@users.noreply.github.com> Co-authored-by: Beinsezii <39478211+Beinsezii@users.noreply.github.com> Co-authored-by: Nick Lafleur <55208706+nicklafleur@users.noreply.github.com> Co-authored-by: YiChen Lv <63285796+forforever73@users.noreply.github.com> Co-authored-by: meatposes <computerdork@verizon.net> Co-authored-by: Bhavik Sharda <10757940+BLSharda@users.noreply.github.com> Co-authored-by: Gaurav Garg <gaugarg@nvidia.com> Co-authored-by: Reese Levine <reeselevine1@gmail.com> Co-authored-by: Geramy Loveless <gloveless@jqluv.com> Co-authored-by: Kakaru <97896816+KakaruHayate@users.noreply.github.com> Co-authored-by: KakaruHayate <KakaruHayate@users.noreply.github.com> Co-authored-by: Jonathan Clohessy <jonathan.clohessy@arm.com> Co-authored-by: Niklas Wenzel <dev@nikwen.de> Co-authored-by: Daniel Bevenius <daniel.bevenius@gmail.com>
4837 lines
191 KiB
C++
4837 lines
191 KiB
C++
#define GGML_COMMON_IMPL_CPP
|
|
#define GGML_COMMON_DECL_CPP
|
|
#include "ggml-common.h"
|
|
#include "ggml-backend-impl.h"
|
|
|
|
#include "ggml-impl.h"
|
|
#include "ggml-cpu.h"
|
|
#include "ggml-cpu-impl.h"
|
|
#include "simd-mappings.h"
|
|
#include "traits.h"
|
|
|
|
#include "arch-fallback.h"
|
|
|
|
#include <cmath>
|
|
#include <cstring>
|
|
#include <cassert>
|
|
#include <cstdio> // for GGML_ASSERT
|
|
|
|
#include "repack.h"
|
|
|
|
#if defined(__GNUC__)
|
|
#pragma GCC diagnostic ignored "-Woverlength-strings"
|
|
#endif
|
|
|
|
#define UNUSED GGML_UNUSED
|
|
|
|
static inline int nearest_int(float fval) {
|
|
assert(fabsf(fval) <= 4194303.f);
|
|
float val = fval + 12582912.f;
|
|
int i; memcpy(&i, &val, sizeof(int));
|
|
return (i & 0x007fffff) - 0x00400000;
|
|
}
|
|
|
|
// Functions to create the interleaved data layout formats
|
|
|
|
// interleave 4 block_q4_0s in blocks of blck_size_interleave
|
|
// returns an interleaved block_q4_0x4
|
|
// in the interleaved block_q4_0x4, place deltas for 4 block_q4_0 blocks
|
|
// first, then interleave quants from 4 block_q4_0s in blocks of blck_size_interleave
|
|
//
|
|
// - in : an array of block_q4_0 pointers
|
|
// - blck_size_interleave : the block_q4_0 quants bytes are interleaved in blocks of
|
|
// blck_size_interleave bytes
|
|
// - xor_mask : the mask to convert the nibbles in block_q4_0 quants bytes
|
|
// from bias offset form to pure sign form (this saves subtract
|
|
// operations durin unpacking)
|
|
//
|
|
|
|
extern "C" {
|
|
|
|
#if defined __riscv_zvfh
|
|
void ggml_quantize_mat_q8_0_4x1_generic(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t k) {
|
|
assert(QK8_0 == 32);
|
|
assert(k % QK8_0 == 0);
|
|
const int nb = k / QK8_0;
|
|
|
|
block_q8_0x4 * GGML_RESTRICT y = (block_q8_0x4 *) vy;
|
|
|
|
// scalar
|
|
const int blck_size_interleave = 1;
|
|
float srcv[4][QK8_0];
|
|
float id[4];
|
|
|
|
for (int i = 0; i < nb; i++) {
|
|
for (int row_iter = 0; row_iter < 4; row_iter++) {
|
|
float amax = 0.0f; // absolute max
|
|
|
|
for (int j = 0; j < QK8_0; j++) {
|
|
srcv[row_iter][j] = x[row_iter * k + i * QK8_0 + j];
|
|
amax = MAX(amax, fabsf(srcv[row_iter][j]));
|
|
}
|
|
|
|
const float d = amax / ((1 << 7) - 1);
|
|
id[row_iter] = d ? 1.0f / d : 0.0f;
|
|
|
|
y[i].d[row_iter] = GGML_CPU_FP32_TO_FP16(d);
|
|
}
|
|
|
|
for (int j = 0; j < QK8_0 * 4; j++) {
|
|
int src_offset = (j / (4 * blck_size_interleave)) * blck_size_interleave;
|
|
int src_id = (j % (4 * blck_size_interleave)) / blck_size_interleave;
|
|
src_offset += (j % blck_size_interleave);
|
|
|
|
float x0 = srcv[src_id][src_offset] * id[src_id];
|
|
y[i].qs[j] = roundf(x0);
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_quantize_mat_q8_K_4x1_generic(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t k) {
|
|
assert(QK_K == 256);
|
|
assert(k % QK_K == 0);
|
|
const int nb = k / QK_K;
|
|
|
|
block_q8_Kx4 * GGML_RESTRICT y = (block_q8_Kx4 *) vy;
|
|
|
|
const int blck_size_interleave = 1;
|
|
float srcv[4][QK_K];
|
|
float iscale[4];
|
|
|
|
for (int i = 0; i < nb; i++) {
|
|
for (int row_iter = 0; row_iter < 4; row_iter++) {
|
|
float amax = 0.0f; // absolute max
|
|
float max = 0;
|
|
|
|
for (int j = 0; j < QK_K; j++) {
|
|
srcv[row_iter][j] = x[row_iter * k + i * QK_K + j];
|
|
// Update the maximum value of the corresponding super block
|
|
if(amax < fabsf(srcv[row_iter][j])) {
|
|
amax = fabsf(srcv[row_iter][j]);
|
|
max = srcv[row_iter][j];
|
|
}
|
|
}
|
|
|
|
iscale[row_iter] = amax ? -127.f/max : 0;
|
|
y[i].d[row_iter] = amax ? 1/iscale[row_iter] : 0;
|
|
}
|
|
|
|
for (int j = 0; j < QK_K / 4; j++) {
|
|
y[i].bsums[j] = 0;
|
|
}
|
|
for (int j = 0; j < QK_K * 4; j++) {
|
|
int src_id = j % 4;
|
|
int src_offset = j / 4;
|
|
int index = ((j >> 6) << 2) + (j & 3);
|
|
|
|
float x0 = srcv[src_id][src_offset] * iscale[src_id];
|
|
y[i].qs[j] = nearest_int(x0);
|
|
y[i].bsums[index] += y[i].qs[j];
|
|
}
|
|
}
|
|
}
|
|
#endif
|
|
|
|
void ggml_quantize_mat_q8_0_4x4_generic(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t k) {
|
|
assert(QK8_0 == 32);
|
|
assert(k % QK8_0 == 0);
|
|
const int nb = k / QK8_0;
|
|
|
|
block_q8_0x4 * GGML_RESTRICT y = (block_q8_0x4 *) vy;
|
|
|
|
// scalar
|
|
const int blck_size_interleave = 4;
|
|
float srcv[4][QK8_0];
|
|
float id[4];
|
|
|
|
for (int i = 0; i < nb; i++) {
|
|
for (int row_iter = 0; row_iter < 4; row_iter++) {
|
|
float amax = 0.0f; // absolute max
|
|
|
|
for (int j = 0; j < QK8_0; j++) {
|
|
srcv[row_iter][j] = x[row_iter * k + i * QK8_0 + j];
|
|
amax = MAX(amax, fabsf(srcv[row_iter][j]));
|
|
}
|
|
|
|
const float d = amax / ((1 << 7) - 1);
|
|
id[row_iter] = d ? 1.0f / d : 0.0f;
|
|
|
|
y[i].d[row_iter] = GGML_CPU_FP32_TO_FP16(d);
|
|
}
|
|
|
|
for (int j = 0; j < QK8_0 * 4; j++) {
|
|
int src_offset = (j / (4 * blck_size_interleave)) * blck_size_interleave;
|
|
int src_id = (j % (4 * blck_size_interleave)) / blck_size_interleave;
|
|
src_offset += (j % blck_size_interleave);
|
|
|
|
float x0 = srcv[src_id][src_offset] * id[src_id];
|
|
y[i].qs[j] = roundf(x0);
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_quantize_mat_q8_0_4x8_generic(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t k) {
|
|
assert(QK8_0 == 32);
|
|
assert(k % QK8_0 == 0);
|
|
const int nb = k / QK8_0;
|
|
|
|
block_q8_0x4 * GGML_RESTRICT y = (block_q8_0x4 *) vy;
|
|
|
|
// scalar
|
|
const int blck_size_interleave = 8;
|
|
float srcv[4][QK8_0];
|
|
float id[4];
|
|
|
|
for (int i = 0; i < nb; i++) {
|
|
for (int row_iter = 0; row_iter < 4; row_iter++) {
|
|
float amax = 0.0f; // absolute max
|
|
|
|
for (int j = 0; j < QK8_0; j++) {
|
|
srcv[row_iter][j] = x[row_iter * k + i * QK8_0 + j];
|
|
amax = MAX(amax, fabsf(srcv[row_iter][j]));
|
|
}
|
|
|
|
const float d = amax / ((1 << 7) - 1);
|
|
id[row_iter] = d ? 1.0f / d : 0.0f;
|
|
|
|
y[i].d[row_iter] = GGML_CPU_FP32_TO_FP16(d);
|
|
}
|
|
|
|
for (int j = 0; j < QK8_0 * 4; j++) {
|
|
int src_offset = (j / (4 * blck_size_interleave)) * blck_size_interleave;
|
|
int src_id = (j % (4 * blck_size_interleave)) / blck_size_interleave;
|
|
src_offset += (j % blck_size_interleave);
|
|
|
|
float x0 = srcv[src_id][src_offset] * id[src_id];
|
|
y[i].qs[j] = roundf(x0);
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_quantize_mat_q8_K_4x4_generic(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t k) {
|
|
assert(QK_K == 256);
|
|
assert(k % QK_K == 0);
|
|
const int nb = k / QK_K;
|
|
|
|
block_q8_Kx4 * GGML_RESTRICT y = (block_q8_Kx4 *) vy;
|
|
|
|
// scalar
|
|
const int blck_size_interleave = 4;
|
|
float srcv[4][QK_K];
|
|
float iscale[4];
|
|
|
|
for (int i = 0; i < nb; i++) {
|
|
for (int row_iter = 0; row_iter < 4; row_iter++) {
|
|
float amax = 0.0f; // absolute max
|
|
float max = 0;
|
|
|
|
for (int j = 0; j < QK_K; j++) {
|
|
srcv[row_iter][j] = x[row_iter * k + i * QK_K + j];
|
|
// Update the maximum value of the corresponding super block
|
|
if(amax < fabsf(srcv[row_iter][j])) {
|
|
amax = fabsf(srcv[row_iter][j]);
|
|
max = srcv[row_iter][j];
|
|
}
|
|
}
|
|
|
|
iscale[row_iter] = amax ? -127.f/max : 0;
|
|
|
|
y[i].d[row_iter] = amax ? 1/iscale[row_iter] : 0;
|
|
}
|
|
|
|
for (int j = 0; j < QK_K / 4; j++) {
|
|
y[i].bsums[j] = 0;
|
|
}
|
|
|
|
// Quants values are interleaved in sequence of four bytes from corresponding super blocks
|
|
// Bsums values are interleaved in sequence of four bsums from each super block taken for interleaving
|
|
// i.e first four bsums from the first super block, followed by first four bsums from second super block and so on
|
|
for (int j = 0; j < QK_K * 4; j++) {
|
|
int src_offset = (j / (4 * blck_size_interleave)) * blck_size_interleave;
|
|
int src_id = (j % (4 * blck_size_interleave)) / blck_size_interleave;
|
|
src_offset += (j % blck_size_interleave);
|
|
int index = (((j & 15) >> 2) << 2) + ((j >> 8) << 4) + ((j >> 6) & 3);
|
|
|
|
float x0 = srcv[src_id][src_offset] * iscale[src_id];
|
|
y[i].qs[j] = nearest_int(x0);
|
|
y[i].bsums[index] += y[i].qs[j];
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_quantize_mat_q8_K_4x8_generic(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t k) {
|
|
assert(QK_K == 256);
|
|
assert(k % QK_K == 0);
|
|
const int nb = k / QK_K;
|
|
|
|
block_q8_Kx4 * GGML_RESTRICT y = (block_q8_Kx4 *) vy;
|
|
|
|
// scalar
|
|
const int blck_size_interleave = 8;
|
|
float srcv[4][QK_K];
|
|
float iscale[4];
|
|
|
|
for (int i = 0; i < nb; i++) {
|
|
for (int row_iter = 0; row_iter < 4; row_iter++) {
|
|
float amax = 0.0f; // absolute max
|
|
float max = 0;
|
|
|
|
for (int j = 0; j < QK_K; j++) {
|
|
srcv[row_iter][j] = x[row_iter * k + i * QK_K + j];
|
|
// Update the maximum value of the corresponding super block
|
|
if(amax < fabsf(srcv[row_iter][j])) {
|
|
amax = fabsf(srcv[row_iter][j]);
|
|
max = srcv[row_iter][j];
|
|
}
|
|
}
|
|
|
|
iscale[row_iter] = amax ? -127.f/max : 0;
|
|
|
|
y[i].d[row_iter] = amax ? 1/iscale[row_iter] : 0;
|
|
}
|
|
|
|
for (int j = 0; j < QK_K / 4; j++) {
|
|
y[i].bsums[j] = 0;
|
|
}
|
|
|
|
// Quants values are interleaved in sequence of eight bytes from corresponding super blocks
|
|
// Bsums values are interleaved in sequence of four bsums from each super block taken for interleaving
|
|
// i.e first four bsums from the first super block, followed by first four bsums from second super block and so on
|
|
for (int j = 0; j < QK_K * 4; j++) {
|
|
int src_offset = (j / (4 * blck_size_interleave)) * blck_size_interleave;
|
|
int src_id = (j % (4 * blck_size_interleave)) / blck_size_interleave;
|
|
src_offset += (j % blck_size_interleave);
|
|
int index = (((j & 31) >> 3) << 2) + ((j >> 8) << 4) + ((j >> 6) & 3);
|
|
|
|
float x0 = srcv[src_id][src_offset] * iscale[src_id];
|
|
y[i].qs[j] = nearest_int(x0);
|
|
y[i].bsums[index] += y[i].qs[j];
|
|
}
|
|
}
|
|
}
|
|
|
|
} // extern "C"
|
|
|
|
template <int64_t INTER_SIZE, ggml_type PARAM_TYPE>
|
|
void ggml_quantize_mat_t(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t nrow, int64_t n_per_row);
|
|
|
|
template <> void ggml_quantize_mat_t<4, GGML_TYPE_Q8_0>(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t nrow, int64_t n_per_row) {
|
|
assert(nrow == 4);
|
|
UNUSED(nrow);
|
|
ggml_quantize_mat_q8_0_4x4(x, vy, n_per_row);
|
|
}
|
|
|
|
template <> void ggml_quantize_mat_t<8, GGML_TYPE_Q8_0>(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t nrow, int64_t n_per_row) {
|
|
assert(nrow == 4);
|
|
UNUSED(nrow);
|
|
ggml_quantize_mat_q8_0_4x8(x, vy, n_per_row);
|
|
}
|
|
|
|
template <> void ggml_quantize_mat_t<4, GGML_TYPE_Q8_K>(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t nrow, int64_t n_per_row) {
|
|
assert(nrow == 4);
|
|
UNUSED(nrow);
|
|
ggml_quantize_mat_q8_K_4x4(x, vy, n_per_row);
|
|
}
|
|
|
|
template <> void ggml_quantize_mat_t<8, GGML_TYPE_Q8_K>(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t nrow, int64_t n_per_row) {
|
|
assert(nrow == 4);
|
|
UNUSED(nrow);
|
|
ggml_quantize_mat_q8_K_4x8(x, vy, n_per_row);
|
|
}
|
|
|
|
#if defined __riscv_zvfh
|
|
template <> void ggml_quantize_mat_t<1, GGML_TYPE_Q8_0>(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t nrow, int64_t n_per_row) {
|
|
assert(nrow == 4);
|
|
UNUSED(nrow);
|
|
ggml_quantize_mat_q8_0_4x1(x, vy, n_per_row);
|
|
}
|
|
|
|
template <> void ggml_quantize_mat_t<1, GGML_TYPE_Q8_K>(const float * GGML_RESTRICT x, void * GGML_RESTRICT vy, int64_t nrow, int64_t n_per_row) {
|
|
assert(nrow == 4);
|
|
UNUSED(nrow);
|
|
ggml_quantize_mat_q8_K_4x1(x, vy, n_per_row);
|
|
}
|
|
#endif
|
|
|
|
template <int M, int N>
|
|
static void ggml_gemv_q6_K_NxM_q8_K_generic_impl(int n,
|
|
float * GGML_RESTRICT s,
|
|
size_t bs,
|
|
const void * GGML_RESTRICT vx,
|
|
const void * GGML_RESTRICT vy,
|
|
int nr,
|
|
int nc) {
|
|
constexpr int blocklen = M;
|
|
constexpr int ncols_interleaved = N;
|
|
const int qk = QK_K;
|
|
const int nb = n / qk;
|
|
const int blocks_per_half = 64 / blocklen;
|
|
|
|
assert(n % qk == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
float sumf[8];
|
|
|
|
const block_q8_K * a_ptr = (const block_q8_K *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q6_Kx8 * b_ptr = (const block_q6_Kx8 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[j] = 0.0f;
|
|
}
|
|
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
const int base_l = (k / blocks_per_half) * 128 + (k % blocks_per_half) * blocklen;
|
|
const int base_h = base_l + 64;
|
|
|
|
const int scale_idx_l = base_l / 16;
|
|
const int scale_idx_h = base_h / 16;
|
|
|
|
const int qh_shift_l = ((base_l % 128) / 32) * 2;
|
|
const int qh_shift_h = ((base_h % 128) / 32) * 2;
|
|
|
|
const int qh_half_l = (base_l / 128) * 32;
|
|
const int qh_half_h = (base_h / 128) * 32;
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
const int8_t scale_l = b_ptr[l].scales[scale_idx_l * ncols_interleaved + j];
|
|
const int8_t scale_h = b_ptr[l].scales[scale_idx_h * ncols_interleaved + j];
|
|
|
|
int sumi_l = 0;
|
|
int sumi_h = 0;
|
|
|
|
for (int i = 0; i < blocklen; i++) {
|
|
const int ql_pos = k * ncols_interleaved * blocklen + j * blocklen + i;
|
|
const int l_4 = b_ptr[l].ql[ql_pos] & 0xF;
|
|
const int hi_4 = (b_ptr[l].ql[ql_pos] >> 4) & 0xF;
|
|
|
|
const int qh_idx_l = qh_half_l + ((base_l + i) % 32);
|
|
const int qh_chunk_l = qh_idx_l / blocklen;
|
|
const int qh_pos_l = qh_idx_l % blocklen;
|
|
const int qh_offset_l = qh_chunk_l * (blocklen * ncols_interleaved) + j * blocklen + qh_pos_l;
|
|
const int hi_2_l = (b_ptr[l].qh[qh_offset_l] >> qh_shift_l) & 0x3;
|
|
|
|
const int qh_idx_h = qh_half_h + ((base_h + i) % 32);
|
|
const int qh_chunk_h = qh_idx_h / blocklen;
|
|
const int qh_pos_h = qh_idx_h % blocklen;
|
|
const int qh_offset_h = qh_chunk_h * (blocklen * ncols_interleaved) + j * blocklen + qh_pos_h;
|
|
const int hi_2_h = (b_ptr[l].qh[qh_offset_h] >> qh_shift_h) & 0x3;
|
|
|
|
const int q_l = ((hi_2_l << 4) | l_4) - 32;
|
|
const int q_h = ((hi_2_h << 4) | hi_4) - 32;
|
|
|
|
const int8_t a_l = a_ptr[l].qs[base_l + i];
|
|
const int8_t a_h = a_ptr[l].qs[base_h + i];
|
|
|
|
sumi_l += q_l * a_l;
|
|
sumi_h += q_h * a_h;
|
|
}
|
|
|
|
sumf[j] +=
|
|
(sumi_l * scale_l + sumi_h * scale_h) * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * a_ptr[l].d;
|
|
}
|
|
}
|
|
}
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
}
|
|
|
|
template <int M, int N>
|
|
static void ggml_gemm_q6_K_NxM_q8_K_generic_impl(int n,
|
|
float * GGML_RESTRICT s,
|
|
size_t bs,
|
|
const void * GGML_RESTRICT vx,
|
|
const void * GGML_RESTRICT vy,
|
|
int nr,
|
|
int nc) {
|
|
constexpr int blocklen = M;
|
|
constexpr int ncols_interleaved = N;
|
|
const int qk = QK_K;
|
|
const int nb = n / qk;
|
|
const int blocks_per_half = 64 / blocklen;
|
|
const int q8_half_stride = 512;
|
|
const int q8_low_high_step = 256;
|
|
|
|
assert(n % qk == 0);
|
|
assert(nr % 4 == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
|
|
float sumf[4][8];
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_Kx4 * a_ptr = (const block_q8_Kx4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q6_Kx8 * b_ptr = (const block_q6_Kx8 *) vx + (x * nb);
|
|
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[m][j] = 0.0f;
|
|
}
|
|
}
|
|
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
const int base_l = (k / blocks_per_half) * 128 + (k % blocks_per_half) * blocklen;
|
|
const int base_h = base_l + 64;
|
|
|
|
const int scale_idx_l = base_l / 16;
|
|
const int scale_idx_h = base_h / 16;
|
|
|
|
const int qh_shift_l = ((base_l % 128) / 32) * 2;
|
|
const int qh_shift_h = ((base_h % 128) / 32) * 2;
|
|
|
|
const int qh_half_l = (base_l / 128) * 32;
|
|
const int qh_half_h = (base_h / 128) * 32;
|
|
|
|
const int q8_base = (k / blocks_per_half) * q8_half_stride + (k % blocks_per_half) * (blocklen * 4);
|
|
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
const int8_t scale_l = b_ptr[l].scales[scale_idx_l * ncols_interleaved + j];
|
|
const int8_t scale_h = b_ptr[l].scales[scale_idx_h * ncols_interleaved + j];
|
|
|
|
int sumi_l = 0;
|
|
int sumi_h = 0;
|
|
|
|
for (int i = 0; i < blocklen; i++) {
|
|
const int ql_pos = k * ncols_interleaved * blocklen + j * blocklen + i;
|
|
const int l_4 = b_ptr[l].ql[ql_pos] & 0xF;
|
|
const int hi_4 = (b_ptr[l].ql[ql_pos] >> 4) & 0xF;
|
|
|
|
const int qh_idx_l = qh_half_l + ((base_l + i) % 32);
|
|
const int qh_chunk_l = qh_idx_l / blocklen;
|
|
const int qh_pos_l = qh_idx_l % blocklen;
|
|
const int qh_offset_l =
|
|
qh_chunk_l * (blocklen * ncols_interleaved) + j * blocklen + qh_pos_l;
|
|
const int hi_2_l = (b_ptr[l].qh[qh_offset_l] >> qh_shift_l) & 0x3;
|
|
|
|
const int qh_idx_h = qh_half_h + ((base_h + i) % 32);
|
|
const int qh_chunk_h = qh_idx_h / blocklen;
|
|
const int qh_pos_h = qh_idx_h % blocklen;
|
|
const int qh_offset_h =
|
|
qh_chunk_h * (blocklen * ncols_interleaved) + j * blocklen + qh_pos_h;
|
|
const int hi_2_h = (b_ptr[l].qh[qh_offset_h] >> qh_shift_h) & 0x3;
|
|
|
|
const int q_l = ((hi_2_l << 4) | l_4) - 32;
|
|
const int q_h = ((hi_2_h << 4) | hi_4) - 32;
|
|
|
|
const int8_t q8_l = a_ptr[l].qs[q8_base + m * blocklen + i];
|
|
const int8_t q8_h = a_ptr[l].qs[q8_base + m * blocklen + i + q8_low_high_step];
|
|
|
|
sumi_l += q_l * q8_l;
|
|
sumi_h += q_h * q8_h;
|
|
}
|
|
|
|
sumf[m][j] += (sumi_l * scale_l + sumi_h * scale_h) * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) *
|
|
a_ptr[l].d[m];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
template <int M, int N>
|
|
static void ggml_gemv_q5_K_NxM_q8_K_generic_impl(int n,
|
|
float * GGML_RESTRICT s,
|
|
size_t bs,
|
|
const void * GGML_RESTRICT vx,
|
|
const void * GGML_RESTRICT vy,
|
|
int nr,
|
|
int nc) {
|
|
constexpr int blocklen = M;
|
|
constexpr int ncols_interleaved = N;
|
|
const int qk = QK_K;
|
|
const int nb = n / qk;
|
|
static const uint32_t kmask1 = 0x3f3f3f3f;
|
|
static const uint32_t kmask2 = 0x0f0f0f0f;
|
|
static const uint32_t kmask3 = 0x03030303;
|
|
|
|
assert(n % qk == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
float sumf[ncols_interleaved];
|
|
float sum_minf[ncols_interleaved];
|
|
uint32_t utmp[32];
|
|
int sumi1;
|
|
int sumi2;
|
|
int sumi;
|
|
|
|
const block_q8_K * a_ptr = (const block_q8_K *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q5_Kx8 * b_ptr = (const block_q5_Kx8 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[j] = 0.0;
|
|
sum_minf[j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
memcpy(utmp + sb * 4, b_ptr[l].scales + sb * K_SCALE_SIZE, K_SCALE_SIZE);
|
|
utmp[sb * 4 + 3] = ((utmp[sb * 4 + 2] >> 4) & kmask2) | (((utmp[sb * 4 + 1] >> 6) & kmask3) << 4);
|
|
const uint32_t uaux_0 = utmp[sb * 4 + 1] & kmask1;
|
|
utmp[sb * 4 + 1] = (utmp[sb * 4 + 2] & kmask2) | (((utmp[sb * 4 + 0] >> 6) & kmask3) << 4);
|
|
utmp[sb * 4 + 2] = uaux_0;
|
|
utmp[sb * 4 + 0] &= kmask1;
|
|
}
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
constexpr int scale_stride = 32;
|
|
uint8_t * scales_0 = (uint8_t *) utmp + (k / (32 / blocklen)) * scale_stride;
|
|
uint8_t * scales_1 = (uint8_t *) utmp + (k / (32 / blocklen)) * scale_stride + 16;
|
|
|
|
const int qh_shift = (k / (32 / blocklen)) * 2;
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi1 = 0;
|
|
sumi2 = 0;
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int b_qs_offset = k * ncols_interleaved * blocklen + j * blocklen + i;
|
|
|
|
const int qh_idx = (k * blocklen + i) % 32;
|
|
const int qh_chunk = qh_idx / blocklen;
|
|
const int qh_pos = qh_idx % blocklen;
|
|
const int b_qh_offset = qh_chunk * (blocklen * ncols_interleaved) + j * blocklen + qh_pos;
|
|
|
|
const uint8_t qh_val = b_ptr[l].qh[b_qh_offset];
|
|
const uint8_t h0 = (qh_val >> qh_shift) & 1;
|
|
const uint8_t h1 = (qh_val >> (qh_shift + 1)) & 1;
|
|
|
|
const int v0 = (int8_t) ((b_ptr[l].qs[b_qs_offset] & 0xF) | (h0 << 4));
|
|
const int v1 = (int8_t) ((b_ptr[l].qs[b_qs_offset] >> 4) | (h1 << 4));
|
|
|
|
const int q8_offset = (k / (32 / blocklen)) * 64 + (k % (32 / blocklen)) * blocklen + i;
|
|
|
|
sumi1 = (v0 * a_ptr[l].qs[q8_offset]);
|
|
sumi2 = (v1 * a_ptr[l].qs[q8_offset + 32]);
|
|
sumi1 = sumi1 * scales_0[j];
|
|
sumi2 = sumi2 * scales_1[j];
|
|
sumi += sumi1 + sumi2;
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * a_ptr[l].d;
|
|
}
|
|
}
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
uint8_t * mins = (uint8_t *) utmp + 8 + sb * 16;
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sum_minf[j] += mins[j] * (a_ptr[l].bsums[sb * 2] + a_ptr[l].bsums[sb * 2 + 1]) *
|
|
GGML_CPU_FP16_TO_FP32(b_ptr[l].dmin[j]) * a_ptr[l].d;
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[x * ncols_interleaved + j] = sumf[j] - sum_minf[j];
|
|
}
|
|
}
|
|
}
|
|
|
|
template <int M, int N>
|
|
static void ggml_gemm_q5_K_NxM_q8_K_generic_impl(int n,
|
|
float * GGML_RESTRICT s,
|
|
size_t bs,
|
|
const void * GGML_RESTRICT vx,
|
|
const void * GGML_RESTRICT vy,
|
|
int nr,
|
|
int nc) {
|
|
constexpr int blocklen = M;
|
|
constexpr int ncols_interleaved = N;
|
|
const int qk = QK_K;
|
|
const int nb = n / qk;
|
|
static const uint32_t kmask1 = 0x3f3f3f3f;
|
|
static const uint32_t kmask2 = 0x0f0f0f0f;
|
|
static const uint32_t kmask3 = 0x03030303;
|
|
|
|
assert(n % qk == 0);
|
|
assert(nr % 4 == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
float sumf[4][ncols_interleaved];
|
|
float sum_minf[4][ncols_interleaved];
|
|
uint32_t utmp[32];
|
|
int sumi1;
|
|
int sumi2;
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_Kx4 * a_ptr = (const block_q8_Kx4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q5_Kx8 * b_ptr = (const block_q5_Kx8 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[m][j] = 0.0;
|
|
sum_minf[m][j] = 0.0;
|
|
}
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
memcpy(utmp + sb * 4, b_ptr[l].scales + sb * K_SCALE_SIZE, K_SCALE_SIZE);
|
|
utmp[sb * 4 + 3] = ((utmp[sb * 4 + 2] >> 4) & kmask2) | (((utmp[sb * 4 + 1] >> 6) & kmask3) << 4);
|
|
const uint32_t uaux_0 = utmp[sb * 4 + 1] & kmask1;
|
|
utmp[sb * 4 + 1] = (utmp[sb * 4 + 2] & kmask2) | (((utmp[sb * 4 + 0] >> 6) & kmask3) << 4);
|
|
utmp[sb * 4 + 2] = uaux_0;
|
|
utmp[sb * 4 + 0] &= kmask1;
|
|
}
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
constexpr int scale_stride = 32;
|
|
uint8_t * scales_0 = (uint8_t *) utmp + (k / (32 / blocklen)) * scale_stride;
|
|
uint8_t * scales_1 = (uint8_t *) utmp + (k / (32 / blocklen)) * scale_stride + 16;
|
|
|
|
const int qh_shift = (k / (32 / blocklen)) * 2;
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi1 = 0;
|
|
sumi2 = 0;
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int b_qs_offset = k * ncols_interleaved * blocklen + j * blocklen + i;
|
|
|
|
const int qh_idx = (k * blocklen + i) % 32;
|
|
const int qh_chunk = qh_idx / blocklen;
|
|
const int qh_pos = qh_idx % blocklen;
|
|
const int b_qh_offset =
|
|
qh_chunk * (blocklen * ncols_interleaved) + j * blocklen + qh_pos;
|
|
|
|
const uint8_t qh_val = b_ptr[l].qh[b_qh_offset];
|
|
const uint8_t h0 = (qh_val >> qh_shift) & 1;
|
|
const uint8_t h1 = (qh_val >> (qh_shift + 1)) & 1;
|
|
|
|
const int v0 = (int8_t) ((b_ptr[l].qs[b_qs_offset] & 0xF) | (h0 << 4));
|
|
const int v1 = (int8_t) ((b_ptr[l].qs[b_qs_offset] >> 4) | (h1 << 4));
|
|
|
|
const int q8_offset = (k / (32 / blocklen)) * 256 +
|
|
(k % (32 / blocklen)) * 4 * blocklen + m * blocklen + i;
|
|
|
|
sumi1 = (v0 * a_ptr[l].qs[q8_offset]);
|
|
sumi2 = (v1 * a_ptr[l].qs[q8_offset + 128]);
|
|
sumi1 = sumi1 * scales_0[j];
|
|
sumi2 = sumi2 * scales_1[j];
|
|
sumi += sumi1 + sumi2;
|
|
}
|
|
sumf[m][j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * a_ptr[l].d[m];
|
|
}
|
|
}
|
|
}
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
uint8_t * mins = (uint8_t *) utmp + 8 + sb * 16;
|
|
for (int m = 0; m < 4; m++) {
|
|
const int16_t * bsums = a_ptr[l].bsums + (sb * 8) + (m * 4) - ((sb % 2) * 6);
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sum_minf[m][j] += mins[j] * (bsums[0] + bsums[1]) *
|
|
GGML_CPU_FP16_TO_FP32(b_ptr[l].dmin[j]) * a_ptr[l].d[m];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j] - sum_minf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
extern "C" {
|
|
|
|
void ggml_gemv_q4_0_4x4_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 4;
|
|
const int blocklen = 4;
|
|
|
|
assert(nr == 1);
|
|
assert(n % qk == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
float sumf[4];
|
|
int sumi;
|
|
|
|
const block_q8_0 * a_ptr = (const block_q8_0 *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_0x4 * b_ptr = (const block_q4_0x4 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[j] = 0.0;
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] << 4);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0xF0);
|
|
sumi += ((v0 * a_ptr[l].qs[k * blocklen + i]) + (v1 * a_ptr[l].qs[k * blocklen + i + qk / 2])) >> 4;
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d);
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_q4_0_4x8_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 4;
|
|
const int blocklen = 8;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
float sumf[4];
|
|
int sumi;
|
|
|
|
const block_q8_0 * a_ptr = (const block_q8_0 *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_0x4 * b_ptr = (const block_q4_0x4 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[j] = 0.0;
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] << 4);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0xF0);
|
|
sumi += ((v0 * a_ptr[l].qs[k * blocklen + i]) + (v1 * a_ptr[l].qs[k * blocklen + i + qk / 2])) >> 4;
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d);
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_q4_0_8x8_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 8;
|
|
const int blocklen = 8;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
float sumf[8];
|
|
int sumi;
|
|
|
|
const block_q8_0 * a_ptr = (const block_q8_0 *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_0x8 * b_ptr = (const block_q4_0x8 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[j] = 0.0;
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] << 4);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0xF0);
|
|
sumi += ((v0 * a_ptr[l].qs[k * blocklen + i]) + (v1 * a_ptr[l].qs[k * blocklen + i + qk / 2])) >> 4;
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d);
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_q4_K_8x4_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK_K;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 8;
|
|
const int blocklen = 4;
|
|
static const uint32_t kmask1 = 0x3f3f3f3f;
|
|
static const uint32_t kmask2 = 0x0f0f0f0f;
|
|
static const uint32_t kmask3 = 0x03030303;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
float sumf[8];
|
|
float sum_minf[8];
|
|
uint32_t utmp[32];
|
|
int sumi1;
|
|
int sumi2;
|
|
int sumi;
|
|
|
|
const block_q8_K * a_ptr = (const block_q8_K *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_Kx8 * b_ptr = (const block_q4_Kx8 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[j] = 0.0;
|
|
sum_minf[j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
memcpy(utmp + sb * 4, b_ptr[l].scales + sb * 12, 12);
|
|
utmp[sb * 4 + 3] = ((utmp[sb * 4 + 2] >> 4) & kmask2) | (((utmp[sb * 4 + 1] >> 6) & kmask3) << 4);
|
|
const uint32_t uaux_0 = utmp[sb * 4 + 1] & kmask1;
|
|
utmp[sb * 4 + 1] = (utmp[sb * 4 + 2] & kmask2) | (((utmp[sb * 4 + 0] >> 6) & kmask3) << 4);
|
|
utmp[sb * 4 + 2] = uaux_0;
|
|
utmp[sb * 4 + 0] &= kmask1;
|
|
}
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
uint8_t * scales_0 = (uint8_t *) utmp + (k / 8) * 32;
|
|
uint8_t * scales_1 = (uint8_t *) utmp + (k / 8) * 32 + 16;
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi1 = 0;
|
|
sumi2 = 0;
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0xF);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4);
|
|
sumi1 = (v0 * a_ptr[l].qs[(k / 8) * 64 + (k % 8) * blocklen + i]);
|
|
sumi2 = (v1 * a_ptr[l].qs[(k / 8) * 64 + (k % 8) * blocklen + i + 32]);
|
|
sumi1 = sumi1 * scales_0[j];
|
|
sumi2 = sumi2 * scales_1[j];
|
|
sumi += sumi1 + sumi2;
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * a_ptr[l].d;
|
|
}
|
|
}
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
uint8_t * mins = (uint8_t *) utmp + 8 + sb * 16;
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sum_minf[j] += mins[j] * (a_ptr[l].bsums[sb * 2] + a_ptr[l].bsums[sb * 2 + 1]) * GGML_CPU_FP16_TO_FP32(b_ptr[l].dmin[j]) * a_ptr[l].d;
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[x * ncols_interleaved + j] = sumf[j] - sum_minf[j];
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_q4_K_8x8_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK_K;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 8;
|
|
const int blocklen = 8;
|
|
static const uint32_t kmask1 = 0x3f3f3f3f;
|
|
static const uint32_t kmask2 = 0x0f0f0f0f;
|
|
static const uint32_t kmask3 = 0x03030303;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
float sumf[8];
|
|
float sum_minf[8];
|
|
uint32_t utmp[32];
|
|
int sumi1;
|
|
int sumi2;
|
|
int sumi;
|
|
|
|
const block_q8_K * a_ptr = (const block_q8_K *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_Kx8 * b_ptr = (const block_q4_Kx8 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[j] = 0.0;
|
|
sum_minf[j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
memcpy(utmp + sb * 4, b_ptr[l].scales + sb * 12, 12);
|
|
utmp[sb * 4 + 3] = ((utmp[sb * 4 + 2] >> 4) & kmask2) | (((utmp[sb * 4 + 1] >> 6) & kmask3) << 4);
|
|
const uint32_t uaux_0 = utmp[sb * 4 + 1] & kmask1;
|
|
utmp[sb * 4 + 1] = (utmp[sb * 4 + 2] & kmask2) | (((utmp[sb * 4 + 0] >> 6) & kmask3) << 4);
|
|
utmp[sb * 4 + 2] = uaux_0;
|
|
utmp[sb * 4 + 0] &= kmask1;
|
|
}
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
uint8_t *scales_0 = (uint8_t*) utmp + (k / 4) * 32;
|
|
uint8_t *scales_1 = (uint8_t*) utmp + (k / 4) * 32 + 16;
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi1 = 0;
|
|
sumi2 = 0;
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0xF);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4);
|
|
sumi1 = (v0 * a_ptr[l].qs[(k >> 2) * 64 + (k % 4) * blocklen + i]);
|
|
sumi2 = (v1 * a_ptr[l].qs[(k >> 2) * 64 + (k % 4) * blocklen + i + 32]);
|
|
sumi1 = sumi1 * scales_0[j];
|
|
sumi2 = sumi2 * scales_1[j];
|
|
sumi += sumi1 + sumi2;
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * a_ptr[l].d;
|
|
}
|
|
}
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
uint8_t *mins = (uint8_t*) utmp + 8 + sb * 16;
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sum_minf[j] += mins[j] * (a_ptr[l].bsums[sb * 2] + a_ptr[l].bsums[sb * 2 + 1]) * GGML_CPU_FP16_TO_FP32(b_ptr[l].dmin[j]) * a_ptr[l].d;
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[x * ncols_interleaved + j] = sumf[j] - sum_minf[j];
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_q2_K_8x8_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK_K;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 8;
|
|
const int blocklen = 8;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
float sumf[8];
|
|
float sum_minf[8];
|
|
int sumi1,sumi2,sumi3,sumi4;
|
|
int sumi;
|
|
|
|
const block_q8_K * a_ptr = (const block_q8_K *)vy;
|
|
for(int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q2_Kx8 * b_ptr = (const block_q2_Kx8 *) vx + (x * nb);
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[j] = 0.0;
|
|
sum_minf[j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (4 * blocklen)); k++) {
|
|
const uint8_t *scales_0 = b_ptr[l].scales + (k / 4) * 64 ;
|
|
const uint8_t *scales_1 = b_ptr[l].scales + (k / 4) * 64 + 16;
|
|
const uint8_t *scales_2 = b_ptr[l].scales + (k / 4) * 64 + 32;
|
|
const uint8_t *scales_3 = b_ptr[l].scales + (k / 4) * 64 + 48;
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi1 = 0;
|
|
sumi2 = 0;
|
|
sumi3 = 0;
|
|
sumi4 = 0;
|
|
sumi = 0;
|
|
int offset = ((k / 2) % 2) + j * 2;
|
|
for (int i = 0; i < blocklen; ++i){
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 3);
|
|
const int v1 = (int8_t) ((b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 2 ) & 3);
|
|
const int v2 = (int8_t) ((b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4 ) & 3);
|
|
const int v3 = (int8_t) ((b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 6 ) & 3);
|
|
sumi1 = (v0 * a_ptr[l].qs[(k >> 2) * 128 + (k % 4) * blocklen + i]);
|
|
sumi2 = (v1 * a_ptr[l].qs[(k >> 2) * 128 + (k % 4) * blocklen + i + 32]);
|
|
sumi3 = (v2 * a_ptr[l].qs[(k >> 2) * 128 + (k % 4) * blocklen + i + 64]);
|
|
sumi4 = (v3 * a_ptr[l].qs[(k >> 2) * 128 + (k % 4) * blocklen + i + 96]);
|
|
|
|
sumi1 = sumi1 * (scales_0[offset] & 0xF);
|
|
sumi2 = sumi2 * (scales_1[offset] & 0xF);
|
|
sumi3 = sumi3 * (scales_2[offset] & 0xF);
|
|
sumi4 = sumi4 * (scales_3[offset] & 0xF);
|
|
sumi += sumi1 + sumi2 + sumi3 + sumi4;
|
|
}
|
|
sumf[j] += sumi * GGML_FP16_TO_FP32(b_ptr[l].d[j]) * a_ptr[l].d;
|
|
}
|
|
}
|
|
for(int sb = 0; sb < 8; sb++) {
|
|
const uint8_t *mins = b_ptr[l].scales + sb * 16;
|
|
for(int j = 0; j < ncols_interleaved; j++){
|
|
sum_minf[j] += ((mins[j * 2] >> 4) * a_ptr[l].bsums[sb * 2] + (mins[(j * 2)+ 1] >> 4) * a_ptr[l].bsums[sb * 2 + 1]) * GGML_FP16_TO_FP32(b_ptr[l].dmin[j]) * a_ptr[l].d;
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[x * ncols_interleaved + j] = sumf[j] - sum_minf[j];
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_q5_K_8x4_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
ggml_gemv_q5_K_NxM_q8_K_generic_impl<4, 8>(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
void ggml_gemv_q5_K_8x8_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
ggml_gemv_q5_K_NxM_q8_K_generic_impl<8, 8>(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
|
|
void ggml_gemv_q6_K_8x4_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
ggml_gemv_q6_K_NxM_q8_K_generic_impl<4, 8>(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
void ggml_gemv_q6_K_8x8_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
ggml_gemv_q6_K_NxM_q8_K_generic_impl<8, 8>(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
void ggml_gemv_iq4_nl_4x4_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 4;
|
|
const int blocklen = 4;
|
|
|
|
assert(nr == 1);
|
|
assert(n % qk == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
float sumf[4];
|
|
int sumi;
|
|
|
|
const block_q8_0 * a_ptr = (const block_q8_0 *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_iq4_nlx4 * b_ptr = (const block_iq4_nlx4 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[j] = 0.0;
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = kvalues_iq4nl[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0x0F];
|
|
const int v1 = kvalues_iq4nl[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4];
|
|
sumi += ((v0 * a_ptr[l].qs[k * blocklen + i]) + (v1 * a_ptr[l].qs[k * blocklen + i + qk / 2]));
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d);
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_iq4_nl_8x8_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 8;
|
|
const int blocklen = 8;
|
|
|
|
assert(nr == 1);
|
|
assert(n % qk == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
float sumf[8];
|
|
int sumi;
|
|
|
|
const block_q8_0 * a_ptr = (const block_q8_0 *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_iq4_nlx8 * b_ptr = (const block_iq4_nlx8 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[j] = 0.0;
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = kvalues_iq4nl[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0x0F];
|
|
const int v1 = kvalues_iq4nl[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4];
|
|
sumi += ((v0 * a_ptr[l].qs[k * blocklen + i]) + (v1 * a_ptr[l].qs[k * blocklen + i + qk / 2]));
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d);
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_mxfp4_4x4_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 4;
|
|
const int blocklen = 4;
|
|
|
|
assert(nr == 1);
|
|
assert(n % qk == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
float sumf[4];
|
|
int sumi;
|
|
|
|
const block_q8_0 * a_ptr = (const block_q8_0 *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_mxfp4x4 * b_ptr = (const block_mxfp4x4 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[j] = 0.0;
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = kvalues_mxfp4[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0x0F];
|
|
const int v1 = kvalues_mxfp4[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4];
|
|
sumi += ((v0 * a_ptr[l].qs[k * blocklen + i]) + (v1 * a_ptr[l].qs[k * blocklen + i + qk / 2]));
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_E8M0_TO_FP32_HALF(b_ptr[l].e[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d);
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_mxfp4_8x8_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 8;
|
|
const int blocklen = 8;
|
|
|
|
assert(nr == 1);
|
|
assert(n % qk == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
float sumf[8];
|
|
int sumi;
|
|
|
|
const block_q8_0 * a_ptr = (const block_q8_0 *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_mxfp4x8 * b_ptr = (const block_mxfp4x8 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[j] = 0.0;
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = kvalues_mxfp4[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0x0F];
|
|
const int v1 = kvalues_mxfp4[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4];
|
|
sumi += ((v0 * a_ptr[l].qs[k * blocklen + i]) + (v1 * a_ptr[l].qs[k * blocklen + i + qk / 2]));
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_E8M0_TO_FP32_HALF(b_ptr[l].e[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d);
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_q8_0_4x4_q8_0_generic(int n,
|
|
float * GGML_RESTRICT s,
|
|
size_t bs,
|
|
const void * GGML_RESTRICT vx,
|
|
const void * GGML_RESTRICT vy,
|
|
int nr,
|
|
int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 4;
|
|
const int blocklen = 4;
|
|
|
|
assert(nr == 1);
|
|
assert(n % qk == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
float sumf[4];
|
|
int sumi;
|
|
|
|
const block_q8_0 * a_ptr = (const block_q8_0 *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q8_0x4 * b_ptr = (const block_q8_0x4 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / blocklen); k++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i];
|
|
sumi += v0 * a_ptr[l].qs[k * blocklen + i];
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d);
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_q8_0_4x8_q8_0_generic(int n,
|
|
float * GGML_RESTRICT s,
|
|
size_t bs,
|
|
const void * GGML_RESTRICT vx,
|
|
const void * GGML_RESTRICT vy,
|
|
int nr,
|
|
int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 4;
|
|
const int blocklen = 8;
|
|
|
|
assert(nr == 1);
|
|
assert(n % qk == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
float sumf[4];
|
|
int sumi;
|
|
|
|
const block_q8_0 * a_ptr = (const block_q8_0 *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q8_0x4 * b_ptr = (const block_q8_0x4 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / blocklen); k++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i];
|
|
sumi += v0 * a_ptr[l].qs[k * blocklen + i];
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d);
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
}
|
|
|
|
// Only enable these for RISC-V.
|
|
#if defined __riscv_zvfh
|
|
void ggml_gemv_q4_0_16x1_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 16;
|
|
const int blocklen = 1;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
float sumf[16];
|
|
int sumi;
|
|
|
|
const block_q8_0 * a_ptr = (const block_q8_0 *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_0x16 * b_ptr = (const block_q4_0x16 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[j] = 0.0;
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] << 4);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0xF0);
|
|
sumi += ((v0 * a_ptr[l].qs[k * blocklen + i]) + (v1 * a_ptr[l].qs[k * blocklen + i + qk / 2])) >> 4;
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d);
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_q4_K_16x1_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK_K;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 16;
|
|
const int blocklen = 1;
|
|
assert (n % qk == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
float sumf[16];
|
|
float sum_minf[16];
|
|
uint8_t scales[128];
|
|
uint8_t mins[128];
|
|
int sumi1;
|
|
int sumi2;
|
|
int sumi;
|
|
const block_q8_K * a_ptr = (const block_q8_K *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_Kx16 * b_ptr = (const block_q4_Kx16 *) vx + (x * nb);
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[j] = 0.0f;
|
|
sum_minf[j] = 0.0f;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int i = 0; i < 128; i++) {
|
|
scales[i] = b_ptr[l].scales[i] & 0x0F;
|
|
mins[i] = b_ptr[l].scales[i] >> 4;
|
|
}
|
|
for (int i = 0; i < 64; i++) {
|
|
scales[i] |= (b_ptr[l].scales[128 + i] & 0x03) << 4;
|
|
mins[i] |= (b_ptr[l].scales[128 + i] & 0x0C) << 2;
|
|
scales[i + 64] |= (b_ptr[l].scales[128 + i] & 0x30);
|
|
mins[i + 64] |= (b_ptr[l].scales[128 + i] & 0xC0) >> 2;
|
|
}
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
uint8_t *min = &mins[sb * 16];
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sum_minf[j] += min[j] * (a_ptr[l].bsums[sb * 2] + a_ptr[l].bsums[sb * 2 + 1]) * GGML_CPU_FP16_TO_FP32(b_ptr[l].dmin[j]) * a_ptr[l].d;
|
|
}
|
|
}
|
|
for (int sb = 0; sb < 8; sb += 2) {
|
|
uint8_t *scales_0 = &scales[sb * 16];
|
|
uint8_t *scales_1 = &scales[(sb + 1) * 16];
|
|
for (int i = 0; i < QK4_0; i++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi1 = 0;
|
|
sumi2 = 0;
|
|
sumi = 0;
|
|
const int v0 = (int8_t) (b_ptr[l].qs[sb * 256 + i * 16 + j] & 0xF);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[sb * 256 + i * 16 + j] >> 4);
|
|
sumi1 = (v0 * a_ptr[l].qs[sb * 32 + i]);
|
|
sumi2 = (v1 * a_ptr[l].qs[sb * 32 + 32 + i]);
|
|
sumi1 = sumi1 * scales_0[j];
|
|
sumi2 = sumi2 * scales_1[j];
|
|
sumi += sumi1 + sumi2;
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * a_ptr[l].d;
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[x * ncols_interleaved + j] = sumf[j] - sum_minf[j];
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_iq4_nl_16x1_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 16;
|
|
const int blocklen = 1;
|
|
|
|
assert(nr == 1);
|
|
assert(n % qk == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
float sumf[16];
|
|
int sumi;
|
|
|
|
const block_q8_0 * a_ptr = (const block_q8_0 *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_iq4_nlx16 * b_ptr = (const block_iq4_nlx16 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[j] = 0.0;
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = kvalues_iq4nl[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0x0F];
|
|
const int v1 = kvalues_iq4nl[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4];
|
|
sumi += ((v0 * a_ptr[l].qs[k * blocklen + i]) + (v1 * a_ptr[l].qs[k * blocklen + i + qk / 2]));
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d);
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_q8_0_16x1_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 16;
|
|
const int blocklen = 1;
|
|
|
|
assert(nr == 1);
|
|
assert(n % qk == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
float sumf[16];
|
|
int sumi;
|
|
|
|
const block_q8_0 * a_ptr = (const block_q8_0 *) vy;
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q8_0x16 * b_ptr = (const block_q8_0x16 *) vx + (x * nb);
|
|
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / blocklen); k++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i];
|
|
sumi += v0 * a_ptr[l].qs[k * blocklen + i];
|
|
}
|
|
sumf[j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d);
|
|
}
|
|
}
|
|
}
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[x * ncols_interleaved + j] = sumf[j];
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemv_q2_K_16x1_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
assert(n % QK_K == 0);
|
|
assert(nr == 1);
|
|
assert(nc % 16 == 0);
|
|
|
|
UNUSED(bs);
|
|
UNUSED(nr);
|
|
|
|
const int nb = n / QK_K;
|
|
const block_q2_Kx16 * x = (const block_q2_Kx16 *)vx;
|
|
const block_q8_K * y = (const block_q8_K *)vy;
|
|
|
|
// Layout: Even-Low(0,2,4,6), Odd-Low(1,3,5,7), Even-High(8...), Odd-High(9...)
|
|
const int sb_perm[16] = {
|
|
0, 4, 1, 5, 2, 6, 3, 7, // 0-7
|
|
8, 12, 9, 13, 10, 14, 11, 15 // 8-15
|
|
};
|
|
|
|
for (int col_tile = 0; col_tile < nc; col_tile += 16) {
|
|
const block_q2_Kx16 * x_ptr = x + (col_tile / 16) * nb;
|
|
const block_q8_K * y_ptr = y;
|
|
|
|
float sumf[16] = {0};
|
|
|
|
// Loop over K-blocks
|
|
for (int k_block = 0; k_block < nb; ++k_block) {
|
|
int32_t isum[16] = {0};
|
|
int32_t summs[16] = {0};
|
|
|
|
const uint8_t * qs_rhs = x_ptr[k_block].qs;
|
|
const uint8_t * sc_rhs = x_ptr[k_block].scales;
|
|
const int8_t * qs_lhs = y_ptr[k_block].qs;
|
|
const int16_t * bs_lhs = y_ptr[k_block].bsums;
|
|
|
|
// Iterate over sub-blocks 0..15
|
|
for (int sb = 0; sb < 16; ++sb) {
|
|
// Correction Term
|
|
int16_t bsum = bs_lhs[sb];
|
|
int scale_offset = sb_perm[sb] * 16;
|
|
|
|
for (int col = 0; col < 16; ++col) {
|
|
uint8_t sc_val = sc_rhs[scale_offset + col];
|
|
summs[col] += bsum * (sc_val >> 4); // Min is high 4 bits
|
|
}
|
|
|
|
// Main Dot Product
|
|
// Calculate base offsets for Q2 unpacking based on SB
|
|
int byte_base;
|
|
if (sb < 8) byte_base = (sb % 2 == 0) ? 0 : 16;
|
|
else byte_base = (sb % 2 == 0) ? 32 : 48;
|
|
|
|
int shift = ((sb / 2) % 4) * 2;
|
|
|
|
for (int col = 0; col < 16; ++col) {
|
|
uint8_t sc_val = sc_rhs[scale_offset + col];
|
|
int32_t d_sb = sc_val & 0xF; // Scale is low 4 bits
|
|
|
|
// Process 16 elements (l=0..15)
|
|
for (int l = 0; l < 16; ++l) {
|
|
// Q2: Interleaved by column. Byte `l` contains 4 k-values.
|
|
int qs_idx = (byte_base + l) * 16 + col;
|
|
uint8_t q2_val = (qs_rhs[qs_idx] >> shift) & 3;
|
|
|
|
// Q8: Linear access
|
|
int k = sb * 16 + l;
|
|
int8_t q8_val = qs_lhs[k];
|
|
|
|
isum[col] += q8_val * q2_val * d_sb;
|
|
}
|
|
}
|
|
}
|
|
|
|
// Finalize K-Block
|
|
for (int col = 0; col < 16; ++col) {
|
|
float d_lhs = y_ptr[k_block].d;
|
|
float d_rhs = GGML_FP16_TO_FP32(x_ptr[k_block].d[col]);
|
|
float dm_rhs = GGML_FP16_TO_FP32(x_ptr[k_block].dmin[col]);
|
|
|
|
float d_all = d_lhs * d_rhs;
|
|
float d_min = d_lhs * dm_rhs;
|
|
|
|
sumf[col] += (isum[col] * d_all) - (summs[col] * d_min);
|
|
}
|
|
}
|
|
|
|
for (int col = 0; col < 16; ++col) {
|
|
s[col_tile + col] = sumf[col];
|
|
}
|
|
}
|
|
}
|
|
#endif
|
|
|
|
void ggml_gemm_q4_0_4x4_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 4;
|
|
const int blocklen = 4;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nr % 4 == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
{
|
|
float sumf[4][4];
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_0x4 * a_ptr = (const block_q8_0x4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_0x4 * b_ptr = (const block_q4_0x4 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[m][j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] << 4);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0xF0);
|
|
sumi += ((v0 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i]) +
|
|
(v1 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i + qk / 2 * 4])) >> 4;
|
|
}
|
|
sumf[m][j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d[m]);
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++)
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_q4_0_4x8_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 4;
|
|
const int blocklen = 8;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nr % 4 == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
float sumf[4][4];
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_0x4 * a_ptr = (const block_q8_0x4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_0x4 * b_ptr = (const block_q4_0x4 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[m][j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] << 4);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0xF0);
|
|
sumi += ((v0 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i]) +
|
|
(v1 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i + qk / 2 * 4])) >> 4;
|
|
}
|
|
sumf[m][j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d[m]);
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++)
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_q4_0_8x8_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 8;
|
|
const int blocklen = 8;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nr % 4 == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
float sumf[4][8];
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_0x4 * a_ptr = (const block_q8_0x4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_0x8 * b_ptr = (const block_q4_0x8 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[m][j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] << 4);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0xF0);
|
|
sumi += ((v0 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i]) +
|
|
(v1 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i + qk / 2 * 4])) >> 4;
|
|
}
|
|
sumf[m][j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d[m]);
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++)
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_q4_K_8x4_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK_K;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 8;
|
|
const int blocklen = 4;
|
|
static const uint32_t kmask1 = 0x3f3f3f3f;
|
|
static const uint32_t kmask2 = 0x0f0f0f0f;
|
|
static const uint32_t kmask3 = 0x03030303;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nr % 4 == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
float sumf[4][8];
|
|
float sum_minf[4][8];
|
|
uint32_t utmp[32];
|
|
int sumi1;
|
|
int sumi2;
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_Kx4 * a_ptr = (const block_q8_Kx4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_Kx8 * b_ptr = (const block_q4_Kx8 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[m][j] = 0.0;
|
|
sum_minf[m][j] = 0.0;
|
|
}
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
memcpy(utmp + sb * 4, b_ptr[l].scales + sb * 12, 12);
|
|
utmp[sb * 4 + 3] = ((utmp[sb * 4 + 2] >> 4) & kmask2) | (((utmp[sb * 4 + 1] >> 6) & kmask3) << 4);
|
|
const uint32_t uaux_0 = utmp[sb * 4 + 1] & kmask1;
|
|
utmp[sb * 4 + 1] = (utmp[sb * 4 + 2] & kmask2) | (((utmp[sb * 4 + 0] >> 6) & kmask3) << 4);
|
|
utmp[sb * 4 + 2] = uaux_0;
|
|
utmp[sb * 4 + 0] &= kmask1;
|
|
}
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
uint8_t * scales_0 = (uint8_t *) utmp + (k / 8) * 32;
|
|
uint8_t * scales_1 = (uint8_t *) utmp + (k / 8) * 32 + 16;
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi1 = 0;
|
|
sumi2 = 0;
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0xF);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4);
|
|
sumi1 = (v0 * a_ptr[l].qs[(k / 8) * 256 + (k % 8) * 4 * blocklen + m * blocklen + i]);
|
|
sumi2 = (v1 * a_ptr[l].qs[(k / 8) * 256 + (k % 8) * 4 * blocklen + m * blocklen + i + 128]);
|
|
sumi1 = sumi1 * scales_0[j];
|
|
sumi2 = sumi2 * scales_1[j];
|
|
sumi += sumi1 + sumi2;
|
|
}
|
|
sumf[m][j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * a_ptr[l].d[m];
|
|
}
|
|
}
|
|
}
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
uint8_t * mins = (uint8_t *) utmp + 8 + sb * 16;
|
|
for(int m = 0; m < 4; m++) {
|
|
const int16_t * bsums = a_ptr[l].bsums + (sb * 8) + (m * 4) - ((sb % 2) * 6);
|
|
for(int j = 0; j < ncols_interleaved; j++) {
|
|
sum_minf[m][j] += mins[j] * (bsums[0] + bsums[1]) * GGML_CPU_FP16_TO_FP32(b_ptr[l].dmin[j]) * a_ptr[l].d[m];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j] - sum_minf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_q4_K_8x8_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK_K;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 8;
|
|
const int blocklen = 8;
|
|
static const uint32_t kmask1 = 0x3f3f3f3f;
|
|
static const uint32_t kmask2 = 0x0f0f0f0f;
|
|
static const uint32_t kmask3 = 0x03030303;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nr % 4 == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(bs);
|
|
|
|
float sumf[4][8];
|
|
float sum_minf[4][8];
|
|
uint32_t utmp[32];
|
|
int sumi1;
|
|
int sumi2;
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_Kx4 * a_ptr = (const block_q8_Kx4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_Kx8 * b_ptr = (const block_q4_Kx8 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[m][j] = 0.0;
|
|
sum_minf[m][j] = 0.0;
|
|
}
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
memcpy(utmp + sb * 4, b_ptr[l].scales + sb * 12, 12);
|
|
utmp[sb * 4 + 3] = ((utmp[sb * 4 + 2] >> 4) & kmask2) | (((utmp[sb * 4 + 1] >> 6) & kmask3) << 4);
|
|
const uint32_t uaux_0 = utmp[sb * 4 + 1] & kmask1;
|
|
utmp[sb * 4 + 1] = (utmp[sb * 4 + 2] & kmask2) | (((utmp[sb * 4 + 0] >> 6) & kmask3) << 4);
|
|
utmp[sb * 4 + 2] = uaux_0;
|
|
utmp[sb * 4 + 0] &= kmask1;
|
|
}
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
uint8_t *scales_0 = (uint8_t*) utmp + (k / 4) * 32;
|
|
uint8_t *scales_1 = (uint8_t*) utmp + (k / 4) * 32 + 16;
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi1 = 0;
|
|
sumi2 = 0;
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0xF);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4);
|
|
sumi1 = (v0 * a_ptr[l].qs[(k >> 2) * 256 + (k % 4) * 4 * blocklen + m * blocklen + i]);
|
|
sumi2 = (v1 * a_ptr[l].qs[(k >> 2) * 256 + (k % 4) * 4 * blocklen + m * blocklen + i + 128]);
|
|
sumi1 = sumi1 * scales_0[j];
|
|
sumi2 = sumi2 * scales_1[j];
|
|
sumi += sumi1 + sumi2;
|
|
}
|
|
sumf[m][j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * a_ptr[l].d[m];
|
|
}
|
|
}
|
|
}
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
uint8_t *mins = (uint8_t*) utmp + 8 + sb * 16;
|
|
for(int m = 0; m < 4; m++) {
|
|
const int16_t *bsums = a_ptr[l].bsums + (sb * 8) + (m * 4) - ((sb % 2) * 6);
|
|
for(int j = 0; j < ncols_interleaved; j++) {
|
|
sum_minf[m][j] += mins[j] * (bsums[0] + bsums[1]) * GGML_CPU_FP16_TO_FP32(b_ptr[l].dmin[j]) * a_ptr[l].d[m];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j] - sum_minf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_q2_K_8x8_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK_K;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 8;
|
|
const int blocklen = 8;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nr % 4 == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
float sumf[4][8];
|
|
float sum_minf[4][8];
|
|
int sumi1, sumi2, sumi3, sumi4;
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_Kx4 * a_ptr = (const block_q8_Kx4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q2_Kx8 * b_ptr = (const block_q2_Kx8 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[m][j] = 0.0;
|
|
sum_minf[m][j] = 0.0;
|
|
}
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (4 * blocklen)); k++) {
|
|
|
|
const uint8_t *scales_0 = b_ptr[l].scales + (k / 4) * 64 ;
|
|
const uint8_t *scales_1 = b_ptr[l].scales + (k / 4) * 64 + 16;
|
|
const uint8_t *scales_2 = b_ptr[l].scales + (k / 4) * 64 + 32;
|
|
const uint8_t *scales_3 = b_ptr[l].scales + (k / 4) * 64 + 48;
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi1 = 0;
|
|
sumi2 = 0;
|
|
sumi3 = 0;
|
|
sumi4 = 0;
|
|
sumi = 0;
|
|
int offset = ((k / 2) % 2) + j * 2;
|
|
for (int i = 0; i < blocklen; ++i){
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 3);
|
|
const int v1 = (int8_t) ((b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 2 ) & 3);
|
|
const int v2 = (int8_t) ((b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4 ) & 3);
|
|
const int v3 = (int8_t) ((b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 6 ) & 3);
|
|
sumi1 = (v0 * a_ptr[l].qs[(k >> 2) * 512 + (k % 4) * 4 * blocklen + m * blocklen + i]);
|
|
sumi2 = (v1 * a_ptr[l].qs[(k >> 2) * 512 + (k % 4) * 4 * blocklen + m * blocklen + i + 128]);
|
|
sumi3 = (v2 * a_ptr[l].qs[(k >> 2) * 512 + (k % 4) * 4 * blocklen + m * blocklen + i + 256]);
|
|
sumi4 = (v3 * a_ptr[l].qs[(k >> 2) * 512 + (k % 4) * 4 * blocklen + m * blocklen + i + 384]);
|
|
sumi1 = sumi1 * (scales_0[offset] & 0xF);
|
|
sumi2 = sumi2 * (scales_1[offset] & 0xF);
|
|
sumi3 = sumi3 * (scales_2[offset] & 0xF);
|
|
sumi4 = sumi4 * (scales_3[offset] & 0xF);
|
|
sumi += sumi1 + sumi2 + sumi3 + sumi4;
|
|
}
|
|
sumf[m][j] += sumi * GGML_FP16_TO_FP32(b_ptr[l].d[j]) * a_ptr[l].d[m];
|
|
}
|
|
}
|
|
}
|
|
for(int sb = 0; sb < 8; sb++) {
|
|
const uint8_t *mins = b_ptr[l].scales + sb * 16;
|
|
for(int m = 0; m < 4; m++) {
|
|
const int16_t *bsums = a_ptr[l].bsums + (sb * 8) + (m * 4) - ((sb % 2) * 6);
|
|
for(int j = 0; j < ncols_interleaved; j++) {
|
|
int mins_prod = ((mins[j * 2] >> 4) * bsums[0] + (mins[(j * 2)+ 1] >> 4) * bsums[1]);
|
|
sum_minf[m][j] += (mins_prod) * GGML_FP16_TO_FP32(b_ptr[l].dmin[j]) * a_ptr[l].d[m];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j] - sum_minf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_q5_K_8x4_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
ggml_gemm_q5_K_NxM_q8_K_generic_impl<4, 8>(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
void ggml_gemm_q5_K_8x8_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
ggml_gemm_q5_K_NxM_q8_K_generic_impl<8, 8>(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
void ggml_gemm_q6_K_8x4_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
ggml_gemm_q6_K_NxM_q8_K_generic_impl<4, 8>(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
void ggml_gemm_q6_K_8x8_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
ggml_gemm_q6_K_NxM_q8_K_generic_impl<8, 8>(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
void ggml_gemm_iq4_nl_4x4_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 4;
|
|
const int blocklen = 4;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nr % 4 == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
{
|
|
float sumf[4][4];
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_0x4 * a_ptr = (const block_q8_0x4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_iq4_nlx4 * b_ptr = (const block_iq4_nlx4 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[m][j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = kvalues_iq4nl[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0x0F];
|
|
const int v1 = kvalues_iq4nl[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4];
|
|
sumi += ((v0 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i]) +
|
|
(v1 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i + qk / 2 * 4]));
|
|
}
|
|
sumf[m][j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d[m]);
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++)
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_iq4_nl_8x8_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 8;
|
|
const int blocklen = 8;
|
|
|
|
assert(n % qk == 0);
|
|
assert(nr % 4 == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
float sumf[4][8];
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_0x4 * a_ptr = (const block_q8_0x4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_iq4_nlx8 * b_ptr = (const block_iq4_nlx8 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[m][j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = kvalues_iq4nl[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0x0F];
|
|
const int v1 = kvalues_iq4nl[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4];
|
|
sumi += ((v0 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i]) +
|
|
(v1 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i + qk / 2 * 4]));
|
|
}
|
|
sumf[m][j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d[m]);
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++)
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_mxfp4_4x4_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 4;
|
|
const int blocklen = 4;
|
|
|
|
assert(n % qk == 0);
|
|
assert(nr % 4 == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
float sumf[4][4];
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_0x4 * a_ptr = (const block_q8_0x4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_mxfp4x4 * b_ptr = (const block_mxfp4x4 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[m][j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = kvalues_mxfp4[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0x0F];
|
|
const int v1 = kvalues_mxfp4[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4];
|
|
sumi += ((v0 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i]) +
|
|
(v1 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i + qk / 2 * 4]));
|
|
}
|
|
sumf[m][j] += sumi * GGML_CPU_E8M0_TO_FP32_HALF(b_ptr[l].e[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d[m]);
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++)
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_mxfp4_8x8_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 8;
|
|
const int blocklen = 8;
|
|
|
|
assert(n % qk == 0);
|
|
assert(nr % 4 == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
float sumf[4][8];
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_0x4 * a_ptr = (const block_q8_0x4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_mxfp4x8 * b_ptr = (const block_mxfp4x8 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[m][j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = kvalues_mxfp4[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0x0F];
|
|
const int v1 = kvalues_mxfp4[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4];
|
|
sumi += ((v0 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i]) +
|
|
(v1 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i + qk / 2 * 4]));
|
|
}
|
|
sumf[m][j] += sumi * GGML_CPU_E8M0_TO_FP32_HALF(b_ptr[l].e[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d[m]);
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++)
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_q8_0_4x4_q8_0_generic(int n,
|
|
float * GGML_RESTRICT s,
|
|
size_t bs,
|
|
const void * GGML_RESTRICT vx,
|
|
const void * GGML_RESTRICT vy,
|
|
int nr,
|
|
int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 4;
|
|
const int blocklen = 4;
|
|
|
|
assert(n % qk == 0);
|
|
assert(nr % 4 == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
float sumf[4][4];
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_0x4 * a_ptr = (const block_q8_0x4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q8_0x4 * b_ptr = (const block_q8_0x4 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[m][j] = 0.0;
|
|
}
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / blocklen); k++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i];
|
|
sumi += v0 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i];
|
|
}
|
|
sumf[m][j] +=
|
|
sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d[m]);
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
|
|
|
|
void ggml_gemm_q8_0_4x8_q8_0_generic(int n,
|
|
float * GGML_RESTRICT s,
|
|
size_t bs,
|
|
const void * GGML_RESTRICT vx,
|
|
const void * GGML_RESTRICT vy,
|
|
int nr,
|
|
int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 4;
|
|
const int blocklen = 8;
|
|
|
|
assert(n % qk == 0);
|
|
assert(nr % 4 == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
float sumf[4][4];
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_0x4 * a_ptr = (const block_q8_0x4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q8_0x4 * b_ptr = (const block_q8_0x4 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[m][j] = 0.0;
|
|
}
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / blocklen); k++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i];
|
|
sumi += v0 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i];
|
|
}
|
|
sumf[m][j] +=
|
|
sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d[m]);
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
// Only enable these for RISC-V.
|
|
#if defined __riscv_zvfh
|
|
void ggml_gemm_q4_0_16x1_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 16;
|
|
const int blocklen = 1;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nr % 4 == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
float sumf[4][16];
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_0x4 * a_ptr = (const block_q8_0x4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_0x16 * b_ptr = (const block_q4_0x16 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[m][j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] << 4);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0xF0);
|
|
sumi += ((v0 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i]) +
|
|
(v1 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i + qk / 2 * 4])) >> 4;
|
|
}
|
|
sumf[m][j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d[m]);
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++)
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_q4_K_16x1_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK_K;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 16;
|
|
const int blocklen = 1;
|
|
|
|
assert (n % qk == 0);
|
|
assert (nr % 4 == 0);
|
|
assert (nc % ncols_interleaved == 0);
|
|
|
|
UNUSED(s);
|
|
UNUSED(bs);
|
|
UNUSED(vx);
|
|
UNUSED(vy);
|
|
UNUSED(nr);
|
|
UNUSED(nc);
|
|
UNUSED(nb);
|
|
UNUSED(ncols_interleaved);
|
|
UNUSED(blocklen);
|
|
|
|
float sumf[4][16];
|
|
float sum_minf[4][16];
|
|
uint8_t scales[128];
|
|
uint8_t mins[128];
|
|
int sumi1;
|
|
int sumi2;
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_Kx4 * a_ptr = (const block_q8_Kx4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q4_Kx16 * b_ptr = (const block_q4_Kx16 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[m][j] = 0.0;
|
|
sum_minf[m][j] = 0.0;
|
|
}
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int i = 0; i < 128; i++) {
|
|
scales[i] = b_ptr[l].scales[i] & 0x0F;
|
|
mins[i] = b_ptr[l].scales[i] >> 4;
|
|
}
|
|
for (int i = 0; i < 64; i++) {
|
|
scales[i] |= (b_ptr[l].scales[128 + i] & 0x03) << 4;
|
|
mins[i] |= (b_ptr[l].scales[128 + i] & 0x0C) << 2;
|
|
scales[i + 64] |= (b_ptr[l].scales[128 + i] & 0x30);
|
|
mins[i + 64] |= (b_ptr[l].scales[128 + i] & 0xC0) >> 2;
|
|
}
|
|
|
|
for (int sb = 0; sb < 8; sb++) {
|
|
uint8_t *min = &mins[sb * 16];
|
|
for(int m = 0; m < 4; m++) {
|
|
const int16_t bsums = a_ptr[l].bsums[sb * 8 + m] + a_ptr[l].bsums[sb * 8 + m + 4];
|
|
for(int j = 0; j < ncols_interleaved; j++) {
|
|
sum_minf[m][j] += min[j] * bsums * GGML_CPU_FP16_TO_FP32(b_ptr[l].dmin[j]) * a_ptr[l].d[m];
|
|
}
|
|
}
|
|
}
|
|
|
|
for (int sb = 0; sb < 8; sb += 2) {
|
|
uint8_t *scales_0 = &scales[sb * 16];
|
|
uint8_t *scales_1 = &scales[(sb + 1) * 16];
|
|
|
|
for (int i = 0; i < QK4_0; i++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi1 = 0;
|
|
sumi2 = 0;
|
|
sumi = 0;
|
|
|
|
const int v0 = (int8_t) (b_ptr[l].qs[sb * 256 + i * 16 + j] & 0xF);
|
|
const int v1 = (int8_t) (b_ptr[l].qs[sb * 256 + i * 16 + j] >> 4);
|
|
sumi1 = (v0 * a_ptr[l].qs[sb * 4 * 32 + i * 4 + m]);
|
|
sumi2 = (v1 * a_ptr[l].qs[sb * 4 * 32 + 32 * 4 + i * 4 + m]);
|
|
sumi1 = sumi1 * scales_0[j];
|
|
sumi2 = sumi2 * scales_1[j];
|
|
sumi += sumi1 + sumi2;
|
|
|
|
sumf[m][j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * a_ptr[l].d[m];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j] - sum_minf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_iq4_nl_16x1_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 16;
|
|
const int blocklen = 1;
|
|
|
|
assert(n % qk == 0);
|
|
assert(nr % 4 == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
float sumf[4][16];
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_0x4 * a_ptr = (const block_q8_0x4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_iq4_nlx16 * b_ptr = (const block_iq4_nlx16 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) sumf[m][j] = 0.0;
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / (2 * blocklen)); k++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = kvalues_iq4nl[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] & 0x0F];
|
|
const int v1 = kvalues_iq4nl[b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i] >> 4];
|
|
sumi += ((v0 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i]) +
|
|
(v1 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i + (qk / 2) * 4]));
|
|
}
|
|
sumf[m][j] += sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d[m]);
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++)
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
void ggml_gemm_q8_0_16x1_q8_0_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
const int qk = QK8_0;
|
|
const int nb = n / qk;
|
|
const int ncols_interleaved = 16;
|
|
const int blocklen = 1;
|
|
|
|
assert(n % qk == 0);
|
|
assert(nr % 4 == 0);
|
|
assert(nc % ncols_interleaved == 0);
|
|
|
|
float sumf[4][16];
|
|
int sumi;
|
|
|
|
for (int y = 0; y < nr / 4; y++) {
|
|
const block_q8_0x4 * a_ptr = (const block_q8_0x4 *) vy + (y * nb);
|
|
for (int x = 0; x < nc / ncols_interleaved; x++) {
|
|
const block_q8_0x16 * b_ptr = (const block_q8_0x16 *) vx + (x * nb);
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumf[m][j] = 0.0;
|
|
}
|
|
}
|
|
for (int l = 0; l < nb; l++) {
|
|
for (int k = 0; k < (qk / blocklen); k++) {
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
sumi = 0;
|
|
for (int i = 0; i < blocklen; ++i) {
|
|
const int v0 = b_ptr[l].qs[k * ncols_interleaved * blocklen + j * blocklen + i];
|
|
sumi += v0 * a_ptr[l].qs[k * 4 * blocklen + m * blocklen + i];
|
|
}
|
|
sumf[m][j] +=
|
|
sumi * GGML_CPU_FP16_TO_FP32(b_ptr[l].d[j]) * GGML_CPU_FP16_TO_FP32(a_ptr[l].d[m]);
|
|
}
|
|
}
|
|
}
|
|
}
|
|
for (int m = 0; m < 4; m++) {
|
|
for (int j = 0; j < ncols_interleaved; j++) {
|
|
s[(y * 4 + m) * bs + x * ncols_interleaved + j] = sumf[m][j];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
|
|
void ggml_gemm_q2_K_16x1_q8_K_generic(int n, float * GGML_RESTRICT s, size_t bs, const void * GGML_RESTRICT vx, const void * GGML_RESTRICT vy, int nr, int nc) {
|
|
assert(n % QK_K == 0);
|
|
assert(nr % 4 == 0);
|
|
assert(nc % 16 == 0);
|
|
const int nb = n / QK_K;
|
|
const block_q2_Kx16 * x = (const block_q2_Kx16 *)vx;
|
|
const block_q8_Kx4 * y = (const block_q8_Kx4 *)vy;
|
|
|
|
const int sb_perm[16] = {
|
|
0, 4, 1, 5, 2, 6, 3, 7,
|
|
8, 12, 9, 13, 10, 14, 11, 15
|
|
};
|
|
|
|
// Iterate Rows in tiles of 4
|
|
for (int row_tile = 0; row_tile < nr; row_tile += 4) {
|
|
// Iterate Columns in tiles of 16
|
|
for (int col_tile = 0; col_tile < nc; col_tile += 16) {
|
|
|
|
const block_q2_Kx16 * x_ptr = x + (col_tile / 16) * nb;
|
|
const block_q8_Kx4 * y_ptr = y + (row_tile / 4) * nb;
|
|
|
|
float sumf[4][16];
|
|
memset(sumf, 0, sizeof(sumf));
|
|
|
|
for (int k_block = 0; k_block < nb; ++k_block) {
|
|
int32_t isum[4][16];
|
|
int32_t summs[4][16];
|
|
memset(isum, 0, sizeof(isum));
|
|
memset(summs, 0, sizeof(summs));
|
|
|
|
const uint8_t * qs_rhs = x_ptr[k_block].qs;
|
|
const uint8_t * sc_rhs = x_ptr[k_block].scales;
|
|
const int8_t * qs_lhs = y_ptr[k_block].qs;
|
|
const int16_t * bs_lhs = y_ptr[k_block].bsums;
|
|
|
|
for (int sb = 0; sb < 16; ++sb) {
|
|
int scale_offset = sb_perm[sb] * 16;
|
|
|
|
int byte_base;
|
|
if (sb < 8) byte_base = (sb % 2 == 0) ? 0 : 16;
|
|
else byte_base = (sb % 2 == 0) ? 32 : 48;
|
|
int shift = ((sb / 2) % 4) * 2;
|
|
|
|
for (int col = 0; col < 16; ++col) {
|
|
uint8_t sc_val = sc_rhs[scale_offset + col];
|
|
int32_t d_sb = sc_val & 0xF;
|
|
int32_t m_sb = sc_val >> 4;
|
|
|
|
// Correction Term
|
|
for (int r = 0; r < 4; ++r) {
|
|
int bsum_idx = (sb / 4) * 16 + r * 4 + (sb % 4);
|
|
summs[r][col] += bs_lhs[bsum_idx] * m_sb;
|
|
}
|
|
|
|
// Main Dot Product
|
|
for (int l = 0; l < 16; ++l) {
|
|
int qs_idx = (byte_base + l) * 16 + col;
|
|
uint8_t q2_val = (qs_rhs[qs_idx] >> shift) & 3;
|
|
|
|
// Calculate Q8 index for this specific k and row
|
|
int k = sb * 16 + l;
|
|
int q8_idx = (k / 4) * 16 + (k % 4);
|
|
|
|
for (int r = 0; r < 4; ++r) {
|
|
// Add r*4 to jump to the correct row within the 4x4 chunk
|
|
int8_t q8_val = qs_lhs[q8_idx + r * 4];
|
|
isum[r][col] += q8_val * q2_val * d_sb;
|
|
}
|
|
}
|
|
}
|
|
}
|
|
|
|
// Finalize K-Block
|
|
for (int col = 0; col < 16; ++col) {
|
|
float d_rhs = GGML_FP16_TO_FP32(x_ptr[k_block].d[col]);
|
|
float dm_rhs = GGML_FP16_TO_FP32(x_ptr[k_block].dmin[col]);
|
|
|
|
for (int r = 0; r < 4; ++r) {
|
|
float d_lhs = y_ptr[k_block].d[r];
|
|
float d_all = d_lhs * d_rhs;
|
|
float d_min = d_lhs * dm_rhs;
|
|
sumf[r][col] += (isum[r][col] * d_all) - (summs[r][col] * d_min);
|
|
}
|
|
}
|
|
}
|
|
|
|
for (int r = 0; r < 4; ++r) {
|
|
for (int col = 0; col < 16; ++col) {
|
|
s[(row_tile + r) * bs + (col_tile + col)] = sumf[r][col];
|
|
}
|
|
}
|
|
}
|
|
}
|
|
}
|
|
#endif
|
|
|
|
} // extern "C"
|
|
|
|
static block_q8_0x4 make_block_q8_0x4(block_q8_0 * in, unsigned int blck_size_interleave) {
|
|
block_q8_0x4 out;
|
|
|
|
for (int i = 0; i < 4; i++) {
|
|
out.d[i] = in[i].d;
|
|
}
|
|
|
|
const int end = QK8_0 * 4 / blck_size_interleave;
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 4;
|
|
int src_offset = (i / 4) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
memcpy(&out.qs[dst_offset], &in[src_id].qs[src_offset], blck_size_interleave);
|
|
}
|
|
return out;
|
|
}
|
|
|
|
static block_q4_0x4 make_block_q4_0x4(block_q4_0 * in, int blck_size_interleave) {
|
|
block_q4_0x4 out;
|
|
|
|
for (int i = 0; i < 4; i++) {
|
|
out.d[i] = in[i].d;
|
|
}
|
|
|
|
const int end = QK4_0 * 2 / blck_size_interleave;
|
|
|
|
if (blck_size_interleave == 8) {
|
|
const uint64_t xor_mask = 0x8888888888888888ULL;
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 4;
|
|
int src_offset = (i / 4) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
uint64_t elems;
|
|
// Using memcpy to avoid unaligned memory accesses
|
|
memcpy(&elems, &in[src_id].qs[src_offset], sizeof(uint64_t));
|
|
elems ^= xor_mask;
|
|
memcpy(&out.qs[dst_offset], &elems, sizeof(uint64_t));
|
|
}
|
|
} else if (blck_size_interleave == 4) {
|
|
const uint32_t xor_mask = 0x88888888;
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 4;
|
|
int src_offset = (i / 4) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
uint32_t elems;
|
|
memcpy(&elems, &in[src_id].qs[src_offset], sizeof(uint32_t));
|
|
elems ^= xor_mask;
|
|
memcpy(&out.qs[dst_offset], &elems, sizeof(uint32_t));
|
|
}
|
|
} else {
|
|
GGML_ASSERT(false);
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
// interleave 8 block_q4_0s in blocks of blck_size_interleave
|
|
// returns an interleaved block_q4_0x8
|
|
// in the interleaved block_q4_0x8, place deltas for 8 block_q4_0 blocks
|
|
// first, then interleave quants from 8 block_q4_0s in blocks of blck_size_interleave
|
|
static block_q4_0x8 make_block_q4_0x8(block_q4_0 * in, unsigned int blck_size_interleave) {
|
|
block_q4_0x8 out;
|
|
|
|
for (int i = 0; i < 8; i++) {
|
|
out.d[i] = in[i].d;
|
|
}
|
|
|
|
const int end = QK4_0 * 4 / blck_size_interleave;
|
|
const uint64_t xor_mask = 0x8888888888888888ULL;
|
|
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 8;
|
|
int src_offset = (i / 8) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
uint64_t elems;
|
|
memcpy(&elems, &in[src_id].qs[src_offset], sizeof(uint64_t));
|
|
elems ^= xor_mask;
|
|
memcpy(&out.qs[dst_offset], &elems, sizeof(uint64_t));
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static block_q4_0x16 make_block_q4_0x16(block_q4_0 * in, unsigned int blck_size_interleave) {
|
|
block_q4_0x16 out;
|
|
|
|
for (int i = 0; i < 16; i++) {
|
|
out.d[i] = in[i].d;
|
|
}
|
|
|
|
const int end = QK4_0 * 8 / blck_size_interleave;
|
|
|
|
if (blck_size_interleave == 1) {
|
|
const uint8_t xor_mask = 0x88;
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 16;
|
|
int src_offset = i / 16;
|
|
int dst_offset = i;
|
|
|
|
out.qs[dst_offset] = in[src_id].qs[src_offset] ^ xor_mask;
|
|
}
|
|
} else {
|
|
GGML_ASSERT(false);
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static block_q4_Kx8 make_block_q4_Kx8(block_q4_K * in, unsigned int blck_size_interleave) {
|
|
block_q4_Kx8 out;
|
|
//Delta(scale) and dmin values of the eight Q4_K structures are copied onto the output interleaved structure
|
|
for (int i = 0; i < 8; i++) {
|
|
out.d[i] = in[i].GGML_COMMON_AGGR_U.GGML_COMMON_AGGR_S.d;
|
|
}
|
|
|
|
for (int i = 0; i < 8; i++) {
|
|
out.dmin[i] = in[i].GGML_COMMON_AGGR_U.GGML_COMMON_AGGR_S.dmin;
|
|
}
|
|
|
|
const int end = QK_K * 4 / blck_size_interleave;
|
|
|
|
// Interleave Q4_K quants by taking 8 bytes at a time
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 8;
|
|
int src_offset = (i / 8) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
// buffer large enough for the max interleave block size (8 bytes)
|
|
uint64_t elems;
|
|
memcpy(&elems, &in[src_id].qs[src_offset], blck_size_interleave);
|
|
memcpy(&out.qs[dst_offset], &elems, blck_size_interleave);
|
|
}
|
|
|
|
// The below logic is designed so as to unpack and rearrange scales and mins values in Q4_K
|
|
// Currently the Q4_K structure has 8 scales and 8 mins packed in 12 bytes ( 6 bits for each value)
|
|
// The output Q4_Kx8 structure has 96 bytes
|
|
// Every 12 byte is packed such that it contains scales and mins for corresponding sub blocks from Q4_K structure
|
|
// For eg - First 12 bytes contains 8 scales and 8 mins - each of first sub block from different Q4_K structures
|
|
uint8_t s[8], m[8];
|
|
|
|
for (int i = 0; i < 4; i++) {
|
|
for (int j = 0; j < 8; j++) {
|
|
s[j] = in[j].scales[i] & 63;
|
|
m[j] = in[j].scales[i + 4] & 63;
|
|
}
|
|
|
|
out.scales[i * 12] = (s[0] & 63) + ((s[4] & 48) << 2);
|
|
out.scales[i * 12 + 1] = (s[1] & 63) + ((s[5] & 48) << 2);
|
|
out.scales[i * 12 + 2] = (s[2] & 63) + ((s[6] & 48) << 2);
|
|
out.scales[i * 12 + 3] = (s[3] & 63) + ((s[7] & 48) << 2);
|
|
out.scales[i * 12 + 4] = (m[0] & 63) + ((m[4] & 48) << 2);
|
|
out.scales[i * 12 + 5] = (m[1] & 63) + ((m[5] & 48) << 2);
|
|
out.scales[i * 12 + 6] = (m[2] & 63) + ((m[6] & 48) << 2);
|
|
out.scales[i * 12 + 7] = (m[3] & 63) + ((m[7] & 48) << 2);
|
|
out.scales[i * 12 + 8] = (s[4] & 15) + ((m[4] & 15) << 4);
|
|
out.scales[i * 12 + 9] = (s[5] & 15) + ((m[5] & 15) << 4);
|
|
out.scales[i * 12 + 10] = (s[6] & 15) + ((m[6] & 15) << 4);
|
|
out.scales[i * 12 + 11] = (s[7] & 15) + ((m[7] & 15) << 4);
|
|
|
|
}
|
|
|
|
for (int i = 0; i < 4; i++) {
|
|
for (int j = 0; j < 8; j++) {
|
|
s[j] = ((in[j].scales[i] & 192) >> 2) | (in[j].scales[i+8] & 15);
|
|
m[j] = ((in[j].scales[i + 4] & 192) >> 2) | ((in[j].scales[i+8] & 240) >> 4);
|
|
}
|
|
|
|
out.scales[i * 12 + 48] = (s[0] & 63) + ((s[4] & 48) << 2);
|
|
out.scales[i * 12 + 49] = (s[1] & 63) + ((s[5] & 48) << 2);
|
|
out.scales[i * 12 + 50] = (s[2] & 63) + ((s[6] & 48) << 2);
|
|
out.scales[i * 12 + 51] = (s[3] & 63) + ((s[7] & 48) << 2);
|
|
out.scales[i * 12 + 52] = (m[0] & 63) + ((m[4] & 48) << 2);
|
|
out.scales[i * 12 + 53] = (m[1] & 63) + ((m[5] & 48) << 2);
|
|
out.scales[i * 12 + 54] = (m[2] & 63) + ((m[6] & 48) << 2);
|
|
out.scales[i * 12 + 55] = (m[3] & 63) + ((m[7] & 48) << 2);
|
|
out.scales[i * 12 + 56] = (s[4] & 15) + ((m[4] & 15) << 4);
|
|
out.scales[i * 12 + 57] = (s[5] & 15) + ((m[5] & 15) << 4);
|
|
out.scales[i * 12 + 58] = (s[6] & 15) + ((m[6] & 15) << 4);
|
|
out.scales[i * 12 + 59] = (s[7] & 15) + ((m[7] & 15) << 4);
|
|
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static block_q4_Kx16 make_block_q4_Kx16(block_q4_K * in, unsigned int blck_size_interleave) {
|
|
block_q4_Kx16 out;
|
|
//Delta(scale) and dmin values of the 16 Q4_K structures are copied onto the output interleaved structure
|
|
for (int i = 0; i < 16; i++) {
|
|
out.d[i] = in[i].GGML_COMMON_AGGR_U.GGML_COMMON_AGGR_S.d;
|
|
}
|
|
|
|
for (int i = 0; i < 16; i++) {
|
|
out.dmin[i] = in[i].GGML_COMMON_AGGR_U.GGML_COMMON_AGGR_S.dmin;
|
|
}
|
|
|
|
const int end = QK_K * 8 / blck_size_interleave;
|
|
|
|
if (blck_size_interleave == 1) {
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 16;
|
|
int src_offset = i / 16;
|
|
int dst_offset = i;
|
|
|
|
out.qs[dst_offset] = in[src_id].qs[src_offset];
|
|
}
|
|
|
|
// RVV repacking.
|
|
//
|
|
// Extract sums and mins for all 8 sub-blocks for each block of Q4_K.
|
|
uint8_t s[128], m[128];
|
|
for (int i = 0; i < 4; i++) {
|
|
for (int j = 0; j < 16; j++) {
|
|
s[i * 16 + j] = in[j].scales[i] & 63;
|
|
m[i * 16 + j] = in[j].scales[i + 4] & 63;
|
|
}
|
|
}
|
|
for (int i = 0; i < 4; i++) {
|
|
for (int j = 0; j < 16; j++) {
|
|
s[64 + i * 16 + j] = ((in[j].scales[i] & 192) >> 2) | (in[j].scales[i+8] & 15);
|
|
m[64 + i * 16 + j] = ((in[j].scales[i + 4] & 192) >> 2) | ((in[j].scales[i+8] & 240) >> 4);
|
|
}
|
|
}
|
|
|
|
for (int i = 0; i < 128; i++) {
|
|
out.scales[i] = (s[i] & 15) | ((m[i] & 15) << 4);
|
|
}
|
|
for (int i = 0; i < 64; i++) {
|
|
out.scales[128 + i] = ((s[i] & 48) >> 4) | ((m[i] & 48) >> 2) | (s[64 + i] & 48) | ((m[64 + i] & 48) << 2);
|
|
}
|
|
} else {
|
|
GGML_ASSERT(false);
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static block_q2_Kx8 make_block_q2_Kx8(block_q2_K * in, unsigned int blck_size_interleave) {
|
|
block_q2_Kx8 out;
|
|
|
|
// Delta(scale) and dmin values of the eight Q2_K structures are copied onto the output interleaved structure
|
|
for (int i = 0; i < 8; i++) {
|
|
out.d[i] = in[i].GGML_COMMON_AGGR_U.GGML_COMMON_AGGR_S.d;
|
|
}
|
|
|
|
for (int i = 0; i < 8; i++) {
|
|
out.dmin[i] = in[i].GGML_COMMON_AGGR_U.GGML_COMMON_AGGR_S.dmin;
|
|
}
|
|
|
|
const int end = QK_K * 2 / blck_size_interleave;
|
|
|
|
// Interleave Q2_K quants by taking 8 bytes at a time
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 8;
|
|
int src_offset = (i / 8) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
uint64_t elems;
|
|
memcpy(&elems, &in[src_id].qs[src_offset], sizeof(uint64_t));
|
|
memcpy(&out.qs[dst_offset], &elems, sizeof(uint64_t));
|
|
}
|
|
|
|
// The below logic is designed so as to unpack and rearrange scales and mins values in Q2_K
|
|
// Currently the Q2_K structure has 16 scales and 16 mins packed in 16 bytes ( 4 bits for each value)
|
|
// The output Q2_Kx8 structure has 128 bytes for storing scales and mins
|
|
// Every 16 byte is packed such that it contains scales and mins for corresponding sub blocks from Q2_K structure
|
|
// For eg - First 16 bytes contains 16 scales and 16 mins - each of first and second sub blocks from different Q2_K structures
|
|
|
|
for (int i = 0; i < 128; i++) {
|
|
// Index for selecting which q2k super block
|
|
int src1 = (i % 16) / 2;
|
|
// Index for selecting scale
|
|
int src2 = ((i / 16) * 2) + (i % 2);
|
|
|
|
out.scales[i] = in[src1].scales[src2];
|
|
}
|
|
return out;
|
|
}
|
|
|
|
static block_q5_Kx8 make_block_q5_Kx8(block_q5_K * in, unsigned int blck_size_interleave) {
|
|
block_q5_Kx8 out;
|
|
//Delta(scale) and dmin values of the eight Q5_K structures are copied onto the output interleaved structure
|
|
for (int i = 0; i < 8; i++) {
|
|
out.d[i] = in[i].GGML_COMMON_AGGR_U.GGML_COMMON_AGGR_S.d;
|
|
}
|
|
|
|
for (int i = 0; i < 8; i++) {
|
|
out.dmin[i] = in[i].GGML_COMMON_AGGR_U.GGML_COMMON_AGGR_S.dmin;
|
|
}
|
|
|
|
const int end = QK_K * 4 / blck_size_interleave;
|
|
|
|
// Interleave Q5_K quants by taking blck_size_interleave bytes at a time
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 8;
|
|
int src_offset = (i / 8) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
memcpy(&out.qs[dst_offset], &in[src_id].qs[src_offset], blck_size_interleave);
|
|
}
|
|
|
|
// Repeat for high bits with the same chunk size, since
|
|
// the high bits are interleaved in Q5_K and the index is
|
|
// qh_idx = (qs_idx % 32);
|
|
// qh_val = qh[qh_idx] >> (qs_idx / 32);
|
|
for (int i = 0; i < end / 4; ++i) {
|
|
int src_id = i % 8;
|
|
int src_offset = (i / 8) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
memcpy(&out.qh[dst_offset], &in[src_id].qh[src_offset], blck_size_interleave);
|
|
}
|
|
|
|
// The below logic is copied over from Q4_K
|
|
// The point is to unpack all the scales and mins for each sub block every time we load 12 bytes.
|
|
// Currently the Q5_K structure has 8 scales and 8 mins packed in 12 bytes ( 6 bits for each value)
|
|
// The output Q5_Kx8 structure has 96 bytes
|
|
// Every 12 byte is packed such that it contains scales and mins for corresponding sub blocks from Q5_K structure
|
|
// For eg - First 12 bytes contains 8 scales and 8 mins - each of first sub block from different Q5_K structures
|
|
uint8_t s[8], m[8];
|
|
|
|
for (int i = 0; i < 4; i++) {
|
|
for (int j = 0; j < 8; j++) {
|
|
s[j] = in[j].scales[i] & 63;
|
|
m[j] = in[j].scales[i + 4] & 63;
|
|
}
|
|
|
|
out.scales[i * 12] = (s[0] & 63) + ((s[4] & 48) << 2);
|
|
out.scales[i * 12 + 1] = (s[1] & 63) + ((s[5] & 48) << 2);
|
|
out.scales[i * 12 + 2] = (s[2] & 63) + ((s[6] & 48) << 2);
|
|
out.scales[i * 12 + 3] = (s[3] & 63) + ((s[7] & 48) << 2);
|
|
out.scales[i * 12 + 4] = (m[0] & 63) + ((m[4] & 48) << 2);
|
|
out.scales[i * 12 + 5] = (m[1] & 63) + ((m[5] & 48) << 2);
|
|
out.scales[i * 12 + 6] = (m[2] & 63) + ((m[6] & 48) << 2);
|
|
out.scales[i * 12 + 7] = (m[3] & 63) + ((m[7] & 48) << 2);
|
|
out.scales[i * 12 + 8] = (s[4] & 15) + ((m[4] & 15) << 4);
|
|
out.scales[i * 12 + 9] = (s[5] & 15) + ((m[5] & 15) << 4);
|
|
out.scales[i * 12 + 10] = (s[6] & 15) + ((m[6] & 15) << 4);
|
|
out.scales[i * 12 + 11] = (s[7] & 15) + ((m[7] & 15) << 4);
|
|
}
|
|
|
|
for (int i = 0; i < 4; i++) {
|
|
for (int j = 0; j < 8; j++) {
|
|
s[j] = ((in[j].scales[i] & 192) >> 2) | (in[j].scales[i + 8] & 15);
|
|
m[j] = ((in[j].scales[i + 4] & 192) >> 2) | ((in[j].scales[i + 8] & 240) >> 4);
|
|
}
|
|
|
|
out.scales[i * 12 + 48] = (s[0] & 63) + ((s[4] & 48) << 2);
|
|
out.scales[i * 12 + 49] = (s[1] & 63) + ((s[5] & 48) << 2);
|
|
out.scales[i * 12 + 50] = (s[2] & 63) + ((s[6] & 48) << 2);
|
|
out.scales[i * 12 + 51] = (s[3] & 63) + ((s[7] & 48) << 2);
|
|
out.scales[i * 12 + 52] = (m[0] & 63) + ((m[4] & 48) << 2);
|
|
out.scales[i * 12 + 53] = (m[1] & 63) + ((m[5] & 48) << 2);
|
|
out.scales[i * 12 + 54] = (m[2] & 63) + ((m[6] & 48) << 2);
|
|
out.scales[i * 12 + 55] = (m[3] & 63) + ((m[7] & 48) << 2);
|
|
out.scales[i * 12 + 56] = (s[4] & 15) + ((m[4] & 15) << 4);
|
|
out.scales[i * 12 + 57] = (s[5] & 15) + ((m[5] & 15) << 4);
|
|
out.scales[i * 12 + 58] = (s[6] & 15) + ((m[6] & 15) << 4);
|
|
out.scales[i * 12 + 59] = (s[7] & 15) + ((m[7] & 15) << 4);
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static block_q6_Kx8 make_block_q6_Kx8(block_q6_K * in, unsigned int blck_size_interleave) {
|
|
block_q6_Kx8 out;
|
|
constexpr int n_blocks = 8; // Kx8
|
|
for (int i = 0; i < n_blocks; i++) {
|
|
out.d[i] = in[i].d;
|
|
}
|
|
|
|
const int end_ls = QK_K * 4 / blck_size_interleave;
|
|
// Interleave Q6_K quants by taking blck_size_interleave bytes at a time
|
|
for (int i = 0; i < end_ls; ++i) {
|
|
int src_id = i % n_blocks;
|
|
int src_offset = (i / n_blocks) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
uint64_t elem_ls;
|
|
memcpy(&elem_ls, &in[src_id].ql[src_offset], blck_size_interleave);
|
|
memcpy(&out.ql[dst_offset], &elem_ls, blck_size_interleave);
|
|
}
|
|
|
|
// Interleave high bits using same chunk size as low bits
|
|
const int end_hs = end_ls / 2;
|
|
for (int i = 0; i < end_hs; ++i) {
|
|
int src_id = i % n_blocks;
|
|
int src_offset = (i / n_blocks) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
uint64_t elem_hs;
|
|
memcpy(&elem_hs, &in[src_id].qh[src_offset], blck_size_interleave);
|
|
memcpy(&out.qh[dst_offset], &elem_hs, blck_size_interleave);
|
|
}
|
|
|
|
// The below logic is designed so as to unpack and rearrange scales in Q6_K
|
|
// The output Q6_Kx8 structure interleaves the 8 bit scales in the same fashion as the quants
|
|
// Q6_K structure has an 8-bit scale per 16 elements -> 16 scales
|
|
// scales: [0 bl0 0 bl1 ... 0 bl7][1 bl0 ... 1 bl7] ... [15 bl0 ... 15 bl7] (bl = block)
|
|
constexpr int n_scales = QK_K / 16;
|
|
|
|
for (int i = 0; i < n_blocks; i++) {
|
|
for (int j = 0; j < n_scales; j++) {
|
|
out.scales[j * n_blocks + i] = in[i].scales[j];
|
|
}
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static block_q2_Kx16 make_block_q2_Kx16(const block_q2_K * in, unsigned int blck_size_interleave) {
|
|
block_q2_Kx16 out;
|
|
constexpr int N_COLS = 16;
|
|
|
|
// 1. Copy Super-Scales (d) and Super-Mins (dmin)
|
|
for (int i = 0; i < N_COLS; i++) {
|
|
out.d[i] = in[i].GGML_COMMON_AGGR_U.GGML_COMMON_AGGR_S.d;
|
|
out.dmin[i] = in[i].GGML_COMMON_AGGR_U.GGML_COMMON_AGGR_S.dmin;
|
|
}
|
|
|
|
// 2. Interleave Q2_K Data
|
|
const int bytes_per_col = 64;
|
|
const int total_bytes = N_COLS * bytes_per_col;
|
|
const int end = total_bytes / blck_size_interleave;
|
|
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_col_id = i % N_COLS;
|
|
int src_offset = (i / N_COLS) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
memcpy(&out.qs[dst_offset], &in[src_col_id].qs[src_offset], blck_size_interleave);
|
|
}
|
|
|
|
// 3. Repack Scales into the Optimized "Sequential-Parallel" Layout
|
|
int out_idx = 0;
|
|
|
|
// Arrays define the sub-block order for each group
|
|
const int even_low_sbs[] = {0, 2, 4, 6};
|
|
const int odd_low_sbs[] = {1, 3, 5, 7};
|
|
const int even_high_sbs[] = {8, 10, 12, 14};
|
|
const int odd_high_sbs[] = {9, 11, 13, 15};
|
|
|
|
// Pack Group 1: Even-Low
|
|
for (int sb : even_low_sbs) {
|
|
for (int col = 0; col < N_COLS; col++) {
|
|
out.scales[out_idx++] = in[col].scales[sb];
|
|
}
|
|
}
|
|
|
|
// Pack Group 2: Odd-Low
|
|
for (int sb : odd_low_sbs) {
|
|
for (int col = 0; col < N_COLS; col++) {
|
|
out.scales[out_idx++] = in[col].scales[sb];
|
|
}
|
|
}
|
|
|
|
// Pack Group 3: Even-High
|
|
for (int sb : even_high_sbs) {
|
|
for (int col = 0; col < N_COLS; col++) {
|
|
out.scales[out_idx++] = in[col].scales[sb];
|
|
}
|
|
}
|
|
|
|
// Pack Group 4: Odd-High
|
|
for (int sb : odd_high_sbs) {
|
|
for (int col = 0; col < N_COLS; col++) {
|
|
out.scales[out_idx++] = in[col].scales[sb];
|
|
}
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static int repack_q4_0_to_q4_0_4_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_Q4_0);
|
|
GGML_ASSERT(interleave_block == 4 || interleave_block == 8);
|
|
constexpr int nrows_interleaved = 4;
|
|
|
|
block_q4_0x4 * dst = (block_q4_0x4 *)t->data;
|
|
const block_q4_0 * src = (const block_q4_0 *)data;
|
|
block_q4_0 dst_tmp[4];
|
|
int nrow = ggml_nrows(t);
|
|
int nblocks = t->ne[0] / QK4_0;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_q4_0));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_q4_0x4(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
|
|
GGML_UNUSED(data_size);
|
|
}
|
|
|
|
static int repack_q4_K_to_q4_K_8_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_Q4_K);
|
|
GGML_ASSERT(interleave_block == 8 || interleave_block == 4);
|
|
constexpr int nrows_interleaved = 8;
|
|
|
|
block_q4_Kx8 * dst = (block_q4_Kx8*)t->data;
|
|
const block_q4_K * src = (const block_q4_K*) data;
|
|
block_q4_K dst_tmp[8];
|
|
int nrow = ggml_nrows(t);
|
|
int nblocks = t->ne[0] / QK_K;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_q4_K));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++ ) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_q4_Kx8(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
|
|
GGML_UNUSED(data_size);
|
|
}
|
|
|
|
static int repack_q4_K_to_q4_K_16_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_Q4_K);
|
|
constexpr int nrows_interleaved = 16;
|
|
|
|
block_q4_Kx16 * dst = (block_q4_Kx16*)t->data;
|
|
const block_q4_K * src = (const block_q4_K*) data;
|
|
block_q4_K dst_tmp[16];
|
|
int nrow = ggml_nrows(t);
|
|
int nblocks = t->ne[0] / QK_K;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_q4_K));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++ ) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_q4_Kx16(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
|
|
GGML_UNUSED(data_size);
|
|
}
|
|
|
|
static int repack_q2_K_to_q2_K_8_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_Q2_K);
|
|
GGML_ASSERT(interleave_block == 8);
|
|
constexpr int nrows_interleaved = 8;
|
|
|
|
block_q2_Kx8 * dst = (block_q2_Kx8*)t->data;
|
|
const block_q2_K * src = (const block_q2_K*) data;
|
|
block_q2_K dst_tmp[8];
|
|
int nrow = ggml_nrows(t);
|
|
int nblocks = t->ne[0] / QK_K;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_q2_K));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_q2_Kx8(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
|
|
GGML_UNUSED(data_size);
|
|
}
|
|
|
|
static int repack_q2_K_to_q2_K_16_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_Q2_K);
|
|
constexpr int nrows_interleaved = 16;
|
|
|
|
block_q2_Kx16 * dst = (block_q2_Kx16*)t->data;
|
|
const block_q2_K * src = (const block_q2_K*) data;
|
|
|
|
block_q2_K dst_tmp[nrows_interleaved];
|
|
|
|
int nrow = ggml_nrows(t);
|
|
int nblocks = t->ne[0] / QK_K;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_q2_K));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
// This loop gathers 16 separate blocks (one from each column)
|
|
// that correspond to the same K-dimension chunk.
|
|
for (int i = 0; i < nrows_interleaved; i++ ) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
|
|
*dst++ = make_block_q2_Kx16(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
|
|
GGML_UNUSED(data_size);
|
|
}
|
|
|
|
static int repack_q4_0_to_q4_0_16_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_Q4_0);
|
|
constexpr int nrows_interleaved = 16;
|
|
|
|
block_q4_0x16 * dst = (block_q4_0x16*)t->data;
|
|
const block_q4_0 * src = (const block_q4_0*) data;
|
|
block_q4_0 dst_tmp[16];
|
|
int nrow = ggml_nrows(t);
|
|
int nblocks = t->ne[0] / QK4_0;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_q4_0));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++ ) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_q4_0x16(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
|
|
GGML_UNUSED(data_size);
|
|
}
|
|
|
|
static int repack_q5_K_to_q5_K_8_bl(struct ggml_tensor * t,
|
|
int interleave_block,
|
|
const void * GGML_RESTRICT data,
|
|
size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_Q5_K);
|
|
GGML_ASSERT(interleave_block == 4 || interleave_block == 8);
|
|
constexpr int nrows_interleaved = 8;
|
|
|
|
block_q5_Kx8 * dst = (block_q5_Kx8 *) t->data;
|
|
const block_q5_K * src = (const block_q5_K *) data;
|
|
block_q5_K dst_tmp[8];
|
|
int nrow = ggml_nrows(t);
|
|
int nblocks = t->ne[0] / QK_K;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_q5_K));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_q5_Kx8(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
}
|
|
|
|
static int repack_q6_K_to_q6_K_8_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_Q6_K);
|
|
GGML_ASSERT(interleave_block == 4 || interleave_block == 8);
|
|
constexpr int nrows_interleaved = 8;
|
|
|
|
block_q6_Kx8 * dst = (block_q6_Kx8 *)t->data;
|
|
const block_q6_K * src = (const block_q6_K *) data;
|
|
block_q6_K dst_tmp[8];
|
|
int nrow = ggml_nrows(t);
|
|
int nblocks = t->ne[0] / QK_K;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_q6_K));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_q6_Kx8(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
}
|
|
|
|
static int repack_q4_0_to_q4_0_8_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_Q4_0);
|
|
GGML_ASSERT(interleave_block == 8);
|
|
constexpr int nrows_interleaved = 8;
|
|
|
|
block_q4_0x8 * dst = (block_q4_0x8*)t->data;
|
|
const block_q4_0 * src = (const block_q4_0*) data;
|
|
block_q4_0 dst_tmp[8];
|
|
int nrow = ggml_nrows(t);
|
|
int nblocks = t->ne[0] / QK4_0;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_q4_0));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++ ) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_q4_0x8(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
|
|
GGML_UNUSED(data_size);
|
|
}
|
|
|
|
static int repack_q8_0_to_q8_0_4_bl(struct ggml_tensor * t,
|
|
int interleave_block,
|
|
const void * GGML_RESTRICT data,
|
|
size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_Q8_0);
|
|
GGML_ASSERT(interleave_block == 4 || interleave_block == 8);
|
|
constexpr int nrows_interleaved = 4;
|
|
|
|
block_q8_0x4 * dst = (block_q8_0x4 *) t->data;
|
|
const block_q8_0 * src = (const block_q8_0 *) data;
|
|
block_q8_0 dst_tmp[4];
|
|
int nrow = ggml_nrows(t);
|
|
int nblocks = t->ne[0] / QK8_0;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_q8_0));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_q8_0x4(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
}
|
|
|
|
static block_q8_0x16 make_block_q8_0x16(block_q8_0 * in, unsigned int blck_size_interleave) {
|
|
block_q8_0x16 out;
|
|
|
|
for (int i = 0; i < 16; i++) {
|
|
out.d[i] = in[i].d;
|
|
}
|
|
|
|
const int end = QK8_0 * 16 / blck_size_interleave;
|
|
|
|
if (blck_size_interleave == 1) {
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 16;
|
|
int src_offset = i / 16;
|
|
int dst_offset = i;
|
|
out.qs[dst_offset] = in[src_id].qs[src_offset];
|
|
}
|
|
} else {
|
|
GGML_ASSERT(false);
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static int repack_q8_0_to_q8_0_16_bl(struct ggml_tensor * t,
|
|
int interleave_block,
|
|
const void * GGML_RESTRICT data,
|
|
size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_Q8_0);
|
|
constexpr int nrows_interleaved = 16;
|
|
|
|
block_q8_0x16 * dst = (block_q8_0x16 *) t->data;
|
|
const block_q8_0 * src = (const block_q8_0 *) data;
|
|
block_q8_0 dst_tmp[16];
|
|
int nrow = ggml_nrows(t);
|
|
int nblocks = t->ne[0] / QK8_0;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_q8_0));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_q8_0x16(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
}
|
|
|
|
static block_iq4_nlx4 make_block_iq4_nlx4(block_iq4_nl * in, unsigned int blck_size_interleave) {
|
|
block_iq4_nlx4 out;
|
|
|
|
for (int i = 0; i < 4; i++) {
|
|
out.d[i] = in[i].d;
|
|
}
|
|
|
|
const int end = QK4_NL * 2 / blck_size_interleave;
|
|
|
|
// TODO: this branch seems wrong
|
|
//if (blck_size_interleave == 8) {
|
|
// for (int i = 0; i < end; ++i) {
|
|
// int src_id = i % 4;
|
|
// int src_offset = (i / 4) * blck_size_interleave;
|
|
// int dst_offset = i * blck_size_interleave;
|
|
|
|
// // Using memcpy to avoid unaligned memory accesses
|
|
// memcpy(&out.qs[dst_offset], &in[src_id].qs[src_offset], sizeof(uint64_t));
|
|
// }
|
|
//} else
|
|
if (blck_size_interleave == 4) {
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 4;
|
|
int src_offset = (i / 4) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
memcpy(&out.qs[dst_offset], &in[src_id].qs[src_offset], sizeof(uint32_t));
|
|
}
|
|
} else {
|
|
GGML_ASSERT(false);
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static int repack_iq4_nl_to_iq4_nl_4_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_IQ4_NL);
|
|
GGML_ASSERT(interleave_block == 4);
|
|
|
|
const block_iq4_nl * src = (const block_iq4_nl *)data;
|
|
block_iq4_nlx4 * dst = ( block_iq4_nlx4 *)t->data;
|
|
|
|
block_iq4_nl dst_tmp[4];
|
|
|
|
int nrow = ggml_nrows(t);
|
|
int nrows_interleaved = 4;
|
|
int nblocks = t->ne[0] / QK4_NL;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_iq4_nl));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_iq4_nlx4(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
|
|
GGML_UNUSED(data_size);
|
|
}
|
|
|
|
static block_iq4_nlx8 make_block_iq4_nlx8(block_iq4_nl * in, unsigned int blck_size_interleave) {
|
|
block_iq4_nlx8 out;
|
|
|
|
for (int i = 0; i < 8; i++) {
|
|
out.d[i] = in[i].d;
|
|
}
|
|
|
|
const int end = QK4_NL * 4 / blck_size_interleave;
|
|
|
|
if (blck_size_interleave == 8) {
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 8;
|
|
int src_offset = (i / 8) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
memcpy(&out.qs[dst_offset], &in[src_id].qs[src_offset], sizeof(uint64_t));
|
|
}
|
|
} else {
|
|
GGML_ASSERT(false);
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static int repack_iq4_nl_to_iq4_nl_8_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_IQ4_NL);
|
|
GGML_ASSERT(interleave_block == 8);
|
|
|
|
const block_iq4_nl * src = (const block_iq4_nl *)data;
|
|
block_iq4_nlx8 * dst = ( block_iq4_nlx8 *)t->data;
|
|
|
|
block_iq4_nl dst_tmp[8];
|
|
|
|
int nrow = ggml_nrows(t);
|
|
int nrows_interleaved = 8;
|
|
int nblocks = t->ne[0] / QK4_NL;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_iq4_nl));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_iq4_nlx8(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
|
|
GGML_UNUSED(data_size);
|
|
}
|
|
|
|
static block_iq4_nlx16 make_block_iq4_nlx16(block_iq4_nl * in, unsigned int blck_size_interleave) {
|
|
block_iq4_nlx16 out;
|
|
|
|
for (int i = 0; i < 16; i++) {
|
|
out.d[i] = in[i].d;
|
|
}
|
|
|
|
const int end = QK4_NL * 8 / blck_size_interleave;
|
|
|
|
if (blck_size_interleave == 1) {
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 16;
|
|
int src_offset = i / 16;
|
|
int dst_offset = i;
|
|
|
|
out.qs[dst_offset] = in[src_id].qs[src_offset];
|
|
}
|
|
} else {
|
|
GGML_ASSERT(false);
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static int repack_iq4_nl_to_iq4_nl_16_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_IQ4_NL);
|
|
GGML_ASSERT(interleave_block == 1);
|
|
|
|
const block_iq4_nl * src = (const block_iq4_nl *)data;
|
|
block_iq4_nlx16 * dst = ( block_iq4_nlx16 *)t->data;
|
|
|
|
block_iq4_nl dst_tmp[16];
|
|
|
|
int nrow = ggml_nrows(t);
|
|
int nrows_interleaved = 16;
|
|
int nblocks = t->ne[0] / QK4_NL;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_iq4_nl));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_iq4_nlx16(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
|
|
GGML_UNUSED(data_size);
|
|
}
|
|
|
|
static block_mxfp4x4 make_block_mxfp4x4(block_mxfp4 * in, unsigned int blck_size_interleave) {
|
|
block_mxfp4x4 out;
|
|
|
|
for (int i = 0; i < 4; i++) {
|
|
out.e[i] = in[i].e;
|
|
}
|
|
|
|
const int end = QK_MXFP4 * 2 / blck_size_interleave;
|
|
|
|
if (blck_size_interleave == 4) {
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 4;
|
|
int src_offset = (i / 4) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
memcpy(&out.qs[dst_offset], &in[src_id].qs[src_offset], sizeof(uint32_t));
|
|
}
|
|
} else {
|
|
GGML_ASSERT(false);
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static int repack_mxfp4_to_mxfp4_4_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_MXFP4);
|
|
GGML_ASSERT(interleave_block == 4);
|
|
|
|
const block_mxfp4 * src = (const block_mxfp4 *)data;
|
|
block_mxfp4x4 * dst = ( block_mxfp4x4 *)t->data;
|
|
|
|
block_mxfp4 dst_tmp[4];
|
|
|
|
int nrow = ggml_nrows(t);
|
|
int nrows_interleaved = 4;
|
|
int nblocks = t->ne[0] / QK_MXFP4;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_mxfp4));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0 || t->ne[0] % 8 != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_mxfp4x4(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
|
|
GGML_UNUSED(data_size);
|
|
}
|
|
|
|
static block_mxfp4x8 make_block_mxfp4x8(block_mxfp4 * in, unsigned int blck_size_interleave) {
|
|
block_mxfp4x8 out;
|
|
|
|
for (int i = 0; i < 8; i++) {
|
|
out.e[i] = in[i].e;
|
|
}
|
|
|
|
const int end = QK_MXFP4 * 4 / blck_size_interleave;
|
|
|
|
if (blck_size_interleave == 8) {
|
|
for (int i = 0; i < end; ++i) {
|
|
int src_id = i % 8;
|
|
int src_offset = (i / 8) * blck_size_interleave;
|
|
int dst_offset = i * blck_size_interleave;
|
|
|
|
memcpy(&out.qs[dst_offset], &in[src_id].qs[src_offset], sizeof(uint64_t));
|
|
}
|
|
} else {
|
|
GGML_ASSERT(false);
|
|
}
|
|
|
|
return out;
|
|
}
|
|
|
|
static int repack_mxfp4_to_mxfp4_8_bl(struct ggml_tensor * t, int interleave_block, const void * GGML_RESTRICT data, size_t data_size) {
|
|
GGML_ASSERT(t->type == GGML_TYPE_MXFP4);
|
|
GGML_ASSERT(interleave_block == 8);
|
|
|
|
const block_mxfp4 * src = (const block_mxfp4 *)data;
|
|
block_mxfp4x8 * dst = ( block_mxfp4x8 *)t->data;
|
|
|
|
block_mxfp4 dst_tmp[8];
|
|
|
|
int nrow = ggml_nrows(t);
|
|
int nrows_interleaved = 8;
|
|
int nblocks = t->ne[0] / QK_MXFP4;
|
|
|
|
GGML_ASSERT(data_size == nrow * nblocks * sizeof(block_mxfp4));
|
|
|
|
if (t->ne[1] % nrows_interleaved != 0) {
|
|
return -1;
|
|
}
|
|
|
|
for (int b = 0; b < nrow; b += nrows_interleaved) {
|
|
for (int64_t x = 0; x < nblocks; x++) {
|
|
for (int i = 0; i < nrows_interleaved; i++) {
|
|
dst_tmp[i] = src[x + i * nblocks];
|
|
}
|
|
*dst++ = make_block_mxfp4x8(dst_tmp, interleave_block);
|
|
}
|
|
src += nrows_interleaved * nblocks;
|
|
}
|
|
return 0;
|
|
|
|
GGML_UNUSED(data_size);
|
|
}
|
|
|
|
namespace ggml::cpu::repack {
|
|
// repack
|
|
template <typename BLOC_TYPE, int64_t INTER_SIZE, int64_t NB_COLS>
|
|
int repack(struct ggml_tensor *, const void *, size_t);
|
|
|
|
// TODO: generalise.
|
|
template <> int repack<block_q4_0, 4, 4>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q4_0_to_q4_0_4_bl(t, 4, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q4_0, 8, 4>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q4_0_to_q4_0_4_bl(t, 8, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q4_0, 8, 8>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q4_0_to_q4_0_8_bl(t, 8, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q4_K, 8, 8>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q4_K_to_q4_K_8_bl(t, 8, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q4_K, 4, 8>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q4_K_to_q4_K_8_bl(t, 4, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q2_K, 8, 8>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q2_K_to_q2_K_8_bl(t, 8, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q5_K, 4, 8>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q5_K_to_q5_K_8_bl(t, 4, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q5_K, 8, 8>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q5_K_to_q5_K_8_bl(t, 8, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q6_K, 4, 8>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q6_K_to_q6_K_8_bl(t, 4, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q6_K, 8, 8>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q6_K_to_q6_K_8_bl(t, 8, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_iq4_nl, 4, 4>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_iq4_nl_to_iq4_nl_4_bl(t, 4, data, data_size);
|
|
}
|
|
|
|
// TODO: needs to be revisited
|
|
//template <> int repack<block_iq4_nl, 8, 4>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
// return repack_iq4_nl_to_iq4_nl_4_bl(t, 8, data, data_size);
|
|
//}
|
|
|
|
template <> int repack<block_iq4_nl, 8, 8>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_iq4_nl_to_iq4_nl_8_bl(t, 8, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_mxfp4, 4, 4>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_mxfp4_to_mxfp4_4_bl(t, 4, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_mxfp4, 8, 8>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_mxfp4_to_mxfp4_8_bl(t, 8, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q8_0, 4, 4>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q8_0_to_q8_0_4_bl(t, 4, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q8_0, 8, 4>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q8_0_to_q8_0_4_bl(t, 8, data, data_size);
|
|
}
|
|
|
|
#if defined __riscv_zvfh
|
|
template <> int repack<block_q4_0, 1, 16>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q4_0_to_q4_0_16_bl(t, 1, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q4_K, 1, 16>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q4_K_to_q4_K_16_bl(t, 1, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_iq4_nl, 1, 16>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_iq4_nl_to_iq4_nl_16_bl(t, 1, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q8_0, 1, 16>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q8_0_to_q8_0_16_bl(t, 1, data, data_size);
|
|
}
|
|
|
|
template <> int repack<block_q2_K, 1, 16>(struct ggml_tensor * t, const void * data, size_t data_size) {
|
|
return repack_q2_K_to_q2_K_16_bl(t, 1, data, data_size);
|
|
}
|
|
#endif
|
|
|
|
// gemv
|
|
template <typename BLOC_TYPE, int64_t INTER_SIZE, int64_t NB_COLS, ggml_type PARAM_TYPE>
|
|
void gemv(int, float *, size_t, const void *, const void *, int, int);
|
|
|
|
template <> void gemv<block_q4_0, 4, 4, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q4_0_4x4_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q4_0, 8, 4, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q4_0_4x8_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q4_0, 8, 8, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q4_0_8x8_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <>
|
|
void gemv<block_q2_K, 8, 8, GGML_TYPE_Q8_K>(int n,
|
|
float * s,
|
|
size_t bs,
|
|
const void * vx,
|
|
const void * vy,
|
|
int nr,
|
|
int nc) {
|
|
ggml_gemv_q2_K_8x8_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q4_K, 4, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q4_K_8x4_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q4_K, 8, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q4_K_8x8_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q5_K, 4, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q5_K_8x4_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q5_K, 8, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q5_K_8x8_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q6_K, 4, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q6_K_8x4_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q6_K, 8, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q6_K_8x8_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_iq4_nl, 4, 4, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_iq4_nl_4x4_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_iq4_nl, 8, 8, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_iq4_nl_8x8_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_mxfp4, 4, 4, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_mxfp4_4x4_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_mxfp4, 8, 8, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_mxfp4_8x8_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q8_0, 4, 4, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q8_0_4x4_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q8_0, 8, 4, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q8_0_4x8_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
#if defined __riscv_zvfh
|
|
template <> void gemv<block_q4_0, 1, 16, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q4_0_16x1_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q4_K, 1, 16, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q4_K_16x1_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_iq4_nl, 1, 16, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_iq4_nl_16x1_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q8_0, 1, 16, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q8_0_16x1_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemv<block_q2_K, 1, 16, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemv_q2_K_16x1_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
#endif
|
|
|
|
// gemm
|
|
template <typename BLOC_TYPE, int64_t INTER_SIZE, int64_t NB_COLS, ggml_type PARAM_TYPE>
|
|
void gemm(int, float *, size_t, const void *, const void *, int, int);
|
|
|
|
template <> void gemm<block_q4_0, 4, 4, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q4_0_4x4_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q4_0, 8, 4, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q4_0_4x8_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <>
|
|
void gemm<block_q4_0, 8, 8, GGML_TYPE_Q8_0>(int n,
|
|
float * s,
|
|
size_t bs,
|
|
const void * vx,
|
|
const void * vy,
|
|
int nr,
|
|
int nc) {
|
|
ggml_gemm_q4_0_8x8_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q2_K, 8, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q2_K_8x8_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q4_K, 4, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q4_K_8x4_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q4_K, 8, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q4_K_8x8_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q5_K, 4, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q5_K_8x4_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q5_K, 8, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q5_K_8x8_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q6_K, 4, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q6_K_8x4_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q6_K, 8, 8, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q6_K_8x8_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_iq4_nl, 4, 4, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_iq4_nl_4x4_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_iq4_nl, 8, 8, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_iq4_nl_8x8_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_mxfp4, 4, 4, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_mxfp4_4x4_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_mxfp4, 8, 8, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_mxfp4_8x8_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q8_0, 4, 4, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q8_0_4x4_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q8_0, 8, 4, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q8_0_4x8_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
#if defined __riscv_zvfh
|
|
template <> void gemm<block_q4_0, 1, 16, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q4_0_16x1_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q4_K, 1, 16, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q4_K_16x1_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_iq4_nl, 1, 16, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_iq4_nl_16x1_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q8_0, 1, 16, GGML_TYPE_Q8_0>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q8_0_16x1_q8_0(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
|
|
template <> void gemm<block_q2_K, 1, 16, GGML_TYPE_Q8_K>(int n, float * s, size_t bs, const void * vx, const void * vy, int nr, int nc) {
|
|
ggml_gemm_q2_K_16x1_q8_K(n, s, bs, vx, vy, nr, nc);
|
|
}
|
|
#endif
|
|
|
|
class tensor_traits_base : public ggml::cpu::tensor_traits {
|
|
public:
|
|
virtual int repack(struct ggml_tensor * t, const void * data, size_t data_size) = 0;
|
|
};
|
|
|
|
template <typename BLOC_TYPE, int64_t INTER_SIZE, int64_t NB_COLS, ggml_type PARAM_TYPE> class tensor_traits : public tensor_traits_base {
|
|
|
|
bool work_size(int /* n_threads */, const struct ggml_tensor * op, size_t & size) override {
|
|
// not realy a GGML_TYPE_Q8_0 but same size.
|
|
switch (op->op) {
|
|
case GGML_OP_MUL_MAT:
|
|
{
|
|
size = ggml_row_size(PARAM_TYPE, ggml_nelements(op->src[1]));
|
|
return true;
|
|
}
|
|
case GGML_OP_MUL_MAT_ID:
|
|
{
|
|
size = ggml_row_size(PARAM_TYPE, ggml_nelements(op->src[1]));
|
|
size = GGML_PAD(size, sizeof(int64_t)); // + padding for next block.
|
|
|
|
const int64_t ne02 = op->src[0]->ne[2]; // n_as, n_expert
|
|
const int64_t ne12 = op->src[1]->ne[2]; // n_tokens
|
|
|
|
const size_t sizeof_mmid_row_mapping = sizeof(int64_t);
|
|
|
|
size += sizeof_mmid_row_mapping*ne02*(ne12 + 1);
|
|
|
|
return true;
|
|
}
|
|
default:
|
|
// GGML_ABORT("fatal error");
|
|
break;
|
|
}
|
|
return false;
|
|
}
|
|
|
|
bool compute_forward(struct ggml_compute_params * params, struct ggml_tensor * op) override {
|
|
switch (op->op) {
|
|
case GGML_OP_MUL_MAT:
|
|
forward_mul_mat(params, op);
|
|
return true;
|
|
case GGML_OP_MUL_MAT_ID:
|
|
forward_mul_mat_id(params, op);
|
|
return true;
|
|
default:
|
|
// GGML_ABORT("fatal error");
|
|
break;
|
|
}
|
|
return false;
|
|
}
|
|
|
|
void forward_mul_mat_one_chunk(ggml_compute_params * params,
|
|
ggml_tensor * op,
|
|
int64_t src0_start,
|
|
int64_t src0_end,
|
|
int64_t src1_start,
|
|
int64_t src1_end) {
|
|
const ggml_tensor * src0 = op->src[0];
|
|
const ggml_tensor * src1 = op->src[1];
|
|
ggml_tensor * dst = op;
|
|
|
|
GGML_TENSOR_BINARY_OP_LOCALS
|
|
|
|
const size_t src1_col_stride = ggml_row_size(PARAM_TYPE, ne10);
|
|
|
|
GGML_ASSERT(ne03 == 1 && ne13 == 1);
|
|
GGML_ASSERT(ne12 % ne02 == 0);
|
|
const int64_t r2 = ne12 / ne02;
|
|
|
|
const int64_t i12 = src1_start / ne1;
|
|
const int64_t i11 = src1_start - i12 * ne1;
|
|
|
|
// Determine batch index
|
|
const int64_t i02 = i12 / r2;
|
|
|
|
const int64_t i1 = i11;
|
|
const int64_t i2 = i12;
|
|
|
|
const char * src0_ptr = (const char *) src0->data + i02 * nb02;
|
|
const char * src1_ptr = (const char *) params->wdata + (i11 + i12 * ne11) * src1_col_stride;
|
|
char * dst_ptr = ((char *) dst->data + (i1 * nb1 + i2 * nb2));
|
|
|
|
const int64_t nrows = src1_end - src1_start;
|
|
const int64_t ncols = src0_end - src0_start;
|
|
|
|
GGML_ASSERT(src1_ptr + src1_col_stride * nrows <= (const char *) params->wdata + params->wsize);
|
|
|
|
// If there are more than three rows in src1, use gemm; otherwise, use gemv.
|
|
if (nrows > 3) {
|
|
gemm<BLOC_TYPE, INTER_SIZE, NB_COLS, PARAM_TYPE>(ne00, (float *) (dst_ptr) + src0_start, nb1 / nb0,
|
|
src0_ptr + src0_start * nb01, src1_ptr,
|
|
nrows - (nrows % 4), ncols);
|
|
}
|
|
for (int iter = nrows - (nrows % 4); iter < nrows; iter++) {
|
|
gemv<BLOC_TYPE, INTER_SIZE, NB_COLS, PARAM_TYPE>(ne00, (float *) (dst_ptr + (iter * nb1)) + src0_start,
|
|
ne01, src0_ptr + src0_start * nb01,
|
|
src1_ptr + (src1_col_stride * iter), 1 /* nrows */, ncols);
|
|
}
|
|
}
|
|
|
|
void forward_mul_mat(ggml_compute_params * params, ggml_tensor * op) {
|
|
const ggml_tensor * src0 = op->src[0];
|
|
const ggml_tensor * src1 = op->src[1];
|
|
ggml_tensor * dst = op;
|
|
|
|
GGML_TENSOR_BINARY_OP_LOCALS
|
|
|
|
const int ith = params->ith;
|
|
const int nth = params->nth;
|
|
|
|
GGML_ASSERT(ne0 == ne01);
|
|
GGML_ASSERT(ne1 == ne11);
|
|
GGML_ASSERT(ne2 == ne12);
|
|
GGML_ASSERT(ne3 == ne13);
|
|
|
|
// dst cannot be transposed or permuted
|
|
GGML_ASSERT(nb0 == sizeof(float));
|
|
GGML_ASSERT(nb0 <= nb1);
|
|
GGML_ASSERT(nb1 <= nb2);
|
|
GGML_ASSERT(nb2 <= nb3);
|
|
|
|
// TODO: General batched mul mat for 4D tensors
|
|
// Currently only supports 3D tensors
|
|
GGML_ASSERT(ne03 == 1);
|
|
GGML_ASSERT(ne13 == 1);
|
|
GGML_ASSERT(ne3 == 1);
|
|
|
|
GGML_ASSERT(src1->type == GGML_TYPE_F32);
|
|
|
|
GGML_ASSERT(ggml_n_dims(op->src[0]) == 2);
|
|
// GGML_ASSERT(ggml_n_dims(op->src[1]) == 2);
|
|
|
|
char * wdata = static_cast<char *>(params->wdata);
|
|
const size_t nbw1 = ggml_row_size(PARAM_TYPE, ne10);
|
|
const size_t nbw2 = nbw1 * ne11;
|
|
|
|
assert(params->wsize >= nbw2 * ne12);
|
|
|
|
const ggml_from_float_t from_float = ggml_get_type_traits_cpu(PARAM_TYPE)->from_float;
|
|
|
|
// INFO: Quantization is done in planes to avoid extra complexity in chunking.
|
|
// Flattening dimensions not multiple of INTER_SIZE would require extra handling depending on how
|
|
// the planes are broadcast.
|
|
for (int64_t i12 = 0; i12 < ne12; i12++) {
|
|
char * data_ptr = (char *) src1->data + i12 * nb12;
|
|
char * wdata_ptr = wdata + i12 * nbw2;
|
|
|
|
for (int64_t i11 = ith * 4; i11 < ne11 - ne11 % 4; i11 += nth * 4) {
|
|
ggml_quantize_mat_t<INTER_SIZE, PARAM_TYPE>((float *) (data_ptr + i11 * nb11),
|
|
(void *) (wdata_ptr + i11 * nbw1), 4, ne10);
|
|
}
|
|
|
|
const int64_t i11_processed = ne11 - ne11 % 4;
|
|
for (int64_t i11 = i11_processed + ith; i11 < ne11; i11 += nth) {
|
|
from_float((float *) (data_ptr + i11 * nb11), (void *) (wdata_ptr + i11 * nbw1), ne10);
|
|
}
|
|
}
|
|
|
|
// disable for NUMA
|
|
const bool disable_chunking = ggml_is_numa();
|
|
|
|
// 4x chunks per thread
|
|
const int64_t nr0 = ggml_nrows(op->src[0]);
|
|
|
|
int nth_scaled = nth * 4;
|
|
int64_t chunk_size0 = (nr0 + nth_scaled - 1) / nth_scaled;
|
|
int64_t nchunk0 = (nr0 + chunk_size0 - 1) / chunk_size0;
|
|
|
|
// src1 is chunked only by full planes.
|
|
// When we flatten we need to address dimensions not multiple of the q8 INTER_SIZE
|
|
// to route them thorugh GEMV.
|
|
// nchunk1 = ne12 also avoids messing the chunking for models with no 3d tensors
|
|
// to avoid affecting their performance
|
|
int64_t nchunk1 = ne12;
|
|
|
|
// Ensure minimum chunk size to avoid alignment issues with high thread counts
|
|
// Minimum chunk size should be at least NB_COLS to prevent overlapping chunks after alignment
|
|
const int64_t min_chunk_size = NB_COLS;
|
|
if (nchunk0 > 0 && (nr0 / nchunk0) < min_chunk_size && nr0 >= min_chunk_size) {
|
|
nchunk0 = (nr0 + min_chunk_size - 1) / min_chunk_size;
|
|
}
|
|
|
|
int64_t dr0 = (nr0 + nchunk0 - 1) / nchunk0;
|
|
// Only increase nchunk0 to nth if it won't make chunks too small
|
|
if (nth == 1 || ((nchunk0 < nth || disable_chunking) && (nr0 + nth - 1) / nth >= min_chunk_size)) {
|
|
nchunk0 = nth;
|
|
dr0 = (nr0 + nchunk0 - 1) / nchunk0;
|
|
}
|
|
|
|
// Ensure nchunk doesn't exceed the number of rows divided by minimum chunk size
|
|
// This prevents creating too many tiny chunks that could overlap after alignment
|
|
const int64_t max_nchunk = (nr0 + min_chunk_size - 1) / min_chunk_size;
|
|
nchunk0 = MIN(nchunk0, max_nchunk);
|
|
|
|
if (ith == 0) {
|
|
// Every thread starts at ith, so the first unprocessed chunk is nth. This save a bit of coordination right at the start.
|
|
ggml_threadpool_chunk_set(params->threadpool, nth);
|
|
}
|
|
|
|
ggml_barrier(params->threadpool);
|
|
|
|
// The first chunk comes from our thread_id, the rest will get auto-assigned.
|
|
int current_chunk = ith;
|
|
|
|
while (current_chunk < nchunk0 * nchunk1) {
|
|
const int64_t ith0 = current_chunk % nchunk0;
|
|
const int64_t ith1 = current_chunk / nchunk0;
|
|
|
|
int64_t src0_start = dr0 * ith0;
|
|
int64_t src0_end = MIN(src0_start + dr0, nr0);
|
|
|
|
// full-plane range for src1
|
|
int64_t src1_start = ith1 * ne11;
|
|
int64_t src1_end = (ith1 + 1) * ne11;
|
|
|
|
// Align boundaries to NB_COLS - round up to ensure all data is included
|
|
// The chunk size limiting above ensures chunks are large enough to prevent overlaps
|
|
src0_start = (src0_start % NB_COLS) ? src0_start + NB_COLS - (src0_start % NB_COLS) : src0_start;
|
|
src0_end = (src0_end % NB_COLS) ? src0_end + NB_COLS - (src0_end % NB_COLS) : src0_end;
|
|
src0_end = MIN(src0_end, ne01);
|
|
|
|
// Make sure current plane is the last one before exiting
|
|
if (src0_start >= src0_end) {
|
|
current_chunk = ggml_threadpool_chunk_add(params->threadpool, 1);
|
|
continue;
|
|
}
|
|
|
|
forward_mul_mat_one_chunk(params, dst, src0_start, src0_end, src1_start, src1_end);
|
|
|
|
current_chunk = ggml_threadpool_chunk_add(params->threadpool, 1);
|
|
}
|
|
}
|
|
|
|
void forward_mul_mat_id(ggml_compute_params * params, ggml_tensor * op) {
|
|
const ggml_tensor * src0 = op->src[0];
|
|
const ggml_tensor * src1 = op->src[1];
|
|
const ggml_tensor * ids = op->src[2];
|
|
ggml_tensor * dst = op;
|
|
|
|
GGML_TENSOR_BINARY_OP_LOCALS
|
|
|
|
const int ith = params->ith;
|
|
const int nth = params->nth;
|
|
|
|
const ggml_from_float_t from_float = ggml_get_type_traits_cpu(PARAM_TYPE)->from_float;
|
|
|
|
// we don't support permuted src0 or src1
|
|
GGML_ASSERT(nb00 == ggml_type_size(src0->type));
|
|
GGML_ASSERT(nb10 == ggml_type_size(src1->type));
|
|
|
|
// dst cannot be transposed or permuted
|
|
GGML_ASSERT(nb0 == sizeof(float));
|
|
GGML_ASSERT(nb0 <= nb1);
|
|
GGML_ASSERT(nb1 <= nb2);
|
|
GGML_ASSERT(nb2 <= nb3);
|
|
|
|
GGML_ASSERT(ne03 == 1);
|
|
GGML_ASSERT(ne13 == 1);
|
|
GGML_ASSERT(ne3 == 1);
|
|
|
|
GGML_ASSERT(src1->type == GGML_TYPE_F32);
|
|
|
|
// row groups
|
|
const int n_ids = ids->ne[0]; // n_expert_used
|
|
const int n_as = ne02; // n_expert
|
|
|
|
const size_t nbw1 = ggml_row_size(PARAM_TYPE, ne10);
|
|
const size_t nbw2 = nbw1*ne11;
|
|
const size_t nbw3 = nbw2*ne12;
|
|
|
|
struct mmid_row_mapping {
|
|
int32_t i1;
|
|
int32_t i2;
|
|
};
|
|
|
|
GGML_ASSERT(params->wsize >=
|
|
(GGML_PAD(nbw3, sizeof(int64_t)) +
|
|
n_as*(ne12 + 1)*sizeof(mmid_row_mapping))
|
|
);
|
|
|
|
auto * wdata = (char *)params->wdata;
|
|
auto * wdata_src1_end = (char *)wdata + GGML_PAD(nbw3, sizeof(int64_t));
|
|
|
|
// total of [n_as][ne12 + 1] elements of type mmid_row_mapping (2*int32_t = int64_t)
|
|
auto * matrix_row_counts = (int64_t *) (wdata_src1_end); // [n_as]
|
|
struct mmid_row_mapping * matrix_rows = (struct mmid_row_mapping *) (matrix_row_counts + n_as); // [n_as][ne12]
|
|
|
|
// src1: float32 => param type
|
|
for (int64_t i12 = 0; i12 < ne12; ++i12) {
|
|
for (int64_t i11 = ith; i11 < ne11; i11 += nth) {
|
|
from_float((float *)((char *) src1->data + i12 * nb12 + i11 * nb11),
|
|
(void *) (wdata + i12 * nbw2 + i11 * nbw1),
|
|
ne10);
|
|
}
|
|
}
|
|
|
|
#define MMID_MATRIX_ROW(row_id, i1) matrix_rows[(row_id) * ne12 + (i1)]
|
|
|
|
if (ith == 0) {
|
|
// initialize matrix_row_counts
|
|
memset(matrix_row_counts, 0, n_as * sizeof(int64_t));
|
|
|
|
// group rows by src0 matrix
|
|
for (int32_t iid1 = 0; iid1 < ids->ne[1]; ++iid1) {
|
|
for (int32_t id = 0; id < n_ids; ++id) {
|
|
const int32_t i02 =
|
|
*(const int32_t *) ((const char *) ids->data + iid1 * ids->nb[1] + id * ids->nb[0]);
|
|
|
|
GGML_ASSERT(i02 >= 0 && i02 < n_as);
|
|
|
|
MMID_MATRIX_ROW(i02, matrix_row_counts[i02]) = { id, iid1 };
|
|
matrix_row_counts[i02] += 1;
|
|
}
|
|
}
|
|
}
|
|
|
|
ggml_barrier(params->threadpool);
|
|
|
|
// compute each matrix multiplication in sequence
|
|
for (int cur_a = 0; cur_a < n_as; ++cur_a) {
|
|
const int64_t cne1 = matrix_row_counts[cur_a];
|
|
|
|
if (cne1 == 0) {
|
|
continue;
|
|
}
|
|
|
|
const auto * src0_cur = (const char *) src0->data + cur_a*nb02;
|
|
|
|
//const int64_t nr0 = ne01; // src0 rows
|
|
const int64_t nr1 = cne1; // src1 rows
|
|
|
|
int64_t src0_cur_start = (ith * ne01) / nth;
|
|
int64_t src0_cur_end = ((ith + 1) * ne01) / nth;
|
|
|
|
// Align boundaries to NB_COLS - round up to ensure all data is included
|
|
src0_cur_start = (src0_cur_start % NB_COLS) ? src0_cur_start + NB_COLS - (src0_cur_start % NB_COLS) : src0_cur_start;
|
|
src0_cur_end = (src0_cur_end % NB_COLS) ? src0_cur_end + NB_COLS - (src0_cur_end % NB_COLS) : src0_cur_end;
|
|
if (src0_cur_end > ne01) {
|
|
src0_cur_end = ne01;
|
|
}
|
|
|
|
if (src0_cur_start >= src0_cur_end) {
|
|
return;
|
|
}
|
|
|
|
for (int ir1 = 0; ir1 < nr1; ir1++) {
|
|
struct mmid_row_mapping row_mapping = MMID_MATRIX_ROW(cur_a, ir1);
|
|
|
|
const int id = row_mapping.i1; // selected expert index
|
|
|
|
const int64_t i11 = id % ne11;
|
|
const int64_t i12 = row_mapping.i2; // row index in src1
|
|
|
|
const int64_t i1 = id; // selected expert index
|
|
const int64_t i2 = i12; // row
|
|
|
|
const auto * src1_col = (const char *) wdata + (i11 * nbw1 + i12 * nbw2);
|
|
|
|
gemv<BLOC_TYPE, INTER_SIZE, NB_COLS, PARAM_TYPE>(
|
|
ne00, (float *) ((char *) dst->data + (i1 * nb1 + i2 * nb2)) + src0_cur_start, ne01,
|
|
src0_cur + src0_cur_start * nb01, src1_col, 1, src0_cur_end - src0_cur_start);
|
|
}
|
|
}
|
|
#undef MMID_MATRIX_ROW
|
|
}
|
|
|
|
int repack(struct ggml_tensor * t, const void * data, size_t data_size) override {
|
|
GGML_LOG_DEBUG("%s: repack tensor %s with %s_%dx%d\n", __func__, t->name, ggml_type_name(t->type),
|
|
(int) NB_COLS, (int) INTER_SIZE);
|
|
return ggml::cpu::repack::repack<BLOC_TYPE, INTER_SIZE, NB_COLS>(t, data, data_size);
|
|
}
|
|
};
|
|
|
|
} // namespace ggml::cpu::repack
|
|
|
|
static const ggml::cpu::tensor_traits * ggml_repack_get_optimal_repack_type(const struct ggml_tensor * cur) {
|
|
// instance for Q4
|
|
static const ggml::cpu::repack::tensor_traits<block_q4_0, 4, 4, GGML_TYPE_Q8_0> q4_0_4x4_q8_0;
|
|
static const ggml::cpu::repack::tensor_traits<block_q4_0, 8, 4, GGML_TYPE_Q8_0> q4_0_4x8_q8_0;
|
|
static const ggml::cpu::repack::tensor_traits<block_q4_0, 8, 8, GGML_TYPE_Q8_0> q4_0_8x8_q8_0;
|
|
|
|
// instance for Q4_K
|
|
static const ggml::cpu::repack::tensor_traits<block_q4_K, 4, 8, GGML_TYPE_Q8_K> q4_K_8x4_q8_K;
|
|
static const ggml::cpu::repack::tensor_traits<block_q4_K, 8, 8, GGML_TYPE_Q8_K> q4_K_8x8_q8_K;
|
|
|
|
// instance for Q5_K
|
|
static const ggml::cpu::repack::tensor_traits<block_q5_K, 4, 8, GGML_TYPE_Q8_K> q5_K_8x4_q8_K;
|
|
static const ggml::cpu::repack::tensor_traits<block_q5_K, 8, 8, GGML_TYPE_Q8_K> q5_K_8x8_q8_K;
|
|
|
|
// instance for Q6_K
|
|
static const ggml::cpu::repack::tensor_traits<block_q6_K, 4, 8, GGML_TYPE_Q8_K> q6_K_8x4_q8_K;
|
|
static const ggml::cpu::repack::tensor_traits<block_q6_K, 8, 8, GGML_TYPE_Q8_K> q6_K_8x8_q8_K;
|
|
|
|
// instance for Q2
|
|
static const ggml::cpu::repack::tensor_traits<block_q2_K, 8, 8, GGML_TYPE_Q8_K> q2_K_8x8_q8_K;
|
|
|
|
// instance for IQ4
|
|
static const ggml::cpu::repack::tensor_traits<block_iq4_nl, 4, 4, GGML_TYPE_Q8_0> iq4_nl_4x4_q8_0;
|
|
static const ggml::cpu::repack::tensor_traits<block_iq4_nl, 8, 8, GGML_TYPE_Q8_0> iq4_nl_8x8_q8_0;
|
|
|
|
// instance for MXFP4
|
|
static const ggml::cpu::repack::tensor_traits<block_mxfp4, 4, 4, GGML_TYPE_Q8_0> mxfp4_4x4_q8_0;
|
|
static const ggml::cpu::repack::tensor_traits<block_mxfp4, 8, 8, GGML_TYPE_Q8_0> mxfp4_8x8_q8_0;
|
|
|
|
// instance for Q8_0
|
|
static const ggml::cpu::repack::tensor_traits<block_q8_0, 4, 4, GGML_TYPE_Q8_0> q8_0_4x4_q8_0;
|
|
static const ggml::cpu::repack::tensor_traits<block_q8_0, 8, 4, GGML_TYPE_Q8_0> q8_0_4x8_q8_0;
|
|
|
|
// instances for RISC-V
|
|
//
|
|
// These implement outer-product style matrix multiplication kernels with
|
|
// an interleave of 1.
|
|
#if defined __riscv_zvfh
|
|
static const ggml::cpu::repack::tensor_traits<block_q4_0, 1, 16, GGML_TYPE_Q8_0> q4_0_16x1_q8_0;
|
|
static const ggml::cpu::repack::tensor_traits<block_q4_K, 1, 16, GGML_TYPE_Q8_K> q4_K_16x1_q8_K;
|
|
static const ggml::cpu::repack::tensor_traits<block_iq4_nl, 1, 16, GGML_TYPE_Q8_0> iq4_nl_16x1_q8_0;
|
|
static const ggml::cpu::repack::tensor_traits<block_q8_0, 1, 16, GGML_TYPE_Q8_0> q8_0_16x1_q8_0;
|
|
static const ggml::cpu::repack::tensor_traits<block_q2_K, 1, 16, GGML_TYPE_Q8_K> q2_K_16x1_q8_K;
|
|
#endif
|
|
|
|
if (cur->type == GGML_TYPE_Q4_0) {
|
|
if (ggml_cpu_has_avx2() || (ggml_cpu_has_sve() && ggml_cpu_has_matmul_int8() && ggml_cpu_get_sve_cnt() == QK8_0)) {
|
|
if (cur->ne[1] % 8 == 0) {
|
|
return &q4_0_8x8_q8_0;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_neon() && ggml_cpu_has_matmul_int8()) {
|
|
if (cur->ne[1] % 4 == 0) {
|
|
return &q4_0_4x8_q8_0;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_neon() && ggml_cpu_has_dotprod()) {
|
|
if (cur->ne[1] % 4 == 0) {
|
|
return &q4_0_4x4_q8_0;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_riscv_v()) {
|
|
#if defined __riscv_zvfh
|
|
switch (__riscv_vlenb() * 8) {
|
|
case 128: { break; } // TODO
|
|
case 256: { if (cur->ne[1] % 16 == 0) { return &q4_0_16x1_q8_0; } break; }
|
|
case 512: { break; } // TODO
|
|
case 1024: { break; } // TODO
|
|
default: { return nullptr; }
|
|
}
|
|
#endif
|
|
}
|
|
} else if (cur->type == GGML_TYPE_Q4_K) {
|
|
if (ggml_cpu_has_avx2()) {
|
|
if (cur->ne[1] % 8 == 0) {
|
|
return &q4_K_8x8_q8_K;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_neon() && ggml_cpu_has_matmul_int8()) {
|
|
if (cur->ne[1] % 8 == 0) {
|
|
return &q4_K_8x8_q8_K;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_neon() && ggml_cpu_has_dotprod()) {
|
|
if (cur->ne[1] % 8 == 0) {
|
|
return &q4_K_8x4_q8_K;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_riscv_v()) {
|
|
#if defined __riscv_zvfh
|
|
switch (__riscv_vlenb() * 8) {
|
|
case 128: { break; } // TODO
|
|
case 256: { if (cur->ne[1] % 16 == 0) { return &q4_K_16x1_q8_K; } break; }
|
|
case 512: { break; } // TODO
|
|
case 1024: { break; } // TODO
|
|
default: { return nullptr; }
|
|
}
|
|
#endif
|
|
}
|
|
} else if (cur->type == GGML_TYPE_Q2_K) {
|
|
if (ggml_cpu_has_avx512()) {
|
|
if (cur->ne[1] % 8 == 0) {
|
|
return &q2_K_8x8_q8_K;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_riscv_v()) {
|
|
#if defined __riscv_zvfh
|
|
switch (__riscv_vlenb() * 8) {
|
|
case 128: { break; } // TODO
|
|
case 256: { if (cur->ne[1] % 16 == 0) { return &q2_K_16x1_q8_K; } break; }
|
|
case 512: { break; } // TODO
|
|
case 1024: { break; } // TODO
|
|
default: { return nullptr; }
|
|
}
|
|
#endif
|
|
}
|
|
} else if (cur->type == GGML_TYPE_Q5_K) {
|
|
if (ggml_cpu_has_neon() && ggml_cpu_has_matmul_int8()) {
|
|
if (cur->ne[1] % 8 == 0) {
|
|
return &q5_K_8x8_q8_K;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_neon() && ggml_cpu_has_dotprod()) {
|
|
if (cur->ne[1] % 8 == 0) {
|
|
return &q5_K_8x4_q8_K;
|
|
}
|
|
}
|
|
} else if (cur->type == GGML_TYPE_Q6_K) {
|
|
if (ggml_cpu_has_neon() && ggml_cpu_has_matmul_int8()) {
|
|
if (cur->ne[1] % 8 == 0) {
|
|
return &q6_K_8x8_q8_K;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_neon() && ggml_cpu_has_dotprod()) {
|
|
if (cur->ne[1] % 8 == 0) {
|
|
return &q6_K_8x4_q8_K;
|
|
}
|
|
}
|
|
} else if (cur->type == GGML_TYPE_IQ4_NL) {
|
|
if (ggml_cpu_has_avx2()) {
|
|
if (cur->ne[1] % 8 == 0) {
|
|
return &iq4_nl_8x8_q8_0;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_neon() && ggml_cpu_has_dotprod()) {
|
|
if (cur->ne[1] % 4 == 0) {
|
|
return &iq4_nl_4x4_q8_0;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_riscv_v()) {
|
|
#if defined __riscv_zvfh
|
|
switch (__riscv_vlenb() * 8) {
|
|
case 128: { break; } // TODO
|
|
case 256: { if (cur->ne[1] % 16 == 0) { return &iq4_nl_16x1_q8_0; } break; }
|
|
case 512: { break; } // TODO
|
|
case 1024: { break; } // TODO
|
|
default: { return nullptr; }
|
|
}
|
|
#endif
|
|
}
|
|
} else if (cur->type == GGML_TYPE_MXFP4) {
|
|
if (ggml_cpu_has_avx2()) {
|
|
if (cur->ne[1] % 8 == 0) {
|
|
return &mxfp4_8x8_q8_0;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_neon() && ggml_cpu_has_dotprod()) {
|
|
if (cur->ne[1] % 4 == 0) {
|
|
return &mxfp4_4x4_q8_0;
|
|
}
|
|
}
|
|
} else if (cur->type == GGML_TYPE_Q8_0) {
|
|
if (ggml_cpu_has_neon() && ggml_cpu_has_matmul_int8()) {
|
|
if (cur->ne[1] % 4 == 0) {
|
|
return &q8_0_4x8_q8_0;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_neon() && ggml_cpu_has_dotprod()) {
|
|
if (cur->ne[1] % 4 == 0) {
|
|
return &q8_0_4x4_q8_0;
|
|
}
|
|
}
|
|
if (ggml_cpu_has_riscv_v()) {
|
|
#if defined __riscv_zvfh
|
|
switch (__riscv_vlenb() * 8) {
|
|
case 128: { break; } // TODO
|
|
case 256: { if (cur->ne[1] % 16 == 0) { return &q8_0_16x1_q8_0; } break; }
|
|
case 512: { break; } // TODO
|
|
case 1024: { break; } // TODO
|
|
default: { return nullptr; }
|
|
}
|
|
#endif
|
|
}
|
|
}
|
|
|
|
return nullptr;
|
|
}
|
|
|
|
static enum ggml_status ggml_backend_cpu_repack_buffer_init_tensor(ggml_backend_buffer_t buffer, struct ggml_tensor * tensor) {
|
|
tensor->extra = (void *) const_cast<ggml::cpu::tensor_traits *>(ggml_repack_get_optimal_repack_type(tensor));
|
|
|
|
GGML_UNUSED(buffer);
|
|
return GGML_STATUS_SUCCESS;
|
|
}
|
|
|
|
static void ggml_backend_cpu_repack_buffer_set_tensor(ggml_backend_buffer_t buffer, struct ggml_tensor * tensor,
|
|
const void * data, size_t offset, size_t size) {
|
|
GGML_ASSERT(offset == 0);
|
|
GGML_ASSERT(size == ggml_nbytes(tensor));
|
|
|
|
auto tensor_traits = (ggml::cpu::repack::tensor_traits_base *) tensor->extra;
|
|
auto OK = tensor_traits->repack(tensor, data, size);
|
|
|
|
GGML_ASSERT(OK == 0);
|
|
GGML_UNUSED(buffer);
|
|
}
|
|
|
|
static const char * ggml_backend_cpu_repack_buffer_type_get_name(ggml_backend_buffer_type_t buft) {
|
|
return "CPU_REPACK";
|
|
|
|
GGML_UNUSED(buft);
|
|
}
|
|
|
|
static ggml_backend_buffer_t ggml_backend_cpu_repack_buffer_type_alloc_buffer(ggml_backend_buffer_type_t buft, size_t size) {
|
|
ggml_backend_buffer_t buffer = ggml_backend_buft_alloc_buffer(ggml_backend_cpu_buffer_type(), size);
|
|
|
|
if (buffer == nullptr) {
|
|
return nullptr;
|
|
}
|
|
|
|
buffer->buft = buft;
|
|
buffer->iface.init_tensor = ggml_backend_cpu_repack_buffer_init_tensor;
|
|
buffer->iface.set_tensor = ggml_backend_cpu_repack_buffer_set_tensor;
|
|
buffer->iface.get_tensor = nullptr;
|
|
buffer->iface.cpy_tensor = nullptr;
|
|
return buffer;
|
|
}
|
|
|
|
static size_t ggml_backend_cpu_repack_buffer_type_get_alignment(ggml_backend_buffer_type_t buft) {
|
|
return TENSOR_ALIGNMENT;
|
|
|
|
GGML_UNUSED(buft);
|
|
}
|
|
|
|
namespace ggml::cpu::repack {
|
|
class extra_buffer_type : ggml::cpu::extra_buffer_type {
|
|
bool supports_op(ggml_backend_dev_t, const struct ggml_tensor * op) override {
|
|
if ( op->op == GGML_OP_MUL_MAT &&
|
|
op->src[0]->buffer &&
|
|
(ggml_n_dims(op->src[0]) == 2) &&
|
|
op->src[0]->buffer->buft == ggml_backend_cpu_repack_buffer_type() &&
|
|
ggml_repack_get_optimal_repack_type(op->src[0])
|
|
) {
|
|
if (op->src[1]->buffer && !ggml_backend_buft_is_host(op->src[1]->buffer->buft)) {
|
|
return false;
|
|
}
|
|
if (op->src[1]->type == GGML_TYPE_F32) {
|
|
return true;
|
|
}
|
|
//if (op->src[1]->type == GGML_TYPE_Q8_0) {
|
|
// return true;
|
|
//}
|
|
// may be possible if Q8_0 packed...
|
|
} else if (op->op == GGML_OP_MUL_MAT_ID
|
|
&& op->src[0]->buffer
|
|
&& (ggml_n_dims(op->src[0]) == 3)
|
|
&& op->src[0]->buffer->buft == ggml_backend_cpu_repack_buffer_type()
|
|
&& ggml_repack_get_optimal_repack_type(op->src[0])
|
|
) {
|
|
if (op->src[1]->buffer && !ggml_backend_buft_is_host(op->src[1]->buffer->buft)) {
|
|
return false;
|
|
}
|
|
if (op->src[1]->type == GGML_TYPE_F32) {
|
|
return true;
|
|
}
|
|
//if (op->src[1]->type == GGML_TYPE_Q8_0) {
|
|
// return true;
|
|
//}
|
|
}
|
|
return false;
|
|
}
|
|
|
|
ggml::cpu::tensor_traits * get_tensor_traits(const struct ggml_tensor * op) override {
|
|
if (op->op == GGML_OP_MUL_MAT || op->op == GGML_OP_MUL_MAT_ID) {
|
|
if (op->src[0]->buffer && op->src[0]->buffer->buft == ggml_backend_cpu_repack_buffer_type()) {
|
|
return (ggml::cpu::tensor_traits *) op->src[0]->extra;
|
|
}
|
|
}
|
|
return nullptr;
|
|
}
|
|
};
|
|
} // namespace ggml::cpu::repack
|
|
|
|
ggml_backend_buffer_type_t ggml_backend_cpu_repack_buffer_type(void) {
|
|
static struct ggml_backend_buffer_type ggml_backend_cpu_buffer_type_repack = {
|
|
/* .iface = */ {
|
|
/* .get_name = */ ggml_backend_cpu_repack_buffer_type_get_name,
|
|
/* .alloc_buffer = */ ggml_backend_cpu_repack_buffer_type_alloc_buffer,
|
|
/* .get_alignment = */ ggml_backend_cpu_repack_buffer_type_get_alignment,
|
|
/* .get_max_size = */ nullptr, // defaults to SIZE_MAX
|
|
/* .get_alloc_size = */ nullptr, // defaults to ggml_nbytes
|
|
/* .is_host = */ nullptr,
|
|
},
|
|
/* .device = */ ggml_backend_reg_dev_get(ggml_backend_cpu_reg(), 0),
|
|
/* .context = */ new ggml::cpu::repack::extra_buffer_type(),
|
|
};
|
|
|
|
return &ggml_backend_cpu_buffer_type_repack;
|
|
}
|