..
dpct
supprt Flash Attention for fp32/fp16/Q4/Q5/Q8 (llama/20190)
2026-03-16 13:10:15 +02:00
template-instances
sycl : add flash-attn support for head size 512 (llama/21654)
2026-04-30 11:29:04 +03:00
CMakeLists.txt
Fix Q8_0 reorder: garbage on 2nd prompt + crash on full VRAM (llama/21638)
2026-04-30 11:29:10 +03:00
add-id.cpp
sycl : fix wrong variable check by assert (llama/20903)
2026-03-29 15:04:36 +03:00
add-id.hpp
…
backend.hpp
ehance UPSCALE to support all UT cases (llama/20637)
2026-03-29 15:04:36 +03:00
binbcast.cpp
support permuted, remove check s0/s10 (llama/19889)
2026-02-27 20:57:58 +02:00
binbcast.hpp
…
common.cpp
…
common.hpp
Optimize Q4_0 mul_mat for Arc770, add scripts (llama/22291)
2026-04-30 11:29:19 +03:00
concat.cpp
…
concat.hpp
…
conv.cpp
…
conv.hpp
…
convert.cpp
sycl: Improve mul_mat_id memory efficiency and add BF16 fast path (llama/22119)
2026-04-30 11:29:16 +03:00
convert.hpp
sycl: Improve mul_mat_id memory efficiency and add BF16 fast path (llama/22119)
2026-04-30 11:29:16 +03:00
count-equal.cpp
supprt Flash Attention for fp32/fp16/Q4/Q5/Q8 (llama/20190)
2026-03-16 13:10:15 +02:00
count-equal.hpp
…
cpy.cpp
…
cpy.hpp
…
dequantize.hpp
Fix Q8_0 reorder: garbage on 2nd prompt + crash on full VRAM (llama/21638)
2026-04-30 11:29:10 +03:00
dmmv.cpp
Fix Q8_0 reorder: garbage on 2nd prompt + crash on full VRAM (llama/21638)
2026-04-30 11:29:10 +03:00
dmmv.hpp
…
element_wise.cpp
sycl: disable Q1_0 in backend and cleanup unused variables (llama/21807)
2026-04-30 11:29:07 +03:00
element_wise.hpp
ehance UPSCALE to support all UT cases (llama/20637)
2026-03-29 15:04:36 +03:00
fattn-common.hpp
supprt Flash Attention for fp32/fp16/Q4/Q5/Q8 (llama/20190)
2026-03-16 13:10:15 +02:00
fattn-tile.cpp
sycl : add flash-attn support for head size 512 (llama/21654)
2026-04-30 11:29:04 +03:00
fattn-tile.hpp
sycl : add flash-attn support for head size 512 (llama/21654)
2026-04-30 11:29:04 +03:00
fattn-vec.hpp
sycl : add flash-attn support for head size 512 (llama/21654)
2026-04-30 11:29:04 +03:00
fattn.cpp
sycl : add flash-attn support for head size 512 (llama/21654)
2026-04-30 11:29:04 +03:00
fattn.hpp
supprt Flash Attention for fp32/fp16/Q4/Q5/Q8 (llama/20190)
2026-03-16 13:10:15 +02:00
gated_delta_net.cpp
sycl: disable Q1_0 in backend and cleanup unused variables (llama/21807)
2026-04-30 11:29:07 +03:00
gated_delta_net.hpp
add op gated_delta_net (llama/20455)
2026-03-16 13:10:15 +02:00
gemm.hpp
sycl: Improve mul_mat_id memory efficiency and add BF16 fast path (llama/22119)
2026-04-30 11:29:16 +03:00
getrows.cpp
…
getrows.hpp
…
ggml-sycl.cpp
Optimize Q4_0 mul_mat for Arc770, add scripts (llama/22291)
2026-04-30 11:29:19 +03:00
gla.cpp
…
gla.hpp
…
im2col.cpp
…
im2col.hpp
…
mmq.cpp
…
mmq.hpp
…
mmvq.cpp
sycl : fused MoE mul_mat_vec_q for TG (llama/21920)
2026-04-30 11:29:17 +03:00
mmvq.hpp
sycl : fused MoE mul_mat_vec_q for TG (llama/21920)
2026-04-30 11:29:17 +03:00
norm.cpp
fix for failed UT case: ACC, L2_NORM, UPSCALE, fused_glu, unary (llama/20283)
2026-03-16 13:10:15 +02:00
norm.hpp
…
outprod.cpp
Remove support for Nvidia & AMD GPU, because the oneAPI plugin for Nvidia & AMD GPU is unavailable: download/installation channels are out of work. (llama/19246)
2026-02-08 09:29:10 +02:00
outprod.hpp
…
pad.cpp
…
pad.hpp
…
pad_reflect_1d.cpp
…
pad_reflect_1d.hpp
…
presets.hpp
supprt Flash Attention for fp32/fp16/Q4/Q5/Q8 (llama/20190)
2026-03-16 13:10:15 +02:00
quantize.hpp
…
quants.hpp
Add Q8_0 reorder optimization (~3x tg speedup on Intel Arc) (llama/21527)
2026-04-30 11:29:02 +03:00
repeat_back.cpp
…
repeat_back.hpp
…
roll.cpp
…
roll.hpp
…
rope.cpp
fix op rope, add rope_back (llama/20293)
2026-03-16 13:10:15 +02:00
rope.hpp
fix op rope, add rope_back (llama/20293)
2026-03-16 13:10:15 +02:00
set.cpp
…
set.hpp
…
set_rows.cpp
sycl: Improve mul_mat_id memory efficiency and add BF16 fast path (llama/22119)
2026-04-30 11:29:16 +03:00
set_rows.hpp
…
softmax.cpp
supprt Flash Attention for fp32/fp16/Q4/Q5/Q8 (llama/20190)
2026-03-16 13:10:15 +02:00
softmax.hpp
…
ssm_conv.cpp
…
ssm_conv.hpp
…
sycl_hw.cpp
Optimize Q4_0 mul_mat for Arc770, add scripts (llama/22291)
2026-04-30 11:29:19 +03:00
sycl_hw.hpp
Optimize Q4_0 mul_mat for Arc770, add scripts (llama/22291)
2026-04-30 11:29:19 +03:00
tsembd.cpp
…
tsembd.hpp
…
type.hpp
sycl : support nvfp4 type in mul_mat (llama/21227)
2026-04-30 11:28:59 +03:00
upscale.cpp
sycl: disable Q1_0 in backend and cleanup unused variables (llama/21807)
2026-04-30 11:29:07 +03:00
upscale.hpp
ehance UPSCALE to support all UT cases (llama/20637)
2026-03-29 15:04:36 +03:00
vecdotq.hpp
Add Q8_0 reorder optimization (~3x tg speedup on Intel Arc) (llama/21527)
2026-04-30 11:29:02 +03:00
wkv.cpp
Remove support for Nvidia & AMD GPU, because the oneAPI plugin for Nvidia & AMD GPU is unavailable: download/installation channels are out of work. (llama/19246)
2026-02-08 09:29:10 +02:00
wkv.hpp
…