llama.cpp/fattn-vec-f16.cuh at 24ecb58168dce81646c2ed425690a106591c8c6d - llama.cpp - Gitea: Git with a cup of tea

root/llama.cpp

mirror of https://github.com/ggerganov/llama.cpp.git synced 2024-11-11 21:39:52 +00:00

Johannes Gäßler dc685be466

CUDA: add FP32 FlashAttention vector kernel (#7188 )

* CUDA: add FP32 FlashAttention vector kernel

* fixup! CUDA: add FP32 FlashAttention vector kernel

* fixup! fixup! CUDA: add FP32 FlashAttention vector kernel

* fixup! fixup! fixup! CUDA: add FP32 FlashAttention vector kernel

2024-05-12 19:40:45 +02:00

6 lines

213 B

Plaintext

Raw Blame History

 #include "common.cuh"
 void ggml_cuda_flash_attn_ext_vec_f16(ggml_backend_cuda_context & ctx, ggml_tensor * dst);
 void ggml_cuda_flash_attn_ext_vec_f16_no_mma(ggml_backend_cuda_context & ctx, ggml_tensor * dst);