]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commit
CUDA: use LRU based eviction for cuda graphs (#21611)
authorAman Gupta <redacted>
Fri, 17 Apr 2026 15:24:21 +0000 (23:24 +0800)
committerGitHub <redacted>
Fri, 17 Apr 2026 15:24:21 +0000 (23:24 +0800)
commitb94050e8968f2ea7766d9d47058bf0013ade9333
tree355c7e99f4dc17504db40b3e64b984c371fec5d5
parenta279d0f0f4e746d1ef3429d8e9d02d2990b2daa7
CUDA: use LRU based eviction for cuda graphs (#21611)

* CUDA: use a ring-buffer for cuda graphs

* bump limit to 128

* use LRU eviction

* better naming

* do periodic clean-up
ggml/src/ggml-cuda/common.cuh