]> git.djapps.eu Git - pkg/ggml/sources/whisper.cpp/commit
CUDA: use LRU based eviction for cuda graphs (llama/21611)
authorAman Gupta <redacted>
Fri, 17 Apr 2026 15:24:21 +0000 (23:24 +0800)
committerGeorgi Gerganov <redacted>
Thu, 30 Apr 2026 08:29:12 +0000 (11:29 +0300)
commit918e0ad20954beaf4a57675749e0a54f12f4233b
tree80443f74244488fe745b5c4d19d2fb3ac4e770ee
parent77c0630ce64e63a63f16e30d9982608b5f6474fa
CUDA: use LRU based eviction for cuda graphs (llama/21611)

* CUDA: use a ring-buffer for cuda graphs

* bump limit to 128

* use LRU eviction

* better naming

* do periodic clean-up
ggml/src/ggml-cuda/common.cuh