]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commit
model : NvFP4 quantized LM head support (#23046)
authorynankani <redacted>
Sat, 16 May 2026 09:09:27 +0000 (09:09 +0000)
committerGitHub <redacted>
Sat, 16 May 2026 09:09:27 +0000 (11:09 +0200)
commit42928bc14d33bde7b8fe8ea436ca44b40357737e
tree50aa23949b519f164ae9f7332b3a1b9b018bb931
parent59778f0196a82db32580bb649d5d839355d6d7bf
model : NvFP4 quantized LM head support (#23046)

* NvFP4 quantized LM head support

Signed-off-by: ynankani <redacted>
* Address review commnets

Signed-off-by: ynankani <redacted>
* Add assert for NvFp4 lm head and tied embeddings

Signed-off-by: ynankani <redacted>
* Address review commnets

Signed-off-by: ynankani <redacted>
* Create output_s tensor only when LM head NvFp4

Signed-off-by: ynankani <redacted>
---------

Signed-off-by: ynankani <redacted>
103 files changed:
src/llama-model-saver.cpp
src/llama-model.cpp
src/llama-model.h
src/models/afmoe.cpp
src/models/apertus.cpp
src/models/arcee.cpp
src/models/arctic.cpp
src/models/arwkv7.cpp
src/models/baichuan.cpp
src/models/bailingmoe.cpp
src/models/bailingmoe2.cpp
src/models/bloom.cpp
src/models/chameleon.cpp
src/models/chatglm.cpp
src/models/codeshell.cpp
src/models/cogvlm.cpp
src/models/cohere2.cpp
src/models/command-r.cpp
src/models/dbrx.cpp
src/models/deci.cpp
src/models/deepseek.cpp
src/models/dots1.cpp
src/models/dream.cpp
src/models/ernie4-5-moe.cpp
src/models/ernie4-5.cpp
src/models/exaone-moe.cpp
src/models/exaone.cpp
src/models/exaone4.cpp
src/models/falcon-h1.cpp
src/models/falcon.cpp
src/models/gemma.cpp
src/models/gemma2.cpp
src/models/gemma3.cpp
src/models/gemma3n.cpp
src/models/gemma4.cpp
src/models/glm4-moe.cpp
src/models/glm4.cpp
src/models/gpt2.cpp
src/models/gptneox.cpp
src/models/granite-hybrid.cpp
src/models/granite.cpp
src/models/grok.cpp
src/models/grovemoe.cpp
src/models/hunyuan-moe.cpp
src/models/hunyuan-vl.cpp
src/models/internlm2.cpp
src/models/jais.cpp
src/models/jais2.cpp
src/models/jamba.cpp
src/models/lfm2.cpp
src/models/llada-moe.cpp
src/models/llada.cpp
src/models/llama.cpp
src/models/llama4.cpp
src/models/maincoder.cpp
src/models/mamba.cpp
src/models/mimo2.cpp
src/models/minicpm3.cpp
src/models/minimax-m2.cpp
src/models/mistral3.cpp
src/models/mpt.cpp
src/models/nemotron-h.cpp
src/models/nemotron.cpp
src/models/olmo.cpp
src/models/olmo2.cpp
src/models/olmoe.cpp
src/models/openai-moe.cpp
src/models/openelm.cpp
src/models/orion.cpp
src/models/paddleocr.cpp
src/models/pangu-embed.cpp
src/models/phi2.cpp
src/models/phi3.cpp
src/models/plamo.cpp
src/models/plamo2.cpp
src/models/plamo3.cpp
src/models/plm.cpp
src/models/qwen.cpp
src/models/qwen2.cpp
src/models/qwen2moe.cpp
src/models/qwen2vl.cpp
src/models/qwen3.cpp
src/models/qwen35.cpp
src/models/qwen35moe.cpp
src/models/qwen3moe.cpp
src/models/qwen3next.cpp
src/models/qwen3vl.cpp
src/models/qwen3vlmoe.cpp
src/models/refact.cpp
src/models/rnd1.cpp
src/models/rwkv6.cpp
src/models/rwkv6qwen2.cpp
src/models/rwkv7.cpp
src/models/seed-oss.cpp
src/models/smallthinker.cpp
src/models/smollm3.cpp
src/models/stablelm.cpp
src/models/starcoder.cpp
src/models/starcoder2.cpp
src/models/step35.cpp
src/models/t5.cpp
src/models/wavtokenizer-dec.cpp
src/models/xverse.cpp