Model Spend Arena2ND ED.
32B · MoE · 262,144 ctx · 2026-10-10

Nemotron Cascade 2 30B A3B

Runs on — · Hugging Face ↗

vLLMllama.cpp

AA coding index 25.3 (Artificial Analysis, frozen since 2026-09-11)

A newer NVIDIA 30B-total MoE (~3B active) using cascade routing — fast decoding for its capability, tuned for the NVIDIA stack.

Sizes on disk

Real GGUF file sizes = weight VRAM.

QuantizationSize
IQ2_XXS18.1 GB
IQ2_XS18.1 GB
IQ2_S18.1 GB
IQ2_M18.1 GB
Q2_K18.2 GB
IQ4_XS18.2 GB
IQ4_NL18.2 GB
Q3_K_S18.2 GB
Q4_018.3 GB
Q2_K_L18.3 GB
IQ3_XXS19.0 GB
IQ3_XS19.1 GB
Q3_K_M19.1 GB
Q3_K_L19.5 GB
IQ3_M19.5 GB
Q3_K_XL19.7 GB
Q4_120.1 GB
Q4_K_S22.4 GB
Q5_K_S24.0 GB
Q4_K_M24.7 GB
Q4_K_L24.9 GB
Q5_K_M26.2 GB
Q5_K_L26.3 GB
Q6_K33.6 GB
Q6_K_L33.6 GB
Q8_033.6 GB
BF1663.2 GB

Config tips

~25 GB at Q4 — a 32 GB card, or a 24 GB one with CPU offload of idle experts. vLLM / TensorRT-LLM give the best throughput on NVIDIA hardware.