Runs on Data centre · Hugging Face ↗
Coding index 52.9 (Artificial Analysis)
Thinking Machines Lab's ~952B MoE — a notable open release from the lab, landing mid-pack on open coding.
Real GGUF file sizes = weight VRAM.
| Quantization | Size |
|---|---|
| Q2_K | 87.9 GB |
| Q3_K_M | 119.4 GB |
| IQ4_XS | 127.4 GB |
| Q4_K_S | 152.3 GB |
| MXFP4 | 158.0 GB |
| Q4_K_M | 162.5 GB |
| Q4 | 163.3 GB |
| Q5_K_M | 196.1 GB |
| Q8_0 | 280.3 GB |
| Q8 | 288.4 GB |
| Q6_K | 458.6 GB |
| BF16 | 527.4 GB |
~590 GB at Q4 — cluster only. Serve tensor-parallel with vLLM / SGLang. Included as a landmark open model to track rather than a practical desktop option.