chiprook
← AI
AIOctober 8, 2026, 06:31

Strata runs a 125B-parameter model on a 12 GB consumer GPU

The open-source C++ project Strata applies 2-bit quantization (Q2_0/IQ2_XS) to Qwen3.8-Flash-Next, running a 125-billion-parameter model on a single 12 GB consumer GPU. On an RTX 5070 with Ryzen 5 7600 it reaches 94 tok/s generation and 2,650 tok/s prompt read.

Strata runs a 125B-parameter model on a 12 GB consumer GPU
#Strata#Qwen#Nvidia#AMD
Read next
AI

Strata runs a 125B LLM on a gaming PC with 12 GB VRAM

AI

133 GB MoE model runs on an 8 GB GPU at 11 tokens/s by streaming experts from NVMe

AI

OrcaSAQ-2 Shrinks 27B Qwen 3.8 AI Into a 12.3GB Local Model

AI

Bonsai 2 27B: ternary weights shrink a 27B model to 5.9 GB