Repacked QAT Gemma 4 on one TPU v5e: 12B serves at 675 tokens/s
A developer repacked Google's QAT Gemma 4 weights for vLLM and served them on a single TPU v5e chip with 15.75 GiB of HBM. The 12B build holds 11.31 GiB of weights and serves 675 output tokens/s at 16 requests, scoring 0.964 on GSM8K and 0.955 on BFCL.
- 12B w8a8emb4: 11.31 GiB of weights, 675 output tokens/s at 16 requests
- On a 3,880-record suite repacks through 12B match bf16; 26B reads 1.1 points lower
- Repacks score up to 2.4 points above Google's 4-bit exports at the same speed
- GSM8K: 0.964 (1272 of 1319), BFCL tool calling: 0.955
Read next
AI