chiprook
← AI
AIOctober 3, 2026, 00:59

Repacked QAT Gemma 4 on one TPU v5e: 12B serves at 675 tokens/s

A developer repacked Google's QAT Gemma 4 weights for vLLM and served them on a single TPU v5e chip with 15.75 GiB of HBM. The 12B build holds 11.31 GiB of weights and serves 675 output tokens/s at 16 requests, scoring 0.964 on GSM8K and 0.955 on BFCL.

Repacked QAT Gemma 4 on one TPU v5e: 12B serves at 675 tokens/s
#Google#Gemma#VLLM#TPU
Read next
AI

QAT Gemma 4 26B-A4B on one TPU v6e: 15.6x KV cache, 1.9x throughput vs FP8

AI

Gemma 4 on SageMaker: QAT weights decode 2.05x faster than bf16 on one L4

AI

Zhipu Opens GLM-5.3-FlashX Near 200 Tokens/s on ~100k Domestic Accelerators

AI

Qwen3.8-27B runs on a single RTX 3090 via vLLM