MTP on RTX 3090 boosts Qwen3.8-27B generation 56%, coding quality unclear
Enabling Multi-Token Prediction on an RTX 3090 raised Qwen3.8-27B generation throughput from 36.0 to 56.2 tokens/s, about 56% faster. Successful tasks finished 20–40% sooner, but one transfer task produced a worse patch: 26/80 checks with MTP versus 35/80 without.
- Generation throughput rose from 36.0 to 56.2 tokens/s, up 56%
- Successful tasks finished 20.1% and 39.9% faster
- Checks passed: 35/80 without MTP versus 26/80 with MTP
- One transfer task at one seed caused the 9-check gap
Read next
AI