Inception Labs' Mercury 2.5 named fastest LLM at 1,107 tokens/sec
Inception Labs says its diffusion model Mercury 2.5 hits 1,107 tokens per second on Nvidia GPUs at $0.20/$0.75 per million tokens. OpenRouter measures 440 tok/s at P50 — still faster than Gemini 3.5 Flash-Lite, GPT-5.6 Luna and Claude Haiku 4.5. The 80% launch discount ended on September 8, 2026.
- Mercury 2.5: 1,107 tok/s vendor-reported, 440 tok/s at P50 on OpenRouter
- $0.20/$0.75 per million tokens — 6.7x cheaper than Claude Haiku 4.5 on output
- 260K context window — smaller than Luna, Flash-Lite and Haiku 4.5
- The 80% launch discount ($0.04/$0.15) ended on September 8, 2026
Read next
AI