New Benchmark Tests 24 LLMs Against Human Writers on 475 Prompts
Vulsar AI released a Creative Writing benchmark on 475 prompts comparing 24 LLMs to humans. GPT 6 Astra leads with 87.8% predicted wins vs 86.6% for amateur writers, but professionals still score higher. Small models fail: Qwen3.8-27B 23.2%, DeepSeek V4.1 Flash 19.8%, Gemma 4 26B 10.9%.
- GPT 6 Astra: 87.8% predicted wins; amateurs: 86.6%
- GPT 5.6 Sol: 77.6%; Claude Fable 5.1: 70.3%
- Claude Opus 5, Kimi K3, Grok 4.6: 50-65% range
- Humans average 2592 tokens per prompt vs 1537 for GPT 6 Astra
Read next
AI