Model family holds eleven number-one benchmark records
A self-improving model family tops eleven public benchmarks at once, spanning math, science, law, structured output and decisions. Two records are perfect scores on AIME 2026 and HMMT 2026, and decision tasks are scored with a deterministic zero-token method.
- Eleven number-one records, including perfect 100% on AIME 2026 and HMMT 2026
- GPQA Diamond 94.44%, MMLU-Pro 88.12%, MMMU-Pro 79.48%
- LEXam 68.94%, LEXam-hard 45.72%, ExtractBench 90.29%
- S1MB: Borda 89.58, task average 66.46
Read next
AI