reasoning
Humanity's Last Exam
- #54xhigh of 58443.1%
- #64high of 58442.3%
- #88low of 58439.2%
Leader: Opus 5.5 · 61.4%
xAI · released 2026-09-21
Measured on 77 benchmarks across 4 reasoning efforts.
General frontier
47.6
#17 of 32 models · best at medium
reasoning
Leader: Opus 5.5 · 61.4%
knowledge
Leader: Opus 5.5 · 46.4
reasoning
Leader: GPT-6 Astra · 99.9%
math
Leader: GPT-6.1 Sol · 100.0%
agentic
Leader: Opus 5.5 · 64.8%
agentic
Leader: Sonnet 5.5 · 1823
agentic
Leader: Opus 5.5 · 14.3%
agentic
Leader: Gemini 4 · 77.5%
agentic
Leader: Sonnet 5.5 · 81.1%
agentic
Leader: Muse Spark 1.2 · 25.4%
agentic
Leader: GPT-5.6 Sol · 56.2%
agentic
Leader: Muse Spark 1.3 · 55.3%
agentic
Leader: Fable 5.1 · 49.2%
agentic
Leader: Opus 5.5 · 65.2%
agentic
Leader: GPT-6 Astra · 62.9%
agentic
Leader: GPT-6 Astra · $15,515
agentic
Leader: GPT-6 Astra · 42.2%
coding
Leader: Opus 5.5 · 1749
coding
Leader: Opus 5.5 · 1813
coding
Leader: Sonnet 5.5 · 69.8%
coding
Leader: Opus 5.5 · 65.3%
coding
Leader: Opus 5.5 · 54.6%
coding
Leader: GPT-6 Astra · 65.5%
coding
Leader: Gemini 4 · 100.0%
coding
Leader: Opus 5.5 · 65.0%
coding
Leader: Opus 5.5 · 18.5%
coding
Leader: Opus 5.5 · 87.0%
coding
Leader: Opus 5.5 · 66.9%
coding
Leader: Opus 5.5 · 87.6%
coding
Leader: Sonnet 5.5 · 63.6%
coding
Leader: Sonnet 5.5 · 92.4%
composite
Leader: Opus 5.5 · 57.6
composite
Leader: Gemini 4 · 1525
composite
Leader: Gemini 4 · 1553
composite
Leader: Gemini 4 · 68.9%
composite
Leader: Opus 5.5 · 37.3%
composite
Leader: GPT-6 Sol · 22.8%
composite
Leader: Opus 5.5 · 35.1%
composite
Leader: Opus 5.5 · 46.5%
composite
Leader: Opus 5.5 · 53.0%
cost
Leader: GPT-6 Luna · $0.00
cost
Leader: GPT-6 Luna · $10.63
economics
Leader: Fable 5.1 · 76.7%
economics
Leader: Gemini 4 · 65.4%
economics
Leader: GPT-6 Astra · 32.2%
economics
Leader: Opus 5.5 · 1866
knowledge
Leader: Fable 5.1 · 67.2%
knowledge
Leader: MiniCPM5-1B (Non-reasoning) · 99.1%
knowledge
Leader: this model · 9.4%
knowledge
Leader: Opus 5 · 63.6%
knowledge
Leader: Opus 5.5 · 91.4%
knowledge
Leader: Opus 5.5 · 87.7%
knowledge
Leader: Opus 5 · 76.9%
long-context
Leader: Kimi K3 · 88.7%
long-context
Leader: Sonnet 5.5 · 75.0%
math
Leader: GPT-6.1 Sol · 93.7%
math
Leader: Sonnet 5.5 · 100.0%
other
Leader: Fable 5 · 1308
reasoning
Leader: Fable 5 · 98.5%
reasoning
Leader: GPT-6 Astra · 95.0%
reasoning
Leader: Gemini 4 · 54.4%
reasoning
Leader: GPT-5.6 Sol · 32.3%
reasoning
Leader: Opus 5.5 · 83.3%
reasoning
Leader: Fable 5 · 88.6%
reasoning
Leader: GPT-6 Astra · 53.2%
reasoning
Leader: GPT-6 Astra · 91.2%
reasoning
Leader: Opus 4.7 · 56.1%
reasoning
Leader: Gemini 3.1 Pro · 77.5%
reliability
Leader: GPT-5.4 Pro · 0.0%
reliability
Leader: GPT-5 Pro · 100.0%
safety
Leader: this model · 68.3%
safety
Leader: GPT-6 Sol · 78.0%
safety
Leader: GPT-6 Astra · 56.9%
speed
Leader: Gemini 2.5 Flash-Lite · 0.3s
speed
Leader: Celeris-1 · 1461.1
speed
Leader: Qwen 2.5 7B · 0.2s
speed
Leader: Llama 3.2 3b · 199.5