reasoning
Humanity's Last Exam
- #29max of 58448.7%
- #35xhigh of 58447.5%
Leader: Opus 5.5 · 61.4%
Meta · released 2026-09-02
Measured on 74 benchmarks across 2 reasoning efforts.
General frontier
49.4
#15 of 32 models · best at max
reasoning
Leader: Opus 5.5 · 61.4%
knowledge
Leader: Opus 5.5 · 46.4
math
Leader: GPT-6.1 Sol · 100.0%
reasoning
Leader: Opus 5.5 · 88.4%
agentic
Leader: Opus 5.5 · 64.8%
agentic
Leader: Sonnet 5.5 · 1823
agentic
Leader: Opus 5.5 · 14.3%
agentic
Leader: Gemini 4 · 51.3%
agentic
Leader: Gemini 4 · 77.5%
agentic
Leader: GPT-6 Astra · 19.2%
agentic
Leader: Muse Spark 1.2 · 25.4%
agentic
Leader: GPT-5.6 Sol · 56.2%
agentic
Leader: this model · 55.3%
agentic
Leader: Fable 5.1 · 49.2%
agentic
Leader: Opus 5.5 · 65.2%
agentic
Leader: GPT-6 Astra · 62.9%
agentic
Leader: GPT-6 Astra · 42.2%
agentic
Leader: Qwen 3.8 Max · 51.3%
coding
Leader: Opus 5.5 · 1749
coding
Leader: Opus 5.5 · 1813
coding
Leader: Sonnet 5.5 · 69.8%
coding
Leader: GPT-6 Astra · 65.5%
coding
Leader: Gemini 4 · 100.0%
coding
Leader: Opus 5.5 · 65.0%
coding
Leader: Opus 5.5 · 18.5%
coding
Leader: Opus 5.5 · 87.0%
coding
Leader: Opus 5.5 · 66.9%
coding
Leader: Opus 5.5 · 87.6%
coding
Leader: GPT-6 Astra · 63.3%
coding
Leader: Fable 5.1 · 91.4%
coding
Leader: Sonnet 5.5 · 63.6%
coding
Leader: Opus 5.5 · 30.4%
coding
Leader: Sonnet 5.5 · 92.4%
composite
Leader: Opus 5.5 · 57.6
composite
Leader: Gemini 4 · 1525
composite
Leader: Gemini 4 · 1553
composite
Leader: Gemini 4 · 68.9%
composite
Leader: Opus 5.5 · 37.3%
composite
Leader: GPT-6 Sol · 22.8%
composite
Leader: Opus 5.5 · 35.1%
composite
Leader: Opus 5.5 · 46.5%
composite
Leader: Opus 5.5 · 53.0%
cost
Leader: GPT-6 Luna · $0.00
cost
Leader: GPT-6 Luna · $10.63
creative
Leader: GPT-6 Astra Pro · 2278
creative
Leader: GPT-6 Astra · 2654
economics
Leader: Fable 5.1 · 76.7%
economics
Leader: Gemini 4 · 65.4%
economics
Leader: GPT-6 Astra · 32.2%
economics
Leader: Opus 5.5 · 1866
knowledge
Leader: Fable 5.1 · 67.2%
knowledge
Leader: MiniCPM5-1B (Non-reasoning) · 99.1%
knowledge
Leader: GPT-6 Astra · 96.3%
knowledge
Leader: Grok 4.7 · 9.4%
knowledge
Leader: Opus 5.5 · 87.7%
long-context
Leader: Kimi K3 · 88.7%
long-context
Leader: Opus 5 · 1516
long-context
Leader: Sonnet 5.5 · 75.0%
math
Leader: GPT-6.1 Sol · 93.7%
math
Leader: Sonnet 5.5 · 100.0%
other
Leader: Fable 5 · 1308
reasoning
Leader: GPT-5.6 Sol · 32.3%
reasoning
Leader: GPT-6 Astra · 53.6%
reasoning
Leader: GPT-6 Astra · 53.2%
reasoning
Leader: GPT-6 Astra · 91.2%
reliability
Leader: GPT-5.4 Pro · 0.0%
reliability
Leader: GPT-5 Pro · 100.0%
safety
Leader: Grok 4.7 · 68.3%
safety
Leader: GPT-6 Sol · 78.0%
safety
Leader: GPT-6 Astra · 56.9%
speed
Leader: Gemini 2.5 Flash-Lite · 0.3s
speed
Leader: Celeris-1 · 1461.1
speed
Leader: Qwen 2.5 7B · 0.2s
speed
Leader: Llama 3.2 3b · 199.5