priorsBuilder

xAI · released 2026-09-21

Grok 4.7

Measured on 77 benchmarks across 4 reasoning efforts.

General frontier

47.6

#17 of 32 models · best at medium

Reasoning efforts in your mix

medium47.6#56 of 128
high45.8#62 of 128
xhigh45.3#65 of 128
low42.8#77 of 128

Your mix’s benchmarks

5 of 8 measured

reasoning

Humanity's Last Exam

584 results
  1. #54xhigh of 58443.1%
  2. #64high of 58442.3%
  3. #88low of 58439.2%

Leader: Opus 5.5 · 61.4%

knowledge

AA-Omniscience

523 results
  1. #27xhigh of 52332.0
  2. #30high of 52330.9
  3. #32low of 52329.6

Leader: Opus 5.5 · 46.4

reasoning

ARC-AGI-3

57 results
  1. #17high of 5710.0%
  2. #19medium of 578.4%
  3. #21xhigh of 577.0%
  4. #32low of 570.8%

Leader: GPT-6 Astra · 99.9%

math

FrontierMath Tier 4 (v2)

70 results
  1. #50xhigh of 7017.1%

Leader: GPT-6.1 Sol · 100.0%

agentic

Terminal-Bench 4.0

35 results
  1. #21xhigh of 3537.6%

Leader: Opus 5.5 · 64.8%

All 77 benchmarks

show 72 more

agentic

AA-Briefcase v1.1

222 results
  1. #9xhigh of 2221644
  2. #12high of 2221634
  3. #33low of 2221499

Leader: Sonnet 5.5 · 1823

agentic

Agent Arena

49 results
  1. #21xhigh of 492.8%

Leader: Opus 5.5 · 14.3%

agentic

AutomationBench-AA

217 results
  1. #11xhigh of 21765.6%
  2. #18high of 21763.5%
  3. #46low of 21756.7%

Leader: Gemini 4 · 77.5%

agentic

BioMysteryBench

25 results
  1. #12xhigh of 2569.3%

Leader: Sonnet 5.5 · 81.1%

agentic

Harvey's Legal Agent Benchmark

76 results
  1. #10xhigh of 7612.5%

Leader: Muse Spark 1.2 · 25.4%

agentic

ITBench-AA

45 results
  1. #16xhigh of 4542.1%

Leader: GPT-5.6 Sol · 56.2%

agentic

Legal Research Bench

75 results
  1. #12xhigh of 7547.1%

Leader: Muse Spark 1.3 · 55.3%

agentic

Tax Agent Bench

67 results
  1. #10xhigh of 6734.2%

Leader: Fable 5.1 · 49.2%

agentic

Terminal-Bench 4.0 (Vals)

45 results
  1. #16xhigh of 4528.8%

Leader: Opus 5.5 · 65.2%

agentic

Terminal-Bench Science (Vals)

39 results
  1. #14xhigh of 3910.0%

Leader: GPT-6 Astra · 62.9%

agentic

Vending-Bench 2

67 results
  1. #7max of 67$10,537

Leader: GPT-6 Astra · $15,515

agentic

WeirdML v3

17 results
  1. #10xhigh of 178.6%

Leader: GPT-6 Astra · 42.2%

coding

Arena Image-to-WebDev

58 results
  1. #22xhigh of 581577

Leader: Opus 5.5 · 1749

coding

Arena WebDev

122 results
  1. #14xhigh of 1221639

Leader: Opus 5.5 · 1813

coding

Code Migration

75 results
  1. #17xhigh of 7544.8%

Leader: Sonnet 5.5 · 69.8%

coding

FrontierCode 1.1 Extended

130 results
  1. #36high of 13059.4%
  2. #49xhigh of 13057.0%

Leader: Opus 5.5 · 65.3%

coding

FrontierCode 1.1 Main

130 results
  1. #32high of 13047.6%
  2. #44xhigh of 13045.6%

Leader: Opus 5.5 · 54.6%

coding

FrontierSWE v2

21 results
  1. #11max of 2129.5%

Leader: GPT-6 Astra · 65.5%

coding

IOI

42 results
  1. #16xhigh of 4257.7%

Leader: Gemini 4 · 100.0%

coding

ProgramBench v1 Almost Resolved

62 results
  1. #11xhigh of 6221.5%

Leader: Opus 5.5 · 65.0%

coding

ProgramBench v1 Fully Resolved

62 results
  1. #19xhigh of 620.5%

Leader: Opus 5.5 · 18.5%

coding

ProgramBench v1 Raw Pass Rate

62 results
  1. #11xhigh of 6275.7%

Leader: Opus 5.5 · 87.0%

coding

SciCode

224 results
  1. #21high of 22457.8%
  2. #24xhigh of 22457.4%
  3. #55low of 22454.9%

Leader: Opus 5.5 · 66.9%

coding

Terminal-Bench 2.1 (Vals)

74 results
  1. #22xhigh of 7473.4%

Leader: Opus 5.5 · 87.6%

coding

Terminal-Bench v4-AA

214 results
  1. #49xhigh of 21425.8%
  2. #51high of 21424.7%
  3. #64low of 21416.2%

Leader: Sonnet 5.5 · 63.6%

coding

Vibe Code Bench v1.1

103 results
  1. #11xhigh of 10386.2%

Leader: Sonnet 5.5 · 92.4%

composite

AA Intelligence Index v4.3.2

607 results
  1. #29xhigh of 60746.4
  2. #30high of 60746.3
  3. #48low of 60742.2

Leader: Opus 5.5 · 57.6

composite

Arena Text

220 results
  1. #75xhigh of 2201443

Leader: Gemini 4 · 1525

composite

Arena Text — Multi-Turn

220 results
  1. #96xhigh of 2201430

Leader: Gemini 4 · 1553

composite

Vals Index

45 results
  1. #14xhigh of 4554.9%

Leader: Gemini 4 · 68.9%

composite

Vals RSI Index v1.1

24 results
  1. #15max of 2420.2%

Leader: Opus 5.5 · 37.3%

composite

Vals RSI Index v1.1: Harness Engineering: Judge

24 results
  1. #16max of 2411.3%

Leader: GPT-6 Sol · 22.8%

composite

Vals RSI Index v1.1: Post-training: Finance Agent

24 results
  1. #17max of 240.0%

Leader: Opus 5.5 · 35.1%

composite

Vals RSI Index v1.1: Pre-training: Compression

24 results
  1. #19max of 2427.9%

Leader: Opus 5.5 · 46.5%

composite

Vals RSI Index v1.1: Pre-training: LM Training

24 results
  1. #8max of 2441.6%

Leader: Opus 5.5 · 53.0%

cost

AA Intelligence Index Cost per Task

177 results
  1. #129low of 177$1.25
  2. #159high of 177$2.73
  3. #166xhigh of 177$3.74

Leader: GPT-6 Luna · $0.00

cost

Cost to Run AA Intelligence Index

177 results
  1. #129low of 177$1,631
  2. #158high of 177$3,881
  3. #165xhigh of 177$4,967

Leader: GPT-6 Luna · $10.63

economics

Excel Modeling Benchmark

72 results
  1. #17xhigh of 7267.0%

Leader: Fable 5.1 · 76.7%

economics

Finance Agent v2

76 results
  1. #32xhigh of 7652.3%

Leader: Gemini 4 · 65.4%

economics

GDP.pdf

208 results
  1. #41high of 20823.2%
  2. #51low of 20821.4%
  3. #61xhigh of 20820.0%

Leader: GPT-6 Astra · 32.2%

economics

GDPval-AA v2.1

286 results
  1. #8xhigh of 2861712
  2. #9high of 2861708
  3. #33low of 2861588

Leader: Opus 5.5 · 1866

knowledge

AA-Omniscience Accuracy

523 results
  1. #62low of 52349.7%
  2. #72high of 52347.8%
  3. #74xhigh of 52347.4%

Leader: Fable 5.1 · 67.2%

knowledge

AA-Omniscience Non-hallucination

523 results
  1. #36xhigh of 52370.7%
  2. #51high of 52367.6%
  3. #71low of 52360.1%

Leader: MiniCPM5-1B (Non-reasoning) · 99.1%

knowledge

Harvey LAB-AA v1.1

25 results
  1. #1xhigh of 259.4%

Leader: this model · 9.4%

knowledge

MedCode

94 results
  1. #21xhigh of 9449.6%

Leader: Opus 5 · 63.6%

knowledge

MedScribe

96 results
  1. #7xhigh of 9689.4%

Leader: Opus 5.5 · 91.4%

knowledge

MMMU-Pro

264 results
  1. #72low of 26478.2%

Leader: Opus 5.5 · 87.7%

knowledge

Public Benefits Bench v1.1

48 results
  1. #19xhigh of 4865.6%

Leader: Opus 5 · 76.9%

long-context

AA-LCR v1.1

520 results
  1. #76low of 52080.0%
  2. #132high of 52077.0%
  3. #134xhigh of 52076.7%

Leader: Kimi K3 · 88.7%

long-context

MLCR-AA

93 results
  1. #46xhigh of 9315.0%

Leader: Sonnet 5.5 · 75.0%

math

FrontierMath Tiers 1–3 (v2)

115 results
  1. #47xhigh of 11553.0%

Leader: GPT-6.1 Sol · 93.7%

math

ProofBench v1.1

50 results
  1. #37xhigh of 5026.0%

Leader: Sonnet 5.5 · 100.0%

other

Arena Vision

116 results
  1. #54xhigh of 1161248

Leader: Fable 5 · 1308

reasoning

ARC-AGI-1

215 results
  1. #70high of 21590.2%
  2. #73medium of 21590.0%
  3. #75xhigh of 21589.5%
  4. #136low of 21563.3%

Leader: Fable 5 · 98.5%

reasoning

ARC-AGI-2

216 results
  1. #72xhigh of 21661.4%
  2. #83medium of 21658.8%
  3. #84high of 21658.3%
  4. #129low of 21616.7%

Leader: GPT-6 Astra · 95.0%

reasoning

Blueprint-Bench 2

28 results
  1. #14max of 2832.5%

Leader: Gemini 4 · 54.4%

reasoning

CritPt

526 results
  1. #66high of 52618.0%
  2. #69xhigh of 52617.7%
  3. #94low of 52613.4%

Leader: GPT-5.6 Sol · 32.3%

reasoning

Furniture Assembly

31 results
  1. #30xhigh of 3120.8%

Leader: Opus 5.5 · 83.3%

reasoning

LegalBench

134 results
  1. #32xhigh of 13484.4%

Leader: Fable 5 · 88.6%

reasoning

MysteryMechanism

25 results
  1. #14xhigh of 2525.2%

Leader: GPT-6 Astra · 53.2%

reasoning

Roboflow Visual Reasoning

102 results
  1. #44high of 10266.9%
  2. #53low of 10264.2%

Leader: GPT-6 Astra · 91.2%

reasoning

SAGE

80 results
  1. #57xhigh of 8040.8%

Leader: Opus 4.7 · 56.1%

reasoning

SimpleQA Verified

47 results
  1. #11max of 4759.4%

Leader: Gemini 3.1 Pro · 77.5%

reliability

Tool-call error rate

171 results
  1. #17max of 1710.1%

Leader: GPT-5.4 Pro · 0.0%

reliability

Uptime (7d)

181 results
  1. #139max of 18198.3%

Leader: GPT-5 Pro · 100.0%

safety

CWE-Bench

18 results
  1. #1xhigh of 1868.3%

Leader: this model · 68.3%

safety

CyberBench v1.1

43 results
  1. #23xhigh of 4369.5%

Leader: GPT-6 Sol · 78.0%

safety

SRE Bench

32 results
  1. #17xhigh of 323.8%

Leader: GPT-6 Astra · 56.9%

speed

Latency (Time to First Token)

355 results
  1. #237low of 3555.2s
  2. #315high of 35543s
  3. #333xhigh of 35598s

Leader: Gemini 2.5 Flash-Lite · 0.3s

speed

Output Speed (tokens/s)

355 results
  1. #219high of 35575.1
  2. #223xhigh of 35574.2
  3. #233low of 35569.7

Leader: Celeris-1 · 1461.1

speed

Provider latency

178 results
  1. #121max of 1782.0s

Leader: Qwen 2.5 7B · 0.2s

speed

Provider throughput

177 results
  1. #84max of 17763.5

Leader: Llama 3.2 3b · 199.5