Top Performing Model
Based on composite benchmark scores
Claude Opus 4.8
Leading today's benchmarks
Performance Timeline
Active Regressions
16Code Thoroughness dropped -3.8% from 92.9 to 89.4
Detected Jun 28, 2026 · 7-day window
Code Thoroughness dropped -3.1% from 90.9 to 88.1
Detected Jun 28, 2026 · 7-day window
Long Reasoning dropped -6.1% from 69.1 to 64.9
Detected Jun 27, 2026 · 7-day window
Long Reasoning dropped -5.4% from 73.8 to 69.8
Detected Jun 21, 2026 · 7-day window
Token Efficiency dropped -9.0% from 53.8 to 49.0
Detected Jun 19, 2026 · 7-day window
Coding Tasks dropped -8.3% from 93.5 to 85.7
Detected Jun 19, 2026 · 7-day window
Security Awareness dropped -3.3% from 93.3 to 90.2
Detected Jun 15, 2026 · 7-day window
Security Awareness dropped -3.3% from 93.8 to 90.7
Detected Jun 15, 2026 · 7-day window
Overall dropped -9.7% from 88.4 to 79.8
Detected Jun 14, 2026 · 7-day window
Code Thoroughness dropped -17.8% from 74.9 to 61.6
Detected Jun 14, 2026 · 7-day window
Code Quality dropped -55.7% from 88.7 to 39.3
Detected Jun 14, 2026 · 7-day window
Performance Efficiency dropped -18.7% from 81.5 to 66.3
Detected Jun 12, 2026 · 7-day window
Code Quality dropped -25.6% from 91.8 to 68.3
Detected Jun 12, 2026 · 7-day window
Token Efficiency dropped -24.8% from 98.8 to 74.3
Detected Jun 8, 2026 · 7-day window
Long Reasoning dropped -5.7% from 65.0 to 61.3
Detected Jun 7, 2026 · 7-day window
Token Efficiency dropped -78.5% from 61.5 to 13.2
Detected Jun 6, 2026 · 7-day window
Category Performance Heatmap
Latest Benchmark Run
Composite benchmark summary
Composite
92.3
Token Benchmark
100.0
231.9k
~7.7k/test
Composite benchmark summary
Composite
86.2
Token Benchmark
70.3
318.7k
~11.0k/test
Composite benchmark summary
Composite
89.3
Token Benchmark
51.7
448.9k
~15.0k/test
Composite benchmark summary
Composite
85.7
Token Benchmark
22.6
1.0M
~34.2k/test
| Model | Composite | Rank | Best Category | Worst Category | Tokens | Details |
|---|---|---|---|---|---|---|
Claude Opus 4.8 | 92.3 | #1 | 100.0Token Efficiency | 66.3Long Reasoning | 231.9k | View |
Claude Sonnet 4.6 | 86.2 | #3 | 100.0Instruction Following | 33.3Performance & Efficiency | 318.7k | View |
GPT-5.5 | 89.3 | #2 | 100.0Instruction Following | 51.7Token Efficiency | 448.9k | View |
Grok 4.5 | 85.7 | #4 | 100.0Instruction Following | 22.6Token Efficiency | 1.0M | View |