Top Performing Model

Based on composite benchmark scores

anthropic

Claude Opus 4.8

Leading today's benchmarks

0.0/100
-2.0%vs prev day

Performance Timeline

Active Regressions

16
Grok 4.5minor

Code Thoroughness dropped -3.8% from 92.9 to 89.4

Detected Jun 28, 2026 · 7-day window

GPT-5.5minor

Code Thoroughness dropped -3.1% from 90.9 to 88.1

Detected Jun 28, 2026 · 7-day window

Claude Opus 4.8moderate

Long Reasoning dropped -6.1% from 69.1 to 64.9

Detected Jun 27, 2026 · 7-day window

Grok 4.5moderate

Long Reasoning dropped -5.4% from 73.8 to 69.8

Detected Jun 21, 2026 · 7-day window

GPT-5.5moderate

Token Efficiency dropped -9.0% from 53.8 to 49.0

Detected Jun 19, 2026 · 7-day window

Grok 4.5moderate

Coding Tasks dropped -8.3% from 93.5 to 85.7

Detected Jun 19, 2026 · 7-day window

Grok 4.5minor

Security Awareness dropped -3.3% from 93.3 to 90.2

Detected Jun 15, 2026 · 7-day window

Claude Opus 4.8minor

Security Awareness dropped -3.3% from 93.8 to 90.7

Detected Jun 15, 2026 · 7-day window

Claude Sonnet 4.6moderate

Overall dropped -9.7% from 88.4 to 79.8

Detected Jun 14, 2026 · 7-day window

Claude Sonnet 4.6major

Code Thoroughness dropped -17.8% from 74.9 to 61.6

Detected Jun 14, 2026 · 7-day window

Claude Sonnet 4.6major

Code Quality dropped -55.7% from 88.7 to 39.3

Detected Jun 14, 2026 · 7-day window

Claude Sonnet 4.6major

Performance Efficiency dropped -18.7% from 81.5 to 66.3

Detected Jun 12, 2026 · 7-day window

Claude Opus 4.8major

Code Quality dropped -25.6% from 91.8 to 68.3

Detected Jun 12, 2026 · 7-day window

Claude Sonnet 4.6major

Token Efficiency dropped -24.8% from 98.8 to 74.3

Detected Jun 8, 2026 · 7-day window

GPT-5.5moderate

Long Reasoning dropped -5.7% from 65.0 to 61.3

Detected Jun 7, 2026 · 7-day window

Grok 4.5major

Token Efficiency dropped -78.5% from 61.5 to 13.2

Detected Jun 6, 2026 · 7-day window

Latest Benchmark Run

Jun 30, 4:50 AMdaily
Claude Opus 4.8

Composite benchmark summary

#1

Composite

92.3

Token Benchmark

100.0

Total tokens

231.9k

~7.7k/test

Best category100.0 Token Efficiency
Worst category66.3 Long Reasoning
View details
Claude Sonnet 4.6

Composite benchmark summary

#3

Composite

86.2

Token Benchmark

70.3

Total tokens

318.7k

~11.0k/test

Best category100.0 Instruction Following
Worst category33.3 Performance & Efficiency
View details
GPT-5.5

Composite benchmark summary

#2

Composite

89.3

Token Benchmark

51.7

Total tokens

448.9k

~15.0k/test

Best category100.0 Instruction Following
Worst category51.7 Token Efficiency
View details
Grok 4.5

Composite benchmark summary

#4

Composite

85.7

Token Benchmark

22.6

Total tokens

1.0M

~34.2k/test

Best category100.0 Instruction Following
Worst category22.6 Token Efficiency
View details