Navigate
AI BENCHY
Advertise here

Compared models

GPT-5.4 (medium) vs GPT-5.3-Codex (medium) vs GPT-5.2 (medium) benchmark comparison: GPT-5.3-Codex (medium) leads on Score with 8.9. GPT-5.4 (medium) leads on Reliability with 10.0. GPT-5.3-Codex (medium) has the lowest Total Cost at $0.920. GPT-5.3-Codex (medium) is fastest at 16.96s.

Last updated at: 2026-08-07

Rank
#29
Total Output Tokens
88,670
Response Time (avg)
23.10s
Total Cost
$1.533
Rank
#18
Total Output Tokens
55,525
Response Time (avg)
16.96s
Total Cost
$0.920
Rank
#33
Total Output Tokens
54,782
Response Time (avg)
22.62s
Total Cost
$0.951
Recommended model GPT-5.3-Codex (medium)

It has the strongest score in this comparison (8.9) and the best overall balance of cost and response time across all 3 models.

Detailed comparison

Metric GPT-5.4 GPT-5.4 medium Release: 2026-03-05 GPT-5.3-Codex GPT-5.3-Codex medium Release: 2026-02-05 GPT-5.2 GPT-5.2 medium Release: 2025-12-11
Score 8.5 8.9 8.4
Rank #29 #18 #33
Reliability 10.0 10.0 10.0
Consistency 8.6 8.6 8.5
Benchmark coverage 22/22 tests · 66/66 attempts 22/22 tests · 66/66 attempts 22/22 tests · 66/66 attempts
Tests Correct
Attempt pass rate 77.3% 83.3% 72.7%
Flaky tests 4 4 4
Total Runs 66 66 66
Cost per result 10.220 5.748 6.791
Total Cost $1.533 $0.920 $0.951
Input Price $2.500 / 1M $1.750 / 1M $1.750 / 1M
Output Price $15.000 / 1M $14.000 / 1M $14.000 / 1M
Total Input Tokens 81,127 81,268 105,004
Output Tokens 6,155 6,251 9,914
Reasoning Tokens 82,515 49,274 44,868
Response Time (avg) 23.10s 16.96s 22.62s
Response Time (max) 100.41s 100.93s 102.93s
Response Time (total) 508.26s 373.19s 339.28s

Model generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#29 GPT-5.4

medium
Cost
$0.214
Time
199.6s
Tokens
14,349 tok

#18 GPT-5.3-Codex

medium
Cost
$0.049
Time
54.9s
Tokens
3,580 tok

#33 GPT-5.2

medium
Cost
$0.047
Time
49.2s
Tokens
3,396 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Coding Score Consistency Attempt pass rate Flaky tests Tests Correct Response Time (avg) Input Tokens Output Tokens Reasoning Tokens
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
GPT-5.2 10.0 10.0 100.0% 0 22.73s 7,302 511 11,912

Quick Compare

Switch Comparison Pair