AI BENCHY Compare

OpenAI: GPT-5.3-Codex vs OpenAI: GPT-5.5

Summary

GPT-5.3-Codex vs GPT-5.5 benchmark comparison: GPT-5.5 leads on average score with 9.0 vs 8.9. GPT-5.3-Codex has the lower benchmark cost at $0.740 vs $3.679. GPT-5.3-Codex is faster at 16.22s vs 37.98s, with pass rates of 82.5% vs 87.3%.

Recommended model: GPT-5.3-Codex - Its score stays close to the best score here (8.9 vs 9.0), while costing about 5.0x less than GPT-5.5.

Last updated at: 2026-06-18

Metric	GPT-5.3-Codex GPT-5.3-Codex medium Release: 2026-02-05	GPT-5.5 GPT-5.5 medium Release: 2026-04-24

Metric	GPT-5.3-Codex GPT-5.3-Codex medium Release: 2026-02-05	GPT-5.5 GPT-5.5 medium Release: 2026-04-24
Score	8.9	9.0
Rank	#10	#9
Reliability	10.0	10.0
Consistency	8.5	8.9
Tests Correct
Attempt pass rate	82.5%	87.3%
Flaky tests	4	3
Total Runs	63	63
Cost per result	4.932	21.638
Total Cost	$0.740	$3.679
Input Price	$1.750 / 1M	$5.000 / 1M
Output Price	$14.000 / 1M	$30.000 / 1M
Total Input Tokens	34,299	34,212
Output Tokens	2,357	1,985
Reasoning Tokens	46,189	114,925
Response Time (avg)	16.22s	37.98s
Response Time (max)	100.93s	332.10s
Response Time (total)	340.67s	797.60s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#10 GPT-5.3-Codex

medium

Cost: $0.049
Time: 54.9s
Tokens: 3,580 tok

#9 GPT-5.5

medium

Cost: $0.112
Time: 71.9s
Tokens: 3,807 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	8.7	7.9	91.7%	1		4.16s	606	240	1,722
GPT-5.5	10.0	10.0	100.0%	0		4.66s	606	250	1,335

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.50s	7,302	535	10,890
GPT-5.5	8.8	7.8	88.9%	1		59.77s	7,305	362	24,959

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.56s	11,019	364	2,731
GPT-5.5	10.0	10.0	100.0%	0		19.29s	11,019	312	2,841

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.07s	7,140	234	728
GPT-5.5	10.0	10.0	100.0%	0		4.18s	7,140	234	593

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	5.9	7.2	55.6%	1		64.31s	813	64	25,308
GPT-5.5	5.3	7.2	44.4%	1		164.14s	723	67	79,625

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	4.6	10.0	0.0%	0		4.87s	477	187	331
GPT-5.5	10.0	10.0	100.0%	0		4.16s	477	138	223

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.04s	660	93	693
GPT-5.5	10.0	10.0	100.0%	0		3.36s	660	93	538

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	9.0	7.9	88.9%	1		5.05s	642	356	1,593
GPT-5.5	10.0	10.0	100.0%	0		6.76s	642	241	2,225

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		6.37s	5,445	254	492
GPT-5.5	10.0	10.0	100.0%	0		10.57s	5,445	258	832

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	2.8	1.6	33.3%	1		14.43s	195	30	1,701
GPT-5.5	2.8	1.6	33.3%	1		37.86s	195	30	1,754

Quick Compare

Switch Comparison Pair

Gemini 3.5 FlashlowvsGPT-5.5medium Gemini 3.5 FlashlowvsGPT-5.3-Codexmedium DeepSeek V4 FlashhighvsGPT-5.3-Codexmedium DeepSeek V4 FlashhighvsGPT-5.5medium Gemini 3.5 FlashhighvsGPT-5.5medium Gemini 3.5 FlashhighvsGPT-5.3-Codexmedium GPT-5.3-CodexmediumvsStep 3.7 Flashlow GPT-5.5mediumvsStep 3.7 Flashlow DeepSeek V4 ProhighvsGPT-5.3-Codexmedium DeepSeek V4 ProhighvsGPT-5.5medium Gemini 3 Flash PreviewlowvsGPT-5.3-Codexmedium Gemini 3 Flash PreviewlowvsGPT-5.5medium