AI BENCHY Compare

OpenAI: GPT-5.3-Codex vs Qwen3.6 Plus Preview

Last updated at: 2026-03-30

Metric	GPT-5.3-Codex GPT-5.3-Codex medium Release: 2026-02-05	Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium Release: Unknown release date Free Available

Metric	GPT-5.3-Codex GPT-5.3-Codex medium Release: 2026-02-05	Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium Release: Unknown release date Free Available
Score	8.5	8.5
Rank	#7	#6
Consistency	8.6	10.0
Tests Correct
Attempt pass rate	82.4%	76.5%
Flaky tests	3	0
Total Runs	51	49
Cost per result	4.526	0.000
Total Cost	$0.544	$0.000
Input Price	$1.750 / 1M	$0.000 / 1M
Output Price	$14.000 / 1M	$0.000 / 1M
Output Tokens	1,788	1,756
Reasoning Tokens	33,649	77,213
Response Time (avg)	15.76s	13.94s
Response Time (max)	100.93s	43.55s
Response Time (total)	267.97s	237.01s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	8.7	7.9	91.7%	1		4.16s	240	1,722
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		9.90s	207	7,557

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.56s	364	2,731
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		34.95s	452	13,073

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.07s	234	728
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		14.95s	270	10,706

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	5.9	7.2	55.6%	1		64.31s	64	25,308
Qwen3.6 Plus Preview	3.0	10.0	0.0%	0		22.08s	49	26,895

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	4.6	10.0	0.0%	0		4.87s	187	331
Qwen3.6 Plus Preview	5.1	10.0	0.0%	0		27.05s	111	5,232

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.04s	93	693
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		7.54s	102	5,552

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	9.0	7.9	88.9%	1		5.12s	352	1,644
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		6.11s	298	6,868

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		6.37s	254	492
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		5.87s	267	1,330

Quick Compare

Switch Comparison Pair

Gemini 3 Flash PreviewlowvsQwen3.6 Plus PreviewmediumFree Available Gemini 3 Flash PreviewlowvsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewlowvsQwen3.6 Plus PreviewmediumFree Available Gemini 3 Flash PreviewnonevsGPT-5.3-Codexmedium Gemini 3 Flash PreviewnonevsQwen3.6 Plus PreviewmediumFree Available Gemini 3.1 Flash Lite PreviewnonevsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewnonevsQwen3.6 Plus PreviewmediumFree Available GPT-5.2 ChatnonevsQwen3.6 Plus PreviewmediumFree Available GPT-5.3 ChatnonevsQwen3.6 Plus PreviewmediumFree Available Claude Sonnet 4.6nonevsGPT-5.3-Codexmedium Claude Sonnet 4.6nonevsQwen3.6 Plus PreviewmediumFree Available