AI BENCHY Compare

OpenAI: GPT-5.3-Codex vs Qwen: Qwen3.6 35B A3B

Last updated at: 2026-04-27

Metric	GPT-5.3-Codex GPT-5.3-Codex medium Release: 2026-02-05	Qwen3.6 35B A3B Qwen3.6 35B A3B medium Release: 2026-04-20

Metric	GPT-5.3-Codex GPT-5.3-Codex medium Release: 2026-02-05	Qwen3.6 35B A3B Qwen3.6 35B A3B medium Release: 2026-04-20
Score	8.6	8.8
Rank	#11	#9
Reliability	N/A	10.0
Consistency	8.7	9.5
Tests Correct
Attempt pass rate	83.3%	83.3%
Flaky tests	3	1
Total Runs	54	54
Cost per result	4.405	0.800
Total Cost	$0.573	$0.104
Input Price	$1.750 / 1M	$0.162 / 1M
Output Price	$14.000 / 1M	$0.966 / 1M
Output Tokens	2,279	14,256
Reasoning Tokens	35,179	98,005
Response Time (avg)	15.38s	11.98s
Response Time (max)	100.93s	45.02s
Response Time (total)	276.91s	191.76s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	8.7	7.9	91.7%	1		4.16s	240	1,722
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		6.02s	1,154	12,385

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		8.95s	491	1,530
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		32.58s	3,294	15,116

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.56s	364	2,731
Qwen3.6 35B A3B	0.0	0.0	0.0%	0		0ms	0	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.07s	234	728
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		12.99s	2,591	9,968

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	5.9	7.2	55.6%	1		64.31s	64	25,308
Qwen3.6 35B A3B	5.3	7.2	44.4%	1		22.50s	6,193	39,116

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	4.6	10.0	0.0%	0		4.87s	187	331
Qwen3.6 35B A3B	4.4	9.9	0.0%	0		8.66s	129	4,569

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.04s	93	693
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		7.50s	219	7,404

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	9.0	7.9	88.9%	1		5.12s	352	1,644
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		5.98s	676	9,447

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.3-Codex	10.0	10.0	100.0%	0		6.37s	254	492
Qwen3.6 35B A3B	0.0	0.0	0.0%	0		0ms	0	0

Quick Compare

Switch Comparison Pair

Gemini 3 Flash PreviewlowvsQwen3.6 35B A3Bmedium GPT-5.3-CodexmediumvsHY3 PreviewhighFree Available Gemini 3 Flash PreviewlowvsGPT-5.3-Codexmedium GPT-5.5lowvsQwen3.6 35B A3Bmedium Qwen3.6 35B A3BmediumvsHY3 PreviewhighFree Available Claude Opus 4.7nonevsQwen3.6 35B A3Bmedium GPT-5.3-CodexmediumvsHY3 PreviewlowFree Available Gemini 3 Flash PreviewnonevsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3-Codexmedium Claude Opus 4.7nonevsGPT-5.3-Codexmedium Qwen3.6 35B A3BmediumvsHY3 PreviewlowFree Available Gemini 3 Flash PreviewnonevsQwen3.6 35B A3Bmedium