Compare Charts Methodology

Language:

❤️ Made by XCS

AI BENCHY Compare

OpenAI: GPT-5.4 vs Qwen: Qwen3.5-Flash

Compare:

Last updated at: 2026-03-06

Metric	OpenAI: GPT-5.4 none Release: 2026-03-05	Qwen: Qwen3.5-Flash none Release: 2026-02-24
Avg Score	4.6	4.9
Rank	#44	#40
Tests Correct
Consistency	8.9	9.5
Cost per result	1.496	0.088
Total Cost	$0.090	$0.006
Attempt pass rate	44.4%	42.2%
Flaky tests	2	1
common.totalRuns	45 (15 x 3)	45 (15 x 3)
Output Tokens	1,635	3,674
Reasoning Tokens	0	0
Response Time (avg)	1.46s	3.73s
Response Time (max)	2.89s	13.73s
Response Time (total)	21.86s	55.90s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Avg Score vs Response Time (avg)

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	10.0	7.3	11.1%	1		1.41s	388	0
Qwen: Qwen3.5-Flash	2.3	7.8	11.1%	1		1.62s	687	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	10.0	10.0	0.0%	0		2.89s	291	0
Qwen: Qwen3.5-Flash	10.0	10.0	0.0%	0		6.22s	1,794	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		1.04s	222	0
Qwen: Qwen3.5-Flash	9.9	10.0	100.0%	0		1.57s	243	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		1.07s	50	0
Qwen: Qwen3.5-Flash	7.0	10.0	66.7%	0		905ms	15	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	5.5	10.0	50.0%	0		1.07s	81	0
Qwen: Qwen3.5-Flash	5.0	10.0	50.0%	0		8.81s	63	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	4.0	9.8	33.3%	0		1.52s	357	0
Qwen: Qwen3.5-Flash	1.3	10.0	0.0%	0		5.90s	608	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		2.75s	246	0
Qwen: Qwen3.5-Flash	10.0	10.0	100.0%	0		3.67s	264	0

Quick Compare

Switch Comparison Pair

MiniMax M2.5mediumvsQwen3.5-Flashnone MiniMax M2.5mediumvsGPT-5.4none gpt-oss-120bmediumFree AvailablevsQwen3.5-Flashnone Mercury 2mediumvsQwen3.5-Flashnone GPT-5 NanomediumvsQwen3.5-Flashnone Mercury 2mediumvsGPT-5.4none GPT-5 MinimediumvsQwen3.5-Flashnone GPT-5.4nonevsQwen3.5-35B-A3Bmedium GPT-5.4nonevsQwen3 Coder Nextmedium GPT-5.4nonevsGLM 4.7 Flashmedium Claude Opus 4.6mediumvsQwen3.5-Flashnone Kimi K2.5mediumvsQwen3.5-Flashnone