AI BENCHY तुलना

OpenAI: GPT-5.4 Mini vs Qwen: Qwen3.7 Plus

सारांश

GPT-5.4 Mini vs Qwen3.7 Plus benchmark तुलना: Qwen3.7 Plus average score में आगे है: 8.2 vs 8.0. Qwen3.7 Plus की benchmark लागत कम है: $0.177 vs $0.526. GPT-5.4 Mini तेज है: 22.34s vs 38.95s, pass rates 73.0% vs 77.8%.

अनुशंसित मॉडल: Qwen3.7 Plus - It has the best score here (8.2), while costing about 3.0x less than GPT-5.4 Mini.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-12

मेट्रिक	GPT-5.4 Mini GPT-5.4 Mini medium रिलीज़: 2026-03-17	Qwen3.7 Plus Qwen3.7 Plus medium रिलीज़: 2026-06-03

मेट्रिक	GPT-5.4 Mini GPT-5.4 Mini medium रिलीज़: 2026-03-17	Qwen3.7 Plus Qwen3.7 Plus medium रिलीज़: 2026-06-03
स्कोर	8.0	8.2
रैंक	#30	#28
विश्वसनीयता	10.0	10.0
संगति	8.0	9.1
सही परीक्षण
प्रति प्रयास पास दर	73.0%	77.8%
अस्थिर टेस्ट	5	2
कुल रन	63	63
प्रति परिणाम लागत	4.381	1.474
कुल लागत	$0.526	$0.177
इनपुट कीमत	$0.750 / 1M	$0.320 / 1M
आउटपुट कीमत	$4.500 / 1M	$1.280 / 1M
कुल इनपुट टोकन	34,116	40,939
आउटपुट टोकन	2,181	2,125
रीजनिंग टोकन	108,937	125,754
प्रतिक्रिया समय (औसत)	22.34s	38.95s
प्रतिक्रिया समय (अधिकतम)	138.75s	178.04s
प्रतिक्रिया समय (कुल)	469.20s	817.85s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#30 GPT-5.4 Mini

medium

Cost: $0.056
Time: 95.5s
Tokens: 12,464 tok

#28 Qwen3.7 Plus

medium

Cost: $0.018
Time: 193.2s
Tokens: 10,821 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	8.6	7.9	91.7%	1		4.05s	606	296	2,876
Qwen3.7 Plus	10.0	10.0	100.0%	0		8.58s	672	195	5,065

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	8.4	7.4	88.9%	1		57.87s	7,305	467	40,902
Qwen3.7 Plus	6.1	6.6	55.6%	1		108.60s	6,472	414	43,576

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	10.0	10.0	100.0%	0		17.81s	11,019	317	4,317
Qwen3.7 Plus	10.0	10.0	100.0%	0		65.24s	14,934	366	10,132

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	10.0	10.0	100.0%	0		2.43s	7,140	234	650
Qwen3.7 Plus	10.0	10.0	100.0%	0		21.75s	7,782	270	6,713

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	4.1	4.4	44.5%	2		65.31s	619	60	43,286
Qwen3.7 Plus	3.6	7.2	22.2%	1		45.35s	771	57	27,073

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	4.5	10.0	0.0%	0		3.72s	477	150	510
Qwen3.7 Plus	10.0	10.0	100.0%	0		25.48s	516	123	3,998

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	9.8	10.0	100.0%	0		2.13s	660	96	1,185
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.13s	699	102	5,013

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	7.8	10.0	66.7%	0		4.37s	642	278	2,443
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.38s	696	280	7,312

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	4.7	1.6	66.7%	1		9.62s	5,453	251	2,594
Qwen3.7 Plus	10.0	10.0	100.0%	0		15.02s	8,193	292	1,831

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.4 Mini	3.0	10.0	0.0%	0		30.10s	195	32	10,174
Qwen3.7 Plus	3.0	10.0	0.0%	0		91.07s	204	26	15,041

त्वरित तुलना

तुलना जोड़ी बदलें

DeepSeek V4 FlashhighvsQwen3.7 Plusmedium DeepSeek V4 FlashhighvsGPT-5.4 Minimedium GPT-5.4 MinimediumvsStep 3.7 Flashlow GPT-5.2 ChatnonevsQwen3.7 Plusmedium Qwen3.7 PlusmediumvsStep 3.7 Flashlow Gemini 3 Flash PreviewlowvsGPT-5.4 Minimedium GPT-5.3 ChatnonevsQwen3.7 Plusmedium Claude Sonnet 4.6nonevsGPT-5.4 Minimedium Claude Opus 4.8nonevsGPT-5.4 Minimedium Gemini 3 Flash PreviewlowvsQwen3.7 Plusmedium GPT-5.4 MinimediumvsQwen3.7 Plusnone Claude Sonnet 4.6nonevsQwen3.7 Plusmedium