AI BENCHY तुलना

OpenAI: GPT-5.2 vs Qwen: Qwen3.5-Flash

सारांश

GPT-5.2 vs Qwen3.5-Flash benchmark तुलना: GPT-5.2 average score में आगे है: 8.4 vs 6.8. Qwen3.5-Flash की benchmark लागत कम है: $0.080 vs $0.548. GPT-5.2 तेज है: 16.88s vs 63.29s, pass rates 71.4% vs 71.4%.

अनुशंसित मॉडल: GPT-5.2 - It has the best score here (8.4), while responding about 3.7x faster than Qwen3.5-Flash.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-18

मेट्रिक	GPT-5.2 GPT-5.2 medium रिलीज़: 2025-12-11	Qwen3.5-Flash Qwen3.5-Flash medium रिलीज़: 2026-02-24

मेट्रिक	GPT-5.2 GPT-5.2 medium रिलीज़: 2025-12-11	Qwen3.5-Flash Qwen3.5-Flash medium रिलीज़: 2026-02-24
स्कोर	8.4	6.8
रैंक	#22	#70
विश्वसनीयता	10.0	10.0
संगति	8.4	8.1
सही परीक्षण
प्रति प्रयास पास दर	71.4%	71.4%
अस्थिर टेस्ट	4	5
कुल रन	63	63
प्रति परिणाम लागत	4.209	0.871
कुल लागत	$0.548	$0.080
इनपुट कीमत	$1.750 / 1M	$0.065 / 1M
आउटपुट कीमत	$14.000 / 1M	$0.260 / 1M
कुल इनपुट टोकन	33,967	38,926
आउटपुट टोकन	2,901	2,088
रीजनिंग टोकन	31,932	294,598
प्रतिक्रिया समय (औसत)	16.88s	63.29s
प्रतिक्रिया समय (अधिकतम)	77.80s	234.29s
प्रतिक्रिया समय (कुल)	236.34s	1265.85s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#22 GPT-5.2

medium

लागत: $0.047
समय: 49.2s
टोकन: 3,396 tok

#70 Qwen3.5-Flash

medium

लागत: $0.002
समय: 25.8s
टोकन: 4,294 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.2	6.5	8.0	58.3%	1		7.81s	606	567	2,002
Qwen3.5-Flash	10.0	10.0	100.0%	0		59.11s	672	383	32,992

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.2	10.0	10.0	100.0%	0		22.73s	7,302	511	11,912
Qwen3.5-Flash	3.7	7.2	22.2%	1		58.87s	6,685	302	90,081

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.2	10.0	10.0	100.0%	0		14.06s	11,019	291	1,757
Qwen3.5-Flash	10.0	10.0	100.0%	0		17.78s	14,934	483	8,270

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.2	10.0	10.0	100.0%	0		3.15s	7,140	234	420
Qwen3.5-Flash	7.3	5.9	83.3%	1		56.99s	6,061	235	16,237

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.2	5.9	7.2	55.6%	1		77.80s	473	42	10,342
Qwen3.5-Flash	5.3	7.2	44.4%	1		146.50s	581	58	43,615

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.2	3.7	9.7	0.0%	0		4.32s	477	162	269
Qwen3.5-Flash	6.1	3.1	66.7%	1		40.05s	516	99	38,486

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.2	9.9	10.0	100.0%	0		3.12s	660	94	614
Qwen3.5-Flash	10.0	10.0	100.0%	0		63.49s	699	98	14,139

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.2	7.5	7.3	77.8%	1		5.80s	642	735	924
Qwen3.5-Flash	8.2	7.2	88.9%	1		27.61s	381	89	12,457

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.2	4.7	1.6	66.7%	1		10.30s	5,453	239	469
Qwen3.5-Flash	10.0	10.0	100.0%	0		10.33s	8,193	309	1,284

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.2	3.0	10.0	0.0%	0		28.18s	195	26	3,223
Qwen3.5-Flash	3.0	10.0	0.0%	0		48.98s	204	32	37,037

त्वरित तुलना

तुलना जोड़ी बदलें