OpenAI: GPT-5.5 vs Qwen: Qwen3.7 Plus

GPT-5.5 (low) average score में आगे है: 9.3 vs 7.9. Qwen3.7 Plus (medium) की benchmark लागत कम है: $0.267 vs $1.253. GPT-5.5 (low) तेज है: 10.13s vs 51.51s, pass rates 86.4% vs 75.8%.

अनुशंसित मॉडलGPT-5.5 (low)It has the best score here (9.3), while responding about 5.1x faster than Qwen3.7 Plus (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-18

मेट्रिक	GPT-5.5 GPT-5.5 low रिलीज़: 2026-04-24	Qwen3.7 Plus Qwen3.7 Plus medium रिलीज़: 2026-06-03

मेट्रिक	GPT-5.5 GPT-5.5 low रिलीज़: 2026-04-24	Qwen3.7 Plus Qwen3.7 Plus medium रिलीज़: 2026-06-03
स्कोर	9.3	7.9
रैंक	#6	#36
विश्वसनीयता	10.0	10.0
संगति	10.0	8.9
सही परीक्षण
प्रति प्रयास पास दर	86.4%	75.8%
अस्थिर टेस्ट	0	3
कुल रन	66	66
प्रति परिणाम लागत	6.594	2.072
कुल लागत	$1.253	$0.267
इनपुट कीमत	$5.000 / 1M	$0.320 / 1M
आउटपुट कीमत	$30.000 / 1M	$1.280 / 1M
कुल इनपुट टोकन	80,058	115,233
आउटपुट टोकन	5,378	6,162
रीजनिंग टोकन	23,040	173,267
प्रतिक्रिया समय (औसत)	10.13s	51.51s
प्रतिक्रिया समय (अधिकतम)	56.19s	315.30s
प्रतिक्रिया समय (कुल)	222.82s	1133.15s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#6 GPT-5.5

low

लागत: $0.068
समय: 37.0s
टोकन: 2,339 tok

#36 Qwen3.7 Plus

medium

लागत: $0.018
समय: 193.2s
टोकन: 10,821 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

श्रेणी:

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020
Qwen3.7 Plus	10.0	10.0	100.0%	0		8.58s	672	195	5,065

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402
Qwen3.7 Plus	6.1	6.6	55.6%	1		108.60s	6,472	414	43,576

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		13.73s	56,868	3,635	1,297
Qwen3.7 Plus	8.2	6.9	66.7%	1		190.27s	89,228	4,403	57,645

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157
Qwen3.7 Plus	10.0	10.0	100.0%	0		21.75s	7,782	270	6,713

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609
Qwen3.7 Plus	3.6	7.2	22.2%	1		45.35s	771	57	27,073

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245
Qwen3.7 Plus	10.0	10.0	100.0%	0		25.48s	516	123	3,998

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.13s	699	102	5,013

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.38s	696	280	7,312

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101
Qwen3.7 Plus	10.0	10.0	100.0%	0		15.02s	8,193	292	1,831

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840
Qwen3.7 Plus	3.0	10.0	0.0%	0		91.07s	204	26	15,041

त्वरित तुलना

तुलना जोड़ी बदलें

GPT-5.6 TerrahighvsQwen3.7 Plusmedium Kimi K3maxvsQwen3.7 Plusmedium Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Claude Opus 4.8lowvsQwen3.7 Plusmedium Qwen3.7 PlusmediumvsGLM 5.2high GPT-5.2 ChatnonevsQwen3.7 Plusmedium GPT-5.6 LunahighvsQwen3.7 Plusmedium Qwen3.7 PlusmediumvsInklinghigh GPT-5.5lowvsQwen3.7 Maxmedium DeepSeek V4 FlashhighvsQwen3.7 Plusmedium Gemini 3.5 FlashmediumvsGPT-5.5low Muse Spark 1.1highvsQwen3.7 Plusmedium