AI BENCHY Compare

OpenAI: GPT-5.5 vs Qwen: Qwen3.5-9B

خلاصہ

GPT-5.5 vs Qwen3.5-9B benchmark موازنہ: GPT-5.5 average score میں آگے ہے: 9.3 vs 3.8. Qwen3.5-9B کی benchmark لاگت کم ہے: $0.036 vs $0.907. GPT-5.5 تیز ہے: 9.76s vs 82.24s، pass rates 85.7% vs 27.0%.

تجویز کردہ ماڈل: GPT-5.5 - It has the best score here (9.3), while responding about 8.4x faster than Qwen3.5-9B.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-06-18

میٹرک	GPT-5.5 GPT-5.5 low اجرا: 2026-04-24	Qwen3.5-9B Qwen3.5-9B medium اجرا: 2026-03-02

میٹرک	GPT-5.5 GPT-5.5 low اجرا: 2026-04-24	Qwen3.5-9B Qwen3.5-9B medium اجرا: 2026-03-02
اسکور	9.3	3.8
درجہ	#4	#165
اعتماد پذیری	10.0	6.7
تسلسل	10.0	8.0
درست ٹیسٹس
فی کوشش کامیابی کی شرح	85.7%	27.0%
غیر مستحکم ٹیسٹ	0	5
کل رنز	63	63
فی نتیجہ لاگت	5.035	1.187
کل لاگت	$0.907	$0.036
ان پٹ قیمت	$5.000 / 1M	$0.100 / 1M
آؤٹ پٹ قیمت	$30.000 / 1M	$0.150 / 1M
کل ان پٹ ٹوکنز	34,209	17,070
آؤٹ پٹ ٹوکنز	2,046	29,045
ریزننگ ٹوکنز	22,460	209,516
ردِعمل کا وقت (اوسط)	9.76s	82.24s
ردِعمل کا وقت (زیادہ سے زیادہ)	56.19s	226.38s
ردِعمل کا وقت (کل)	204.92s	1315.88s

جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 GPT-5.5

low

لاگت: $0.068
وقت: 37.0s
ٹوکنز: 2,339 tok

#165 Qwen3.5-9B

medium

لاگت: $0.001
وقت: 35.9s
ٹوکنز: 3,030 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

اینٹی اے آئی چالیں	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020
Qwen3.5-9B	5.1	5.8	50.0%	2		34.44s	369	2,621	12,411

کوڈنگ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402
Qwen3.5-9B	2.9	10.0	0.0%	0		100.88s	2,396	7,890	41,129

مشترکہ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717
Qwen3.5-9B	3.0	10.0	0.0%	0		0ms	0	0	0

ڈیٹا پارسنگ اور استخراج	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157
Qwen3.5-9B	3.6	5.6	33.3%	1		87.31s	4,722	1,383	32,113

ڈومین مخصوص	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609
Qwen3.5-9B	3.6	7.2	22.2%	1		137.75s	295	11,549	48,475

عمومی ذہانت	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245
Qwen3.5-9B	2.8	1.6	33.3%	1		226.38s	180	0	30,695

ہدایات کی پیروی	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415
Qwen3.5-9B	6.5	10.0	50.0%	0		5.75s	381	491	1,824

پہیلی حل کرنا	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954
Qwen3.5-9B	3.0	10.0	0.0%	0		32.27s	376	1,593	12,026

ٹول کالنگ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101
Qwen3.5-9B	10.0	10.0	100.0%	0		4.31s	8,283	444	1,149

معلومات عامہ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840
Qwen3.5-9B	3.0	10.0	0.0%	0		177.02s	68	3,074	29,694

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں

GPT-5.5lowvsQwen3.7 Maxmedium Claude Fable 5mediumvsGPT-5.5low Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Gemini 3.5 FlashmediumvsGPT-5.5low gpt-oss-120bnoneمفت دستیابvsQwen3.5-9Bmedium Granite 4.1 8BnonevsQwen3.5-9Bmedium Gemini 3 Flash PreviewmediumvsGPT-5.5low GPT-5.5lowvsQwen3.6 Max Previewmedium Claude Opus 4.8mediumvsGPT-5.5low Gemini 3.5 FlashhighvsGPT-5.5low Qwen3.5-9BmediumvsGrok 4.20none Claude Opus 4.7mediumvsGPT-5.5low