AI BENCHY Compare

Qwen: Qwen3.7 Plus vs xAI: Grok Build 0.1

خلاصہ

Qwen3.7 Plus vs Grok Build 0.1 benchmark موازنہ: Grok Build 0.1 average score میں آگے ہے: 7.6 vs 7.2. Qwen3.7 Plus کی benchmark لاگت کم ہے: $0.023 vs $0.927. Qwen3.7 Plus تیز ہے: 2.85s vs 49.90s، pass rates 47.6% vs 61.9%.

تجویز کردہ ماڈل: Qwen3.7 Plus - Its score stays close to the best score here (7.2 vs 7.6), while costing about 42.0x less than Grok Build 0.1.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-07-02

میٹرک	Qwen3.7 Plus Qwen3.7 Plus none اجرا: 2026-06-03	Grok Build 0.1 Grok Build 0.1 medium اجرا: 2026-05-21

میٹرک	Qwen3.7 Plus Qwen3.7 Plus none اجرا: 2026-06-03	Grok Build 0.1 Grok Build 0.1 medium اجرا: 2026-05-21
اسکور	7.2	7.6
درجہ	#62	#44
اعتماد پذیری	10.0	10.0
تسلسل	10.0	9.9
درست ٹیسٹس
فی کوشش کامیابی کی شرح	47.6%	61.9%
غیر مستحکم ٹیسٹ	0	0
کل رنز	63	63
فی نتیجہ لاگت	0.276	7.124
کل لاگت	$0.023	$0.927
ان پٹ قیمت	$0.320 / 1M	$1.000 / 1M
آؤٹ پٹ قیمت	$1.280 / 1M	$2.000 / 1M
کل ان پٹ ٹوکنز	42,510	44,418
آؤٹ پٹ ٹوکنز	6,578	2,782
ریزننگ ٹوکنز	0	438,018
ردِعمل کا وقت (اوسط)	2.85s	49.90s
ردِعمل کا وقت (زیادہ سے زیادہ)	29.38s	252.69s
ردِعمل کا وقت (کل)	59.86s	1047.92s

جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#62 Qwen3.7 Plus

none

لاگت: $0.019
وقت: 213.5s
ٹوکنز: 11,960 tok

#44 xAI: Grok Build 0.1

medium

لاگت: $0.028
وقت: 81.3s
ٹوکنز: 14,009 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

اینٹی اے آئی چالیں	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Qwen3.7 Plus	6.5	10.0	50.0%	0		1.38s	696	349	0
Grok Build 0.1	8.3	10.0	75.0%	0		7.43s	2,010	220	12,162

کوڈنگ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Qwen3.7 Plus	5.5	10.0	33.3%	0		2.15s	7,911	639	0
Grok Build 0.1	5.7	9.7	33.3%	0		108.46s	8,304	1,138	161,452

مشترکہ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Qwen3.7 Plus	10.0	10.0	100.0%	0		29.38s	14,952	4,505	0
Grok Build 0.1	10.0	10.0	100.0%	0		32.81s	12,909	231	16,917

ڈیٹا پارسنگ اور استخراج	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Qwen3.7 Plus	10.0	10.0	100.0%	0		1.43s	7,794	243	0
Grok Build 0.1	10.0	10.0	100.0%	0		10.72s	7,761	180	8,876

ڈومین مخصوص	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Qwen3.7 Plus	3.0	10.0	0.0%	0		868ms	789	18	0
Grok Build 0.1	5.3	10.0	33.3%	0		158.00s	1,764	492	175,294

عمومی ذہانت	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Qwen3.7 Plus	5.3	10.0	0.0%	0		1.33s	522	78	0
Grok Build 0.1	4.4	9.9	0.0%	0		18.41s	825	76	6,345

ہدایات کی پیروی	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Qwen3.7 Plus	6.3	10.0	50.0%	0		929ms	711	72	0
Grok Build 0.1	9.8	10.0	100.0%	0		12.36s	1,362	57	9,599

پہیلی حل کرنا	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Qwen3.7 Plus	7.7	10.0	66.7%	0		1.71s	714	443	0
Grok Build 0.1	7.7	10.0	66.7%	0		18.26s	1,689	195	20,841

ٹول کالنگ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Qwen3.7 Plus	10.0	10.0	100.0%	0		3.54s	8,211	222	0
Grok Build 0.1	10.0	10.0	100.0%	0		13.12s	7,263	180	4,969

معلومات عامہ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Qwen3.7 Plus	3.0	10.0	0.0%	0		1.21s	210	9	0
Grok Build 0.1	3.0	10.0	0.0%	0		53.51s	531	13	21,563

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں

Gemma 4 26B A4Bmediumمفت دستیابvsQwen3.7 Plusnone DeepSeek V4 ProhighvsGrok Build 0.1medium Qwen3.7 PlusnonevsStep 3.7 Flashhigh Qwen3.7 PlusnonevsGLM 5.1medium GPT-5.3 ChatnonevsGrok Build 0.1medium Step 3.7 FlashlowvsGrok Build 0.1medium Laguna XS 2.1mediumمفت دستیابvsQwen3.7 Plusnone Claude Opus 4.8lowvsGrok Build 0.1medium Kimi K2.7 CodemediumvsQwen3.7 Plusnone Qwen3.7 PlusnonevsGrok 4.20medium Gemini 3 Flash PreviewlowvsQwen3.7 Plusnone Gemini 3 Flash PreviewlowvsGrok Build 0.1medium