AI BENCHY Compare

Qwen: Qwen3.7 Plus vs xAI: Grok Build 0.1

सारांश

Qwen3.7 Plus vs Grok Build 0.1 benchmark तुलना: Grok Build 0.1 average score मध्ये पुढे आहे: 7.6 vs 7.2. Qwen3.7 Plus चा benchmark खर्च कमी आहे: $0.023 vs $0.927. Qwen3.7 Plus वेगवान आहे: 2.85s vs 49.90s, pass rates 47.6% vs 61.9%.

शिफारस केलेले मॉडेल: Qwen3.7 Plus - Its score stays close to the best score here (7.2 vs 7.6), while costing about 42.0x less than Grok Build 0.1.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-02

मेट्रिक	Qwen3.7 Plus Qwen3.7 Plus none प्रकाशन: 2026-06-03	Grok Build 0.1 Grok Build 0.1 medium प्रकाशन: 2026-05-21

मेट्रिक	Qwen3.7 Plus Qwen3.7 Plus none प्रकाशन: 2026-06-03	Grok Build 0.1 Grok Build 0.1 medium प्रकाशन: 2026-05-21
स्कोअर	7.2	7.6
क्रमांक	#62	#44
विश्वसनीयता	10.0	10.0
सुसंगतता	10.0	9.9
बरोबर चाचण्या
प्रति प्रयत्न पास दर	47.6%	61.9%
अस्थिर चाचण्या	0	0
एकूण रन	63	63
प्रति निकाल खर्च	0.276	7.124
एकूण खर्च	$0.023	$0.927
इनपुट किंमत	$0.320 / 1M	$1.000 / 1M
आउटपुट किंमत	$1.280 / 1M	$2.000 / 1M
एकूण इनपुट टोकन्स	42,510	44,418
आउटपुट टोकन्स	6,578	2,782
रिझनिंग टोकन्स	0	438,018
प्रतिसाद वेळ (सरासरी)	2.85s	49.90s
प्रतिसाद वेळ (कमाल)	29.38s	252.69s
प्रतिसाद वेळ (एकूण)	59.86s	1047.92s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#62 Qwen3.7 Plus

none

खर्च: $0.019
वेळ: 213.5s
टोकन्स: 11,960 tok

#44 xAI: Grok Build 0.1

medium

खर्च: $0.028
वेळ: 81.3s
टोकन्स: 14,009 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

अँटी-एआय युक्त्या	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.7 Plus	6.5	10.0	50.0%	0		1.38s	696	349	0
Grok Build 0.1	8.3	10.0	75.0%	0		7.43s	2,010	220	12,162

कोडिंग	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.7 Plus	5.5	10.0	33.3%	0		2.15s	7,911	639	0
Grok Build 0.1	5.7	9.7	33.3%	0		108.46s	8,304	1,138	161,452

संयुक्त	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.7 Plus	10.0	10.0	100.0%	0		29.38s	14,952	4,505	0
Grok Build 0.1	10.0	10.0	100.0%	0		32.81s	12,909	231	16,917

डेटा पार्सिंग आणि निष्कर्षण	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.7 Plus	10.0	10.0	100.0%	0		1.43s	7,794	243	0
Grok Build 0.1	10.0	10.0	100.0%	0		10.72s	7,761	180	8,876

डोमेन-विशिष्ट	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.7 Plus	3.0	10.0	0.0%	0		868ms	789	18	0
Grok Build 0.1	5.3	10.0	33.3%	0		158.00s	1,764	492	175,294

Samanya Buddhimatta	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.7 Plus	5.3	10.0	0.0%	0		1.33s	522	78	0
Grok Build 0.1	4.4	9.9	0.0%	0		18.41s	825	76	6,345

सूचनांचे पालन	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.7 Plus	6.3	10.0	50.0%	0		929ms	711	72	0
Grok Build 0.1	9.8	10.0	100.0%	0		12.36s	1,362	57	9,599

कोडी सोडवणे	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.7 Plus	7.7	10.0	66.7%	0		1.71s	714	443	0
Grok Build 0.1	7.7	10.0	66.7%	0		18.26s	1,689	195	20,841

टूल कॉलिंग	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.7 Plus	10.0	10.0	100.0%	0		3.54s	8,211	222	0
Grok Build 0.1	10.0	10.0	100.0%	0		13.12s	7,263	180	4,969

सामान्य ज्ञान	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.7 Plus	3.0	10.0	0.0%	0		1.21s	210	9	0
Grok Build 0.1	3.0	10.0	0.0%	0		53.51s	531	13	21,563

झटपट तुलना

तुलना जोडी बदला

Gemma 4 26B A4Bmediumमोफत उपलब्धvsQwen3.7 Plusnone DeepSeek V4 ProhighvsGrok Build 0.1medium Qwen3.7 PlusnonevsStep 3.7 Flashhigh Qwen3.7 PlusnonevsGLM 5.1medium GPT-5.3 ChatnonevsGrok Build 0.1medium Step 3.7 FlashlowvsGrok Build 0.1medium Laguna XS 2.1mediumमोफत उपलब्धvsQwen3.7 Plusnone Claude Opus 4.8lowvsGrok Build 0.1medium Kimi K2.7 CodemediumvsQwen3.7 Plusnone Qwen3.7 PlusnonevsGrok 4.20medium Gemini 3 Flash PreviewlowvsQwen3.7 Plusnone Gemini 3 Flash PreviewlowvsGrok Build 0.1medium