AI BENCHY Compare

Qwen: Qwen3.5-27B vs xAI: Grok 4.20

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-04-02

मेट्रिक	Qwen3.5-27B Qwen3.5-27B none प्रकाशन: 2026-02-24	Grok 4.20 Grok 4.20 none प्रकाशन: 2026-03-31

मेट्रिक	Qwen3.5-27B Qwen3.5-27B none प्रकाशन: 2026-02-24	Grok 4.20 Grok 4.20 none प्रकाशन: 2026-03-31
स्कोअर	5.6	5.4
क्रमांक	#65	#69
सुसंगतता	9.1	9.5
बरोबर चाचण्या
प्रति प्रयत्न पास दर	35.3%	31.4%
अस्थिर चाचण्या	2	1
एकूण रन	51	51
प्रति निकाल खर्च	0.303	1.809
एकूण खर्च	$0.016	$0.091
???? ???	$0.195 / 1M	$2.000 / 1M
????? ???	$1.560 / 1M	$6.000 / 1M
आउटपुट टोकन्स	3,164	1,655
रिझनिंग टोकन्स	0	0
प्रतिसाद वेळ (सरासरी)	1.70s	1.11s
प्रतिसाद वेळ (कमाल)	9.39s	6.04s
प्रतिसाद वेळ (एकूण)	28.82s	18.80s

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

अँटी-एआय युक्त्या	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.5-27B	4.8	10.0	25.0%	0		788ms	267	0
Grok 4.20	4.8	10.0	25.0%	0		501ms	267	0

संयुक्त	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.5-27B	2.8	1.6	33.3%	1		9.39s	1,461	0
Grok 4.20	3.0	10.0	0.0%	0		6.04s	282	0

डेटा पार्सिंग आणि निष्कर्षण	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.5-27B	10.0	10.0	100.0%	0		1.43s	243	0
Grok 4.20	10.0	10.0	100.0%	0		522ms	207	0

डोमेन-विशिष्ट	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.5-27B	3.0	10.0	0.0%	0		540ms	15	0
Grok 4.20	3.0	10.0	0.0%	0		687ms	325	0

Samanya Buddhimatta	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.5-27B	5.0	10.0	0.0%	0		2.51s	126	0
Grok 4.20	4.8	10.0	0.0%	0		659ms	83	0

सूचनांचे पालन	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.5-27B	4.8	10.0	0.0%	0		815ms	69	0
Grok 4.20	4.8	10.0	0.0%	0		455ms	60	0

Puzzle Solving	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.5-27B	6.7	7.9	55.6%	1		1.37s	680	0
Grok 4.20	5.3	7.4	44.4%	1		487ms	242	0

टूल कॉलिंग	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	आउटपुट टोकन्स	रिझनिंग टोकन्स
Qwen3.5-27B	10.0	10.0	100.0%	0		3.54s	303	0
Grok 4.20	10.0	10.0	100.0%	0		4.63s	189	0

झटपट तुलना

तुलना जोडी बदला

Mistral Small 4mediumvsQwen3.5-27Bnone Mistral Small 4mediumvsGrok 4.20none MiniMax M2.5mediumमोफत उपलब्धvsQwen3.5-27Bnone MiniMax M2.7mediumvsGrok 4.20none gpt-oss-120bmediumमोफत उपलब्धvsQwen3.5-27Bnone MiniMax M2.5mediumमोफत उपलब्धvsGrok 4.20none Qwen3 Coder NextmediumvsGrok 4.20none MiniMax M2.7mediumvsQwen3.5-27Bnone Qwen3.5-27BnonevsGrok 4.20 Multi Agent Betamedium gpt-oss-120bmediumमोफत उपलब्धvsGrok 4.20none GPT-5 NanomediumvsQwen3.5-27Bnone Grok 4.20nonevsGLM 4.7 Flashmedium