AI BENCHY तुलना

Qwen3.6 Plus Preview vs Grok 4.20 Multi Agent Beta

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-05-01

मेट्रिक	Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium रिलीज़: 2026-04-20 निःशुल्क उपलब्ध	Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium रिलीज़: 2026-03-12

मेट्रिक	Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium रिलीज़: 2026-04-20 निःशुल्क उपलब्ध	Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium रिलीज़: 2026-03-12
स्कोर	8.5	6.6
रैंक	#15	#71
विश्वसनीयता	लागू नहीं	लागू नहीं
संगति	10.0	7.4
सही परीक्षण
प्रति प्रयास पास दर	76.5%	63.0%
अस्थिर टेस्ट	0	6
कुल रन	49	52
प्रति परिणाम लागत	0.000	63.414
कुल लागत	$0.000	$5.074
???? ???	$0.000 / 1M	$0.000 / 1M
????? ???	$0.000 / 1M	$0.000 / 1M
आउटपुट टोकन	1,756	299,034
रीजनिंग टोकन	77,213	309,670
प्रतिक्रिया समय (औसत)	13.94s	9.80s
प्रतिक्रिया समय (अधिकतम)	43.55s	35.28s
प्रतिक्रिया समय (कुल)	237.01s	156.75s

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		9.90s	207	7,557
Grok 4.20 Multi Agent Beta	6.9	5.8	75.0%	2		3.46s	33,706	33,077

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		34.95s	452	13,073
Grok 4.20 Multi Agent Beta	3.0	10.0	0.0%	0		0ms	0	0

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		14.95s	270	10,706
Grok 4.20 Multi Agent Beta	10.0	10.0	100.0%	0		5.54s	25,306	25,051

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Qwen3.6 Plus Preview	3.0	10.0	0.0%	0		22.08s	49	26,895
Grok 4.20 Multi Agent Beta	2.9	7.2	11.1%	1		24.67s	164,609	163,647

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Qwen3.6 Plus Preview	5.1	10.0	0.0%	0		27.05s	111	5,232
Grok 4.20 Multi Agent Beta	5.8	2.8	66.7%	1		6.40s	15,848	15,746

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		7.54s	102	5,552
Grok 4.20 Multi Agent Beta	9.8	10.0	100.0%	0		4.63s	25,457	25,322

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		6.11s	298	6,868
Grok 4.20 Multi Agent Beta	7.2	5.1	77.8%	2		5.01s	34,022	33,686

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Qwen3.6 Plus Preview	10.0	10.0	100.0%	0		5.87s	267	1,330
Grok 4.20 Multi Agent Beta	3.0	10.0	0.0%	0		0ms	0	0

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Qwen3.6 Plus Preview	-	-	-	-	-	-	-	-
Grok 4.20 Multi Agent Beta	10.0	10.0	100.0%	0		27.11s	86	13,141

त्वरित तुलना

तुलना जोड़ी बदलें

Qwen3.6 Plus Previewmediumनिःशुल्क उपलब्धvsHY3 Previewhighनिःशुल्क उपलब्ध Qwen3.6 Plus Previewmediumनिःशुल्क उपलब्धvsHY3 Previewlowनिःशुल्क उपलब्ध Gemini 3 Flash PreviewnonevsQwen3.6 Plus Previewmediumनिःशुल्क उपलब्ध Gemini 3 Flash PreviewlowvsQwen3.6 Plus Previewmediumनिःशुल्क उपलब्ध Gemini 3.1 Flash Lite PreviewlowvsQwen3.6 Plus Previewmediumनिःशुल्क उपलब्ध GPT-5.2 ChatnonevsQwen3.6 Plus Previewmediumनिःशुल्क उपलब्ध Gemini 3.1 Flash Lite PreviewnonevsQwen3.6 Plus Previewmediumनिःशुल्क उपलब्ध GPT-5.5lowvsQwen3.6 Plus Previewmediumनिःशुल्क उपलब्ध GPT-5.3 ChatnonevsQwen3.6 Plus Previewmediumनिःशुल्क उपलब्ध DeepSeek V4 FlashhighvsQwen3.6 Plus Previewmediumनिःशुल्क उपलब्ध Claude Opus 4.7nonevsQwen3.6 Plus Previewmediumनिःशुल्क उपलब्ध Claude Sonnet 4.6nonevsQwen3.6 Plus Previewmediumनिःशुल्क उपलब्ध