AI BENCHY तुलना

Inception: Mercury 2 vs Qwen: Qwen3.5-122B-A10B

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-03

मेट्रिक	Mercury 2 Mercury 2 none रिलीज़: 2026-02-24	Qwen3.5-122B-A10B Qwen3.5-122B-A10B none रिलीज़: 2026-02-24

मेट्रिक	Mercury 2 Mercury 2 none रिलीज़: 2026-02-24	Qwen3.5-122B-A10B Qwen3.5-122B-A10B none रिलीज़: 2026-02-24
स्कोर	4.6	5.4
रैंक	#153	#131
विश्वसनीयता	10.0	10.0
संगति	9.1	9.5
सही परीक्षण
प्रति प्रयास पास दर	25.0%	33.3%
अस्थिर टेस्ट	2	1
कुल रन	60	60
प्रति परिणाम लागत	0.216	0.380
कुल लागत	$0.009	$0.019
इनपुट कीमत	$0.250 / 1M	$0.260 / 1M
आउटपुट कीमत	$0.750 / 1M	$2.080 / 1M
कुल इनपुट टोकन	25,515	44,894
आउटपुट टोकन	3,001	3,374
रीजनिंग टोकन	0	0
प्रतिक्रिया समय (औसत)	614ms	3.38s
प्रतिक्रिया समय (अधिकतम)	1.27s	46.00s
प्रतिक्रिया समय (कुल)	12.28s	67.55s

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	3.0	10.0	0.0%	0		483ms	631	286	0
Qwen3.5-122B-A10B	4.8	10.0	25.0%	0		1.59s	696	312	0

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	3.5	9.4	0.0%	0		831ms	4,631	1,650	0
Qwen3.5-122B-A10B	4.0	5.5	33.3%	1		2.14s	5,072	684	0

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	3.0	10.0	0.0%	0		606ms	4,821	131	0
Qwen3.5-122B-A10B	3.0	10.0	0.0%	0		46.00s	20,175	1,137	0

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	7.3	5.9	83.3%	1		667ms	6,362	180	0
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		1.01s	7,794	243	0

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	5.3	7.2	44.4%	1		534ms	784	46	0
Qwen3.5-122B-A10B	5.3	10.0	33.3%	0		465ms	789	15	0

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	4.8	10.0	0.0%	0		628ms	495	159	0
Qwen3.5-122B-A10B	5.0	10.0	0.0%	0		1.12s	522	66	0

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	6.5	10.0	50.0%	0		551ms	691	82	0
Qwen3.5-122B-A10B	6.3	10.0	50.0%	0		513ms	711	69	0

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	3.1	10.0	0.0%	0		535ms	694	251	0
Qwen3.5-122B-A10B	3.8	10.0	0.0%	0		1.00s	714	575	0

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	10.0	10.0	100.0%	0		1.27s	6,193	197	0
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		2.04s	8,211	264	0

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	3.0	10.0	0.0%	0		548ms	213	19	0
Qwen3.5-122B-A10B	3.0	10.0	0.0%	0		295ms	210	9	0

त्वरित तुलना

तुलना जोड़ी बदलें

Mistral Small 4mediumvsQwen3.5-122B-A10Bnone MiniMax M2.7mediumvsQwen3.5-122B-A10Bnone Elephant AlphamediumvsQwen3.5-122B-A10Bnone MiniMax M2.5mediumvsQwen3.5-122B-A10Bnone Mercury 2nonevsQwen3 Coder Nextmedium Mercury 2nonevsGLM 4.7 Flashmedium Mercury 2nonevsQwen3.5-9Bmedium CobuddymediumvsQwen3.5-122B-A10Bnone Owl AlphamediumvsQwen3.5-122B-A10Bnone gpt-oss-120bmediumनिःशुल्क उपलब्धvsQwen3.5-122B-A10Bnone Nemotron 3 Supermediumनिःशुल्क उपलब्धvsQwen3.5-122B-A10Bnone Mercury 2nonevsElephant Alphamedium