AI BENCHY तुलना

Inception: Mercury 2 vs OpenAI: GPT-5.5

सारांश

Mercury 2 vs GPT-5.5 benchmark तुलना: GPT-5.5 average score में आगे है: 9.3 vs 7.5. Mercury 2 की benchmark लागत कम है: $0.058 vs $0.907. Mercury 2 तेज है: 2.24s vs 9.76s, pass rates 54.0% vs 85.7%.

अनुशंसित मॉडल: GPT-5.5 - It has the strongest score in this comparison (9.3) and the best overall balance of cost and response time across all 2 models.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-18

मेट्रिक	Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24	GPT-5.5 GPT-5.5 low रिलीज़: 2026-04-24

मेट्रिक	Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24	GPT-5.5 GPT-5.5 low रिलीज़: 2026-04-24
स्कोर	7.5	9.3
रैंक	#44	#4
विश्वसनीयता	10.0	10.0
संगति	8.8	10.0
सही परीक्षण
प्रति प्रयास पास दर	54.0%	85.7%
अस्थिर टेस्ट	3	0
कुल रन	63	63
प्रति परिणाम लागत	0.578	5.035
कुल लागत	$0.058	$0.907
इनपुट कीमत	$0.250 / 1M	$5.000 / 1M
आउटपुट कीमत	$0.750 / 1M	$30.000 / 1M
कुल इनपुट टोकन	35,116	34,209
आउटपुट टोकन	4,048	2,046
रीजनिंग टोकन	61,219	22,460
प्रतिक्रिया समय (औसत)	2.24s	9.76s
प्रतिक्रिया समय (अधिकतम)	14.63s	56.19s
प्रतिक्रिया समय (कुल)	44.72s	204.92s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#44 Mercury 2

medium

लागत: $0.002
समय: 2.1s
टोकन: 1,702 tok

#4 GPT-5.5

low

लागत: $0.068
समय: 37.0s
टोकन: 2,339 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	6.9	9.9	50.0%	0		1.12s	554	2,546	2,609
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	8.2	7.7	77.8%	1		2.04s	7,065	296	11,328
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	10.0	10.0	100.0%	0		3.28s	12,909	268	4,887
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	7.3	5.9	83.3%	1		1.11s	6,234	183	1,656
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	2.9	7.2	11.1%	1		6.48s	695	41	30,754
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	4.8	10.0	0.0%	0		821ms	456	137	542
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	10.0	10.0	100.0%	0		1.07s	340	14	958
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	5.4	10.0	33.3%	0		949ms	601	361	2,781
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	10.0	10.0	100.0%	0		1.89s	6,080	180	1,956
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Mercury 2	3.0	10.0	0.0%	0		2.58s	182	22	3,748
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840

त्वरित तुलना

तुलना जोड़ी बदलें

Mercury 2mediumvsGPT-5.3 Chatnone GPT-5.5lowvsQwen3.7 Maxmedium DeepSeek V4 ProhighvsMercury 2medium Claude Fable 5mediumvsGPT-5.5low Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Mercury 2mediumvsStep 3.7 Flashlow Gemini 3 Flash PreviewlowvsMercury 2medium Gemini 3.5 FlashmediumvsGPT-5.5low Claude Sonnet 4.6nonevsMercury 2medium Gemini 3 Flash PreviewmediumvsGPT-5.5low Claude Opus 4.8nonevsMercury 2medium DeepSeek V4 PrononevsMercury 2medium