AI BENCHY Compare

Inception: Mercury 2 vs OpenAI: GPT-5.5

सारांश

Mercury 2 vs GPT-5.5 benchmark तुलना: GPT-5.5 average score मध्ये पुढे आहे: 9.3 vs 7.5. Mercury 2 चा benchmark खर्च कमी आहे: $0.058 vs $0.907. Mercury 2 वेगवान आहे: 2.24s vs 9.76s, pass rates 54.0% vs 85.7%.

शिफारस केलेले मॉडेल: GPT-5.5 - It has the strongest score in this comparison (9.3) and the best overall balance of cost and response time across all 2 models.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-06-18

मेट्रिक	Mercury 2 Mercury 2 medium प्रकाशन: 2026-02-24	GPT-5.5 GPT-5.5 low प्रकाशन: 2026-04-24

मेट्रिक	Mercury 2 Mercury 2 medium प्रकाशन: 2026-02-24	GPT-5.5 GPT-5.5 low प्रकाशन: 2026-04-24
स्कोअर	7.5	9.3
क्रमांक	#44	#4
विश्वसनीयता	10.0	10.0
सुसंगतता	8.8	10.0
बरोबर चाचण्या
प्रति प्रयत्न पास दर	54.0%	85.7%
अस्थिर चाचण्या	3	0
एकूण रन	63	63
प्रति निकाल खर्च	0.578	5.035
एकूण खर्च	$0.058	$0.907
इनपुट किंमत	$0.250 / 1M	$5.000 / 1M
आउटपुट किंमत	$0.750 / 1M	$30.000 / 1M
एकूण इनपुट टोकन्स	35,116	34,209
आउटपुट टोकन्स	4,048	2,046
रिझनिंग टोकन्स	61,219	22,460
प्रतिसाद वेळ (सरासरी)	2.24s	9.76s
प्रतिसाद वेळ (कमाल)	14.63s	56.19s
प्रतिसाद वेळ (एकूण)	44.72s	204.92s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#44 Mercury 2

medium

खर्च: $0.002
वेळ: 2.1s
टोकन्स: 1,702 tok

#4 GPT-5.5

low

खर्च: $0.068
वेळ: 37.0s
टोकन्स: 2,339 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

अँटी-एआय युक्त्या	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Mercury 2	6.9	9.9	50.0%	0		1.12s	554	2,546	2,609
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020

कोडिंग	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Mercury 2	8.2	7.7	77.8%	1		2.04s	7,065	296	11,328
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402

संयुक्त	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Mercury 2	10.0	10.0	100.0%	0		3.28s	12,909	268	4,887
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717

डेटा पार्सिंग आणि निष्कर्षण	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Mercury 2	7.3	5.9	83.3%	1		1.11s	6,234	183	1,656
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157

डोमेन-विशिष्ट	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Mercury 2	2.9	7.2	11.1%	1		6.48s	695	41	30,754
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609

Samanya Buddhimatta	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Mercury 2	4.8	10.0	0.0%	0		821ms	456	137	542
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245

सूचनांचे पालन	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Mercury 2	10.0	10.0	100.0%	0		1.07s	340	14	958
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415

कोडी सोडवणे	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Mercury 2	5.4	10.0	33.3%	0		949ms	601	361	2,781
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954

टूल कॉलिंग	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Mercury 2	10.0	10.0	100.0%	0		1.89s	6,080	180	1,956
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101

सामान्य ज्ञान	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Mercury 2	3.0	10.0	0.0%	0		2.58s	182	22	3,748
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840

झटपट तुलना

तुलना जोडी बदला

Mercury 2mediumvsGPT-5.3 Chatnone GPT-5.5lowvsQwen3.7 Maxmedium DeepSeek V4 ProhighvsMercury 2medium Claude Fable 5mediumvsGPT-5.5low Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Mercury 2mediumvsStep 3.7 Flashlow Gemini 3 Flash PreviewlowvsMercury 2medium Gemini 3.5 FlashmediumvsGPT-5.5low Claude Sonnet 4.6nonevsMercury 2medium Gemini 3 Flash PreviewmediumvsGPT-5.5low Claude Opus 4.8nonevsMercury 2medium DeepSeek V4 PrononevsMercury 2medium