- क्रमांक
- #136
- एकूण आउटपुट टोकन्स
- 87,554
- प्रतिसाद वेळ (सरासरी)
- 2.95s
- एकूण खर्च
- $0.094
Mercury 2 (medium) vs GPT-5.5
average score जवळपास समान आहे: 7.0 vs 7.0. Mercury 2 (medium) चा benchmark खर्च कमी आहे: $0.094 vs $0.544. GPT-5.5 वेगवान आहे: 2.35s vs 2.95s, pass rates 53.0% vs 59.1%.
- क्रमांक
- #135
- एकूण आउटपुट टोकन्स
- 4,915
- प्रतिसाद वेळ (सरासरी)
- 2.35s
- एकूण खर्च
- $0.544
शिफारस केलेले मॉडेल
Mercury 2 (medium)
It has the best score here (7.0), while costing about 5.8x less than GPT-5.5.
तपशीलवार तुलना
| मेट्रिक | Mercury 2 Mercury 2 medium | GPT-5.5 GPT-5.5 none |
|---|---|---|
| स्कोअर | 7.0 | 7.0 |
| क्रमांक | #136 | #135 |
| विश्वसनीयता | 10.0 | 10.0 |
| सुसंगतता | 8.4 | 9.2 |
| प्रयत्न | 66/66 | 66/66 |
| बरोबर चाचण्या | ||
| प्रति प्रयत्न पास दर | 53.0% | 59.1% |
| अस्थिर चाचण्या | 4 | 2 |
| एकूण रन | 66 | 66 |
| प्रति निकाल खर्च | 0.933 | 4.533 |
| एकूण खर्च | $0.094 | $0.544 |
| इनपुट किंमत | $0.250 / 1M | $5.000 / 1M |
| आउटपुट किंमत | $0.750 / 1M | $30.000 / 1M |
| एकूण इनपुट टोकन्स | 110,515 | 79,294 |
| आउटपुट टोकन्स | 10,325 | 4,915 |
| रिझनिंग टोकन्स | 77,229 | 0 |
| प्रतिसाद वेळ (सरासरी) | 2.95s | 2.35s |
| प्रतिसाद वेळ (कमाल) | 14.63s | 12.24s |
| प्रतिसाद वेळ (एकूण) | 61.89s | 51.78s |
| पॅरामीटर्स | ~100B | ~1.5T एकूण (~100B सक्रिय) |
| उपलब्धता | बंद स्रोत | बंद स्रोत |
मॉडेल जनरेशन शोकेस
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#136 Mercury 2
medium- खर्च
- $0.002
- वेळ
- 2.1s
- टोकन्स
- 1,702 tok
#135 GPT-5.5
none- खर्च
- $0.090
- वेळ
- 54.3s
- टोकन्स
- 3,063 tok
स्कोअरनुसार शीर्ष मॉडेल्स
स्कोअर विरुद्ध एकूण खर्च
प्रतिसाद वेळ (सरासरी)
स्कोअर vs प्रतिसाद वेळ (सरासरी)
एकूण आउटपुट टोकन्स
स्कोअर vs एकूण आउटपुट टोकन्स
श्रेणीवार तपशील
झटपट तुलना
तुलना जोडी बदला
GPT-5.5nonevsGLM 5.1mediumGPT-5.5nonevsGrok 4.20mediumDeepSeek V3.2mediumvsGPT-5.5noneSeed-2.0-MinimediumvsGPT-5.5noneKimi K2.5mediumvsGPT-5.5noneMercury 2mediumvsGPT-5.6 SolnoneGPT-5.5nonevsGrok 4.3mediumKAT-Coder-Pro V2.5mediumvsGPT-5.5noneClaude Fable 5.1lowvsMercury 2mediumClaude Fable 5.1lowvsGPT-5.5noneGPT-5.5nonevsQwen3.7 FlashmediumSeed-2.0-CodehighvsMercury 2medium