नेव्हिगेशन
AI BENCHY
Advertise here

Mercury 2 (medium) vs Kimi K2.5 (medium)

average score जवळपास समान आहे: 7.0 vs 7.0. Mercury 2 (medium) चा benchmark खर्च कमी आहे: $0.094 vs $0.607. Mercury 2 (medium) वेगवान आहे: 2.95s vs 98.19s, pass rates 53.0% vs 63.6%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-15

क्रमांक
#119
एकूण आउटपुट टोकन्स
87,554
प्रतिसाद वेळ (सरासरी)
2.95s
एकूण खर्च
$0.094
क्रमांक
#122
एकूण आउटपुट टोकन्स
220,942
प्रतिसाद वेळ (सरासरी)
98.19s
एकूण खर्च
$0.607
शिफारस केलेले मॉडेल Mercury 2 (medium)

It has the best score here (7.0), while costing about 6.5x less than Kimi K2.5 (medium).

तपशीलवार तुलना

मेट्रिक Mercury 2 Mercury 2 medium प्रकाशन: 2026-02-24 Kimi K2.5 Kimi K2.5 medium प्रकाशन: 2026-01-27
स्कोअर 7.0 7.0
क्रमांक #119 #122
विश्वसनीयता 10.0 10.0
सुसंगतता 8.4 7.0
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 53.0% 63.6%
अस्थिर चाचण्या 4 8
एकूण रन 66 66
प्रति निकाल खर्च 0.933 4.849
एकूण खर्च $0.094 $0.607
इनपुट किंमत $0.250 / 1M $0.571 / 1M
आउटपुट किंमत $0.750 / 1M $2.850 / 1M
एकूण इनपुट टोकन्स 110,515 118,496
आउटपुट टोकन्स 10,325 53,522
रिझनिंग टोकन्स 77,229 167,420
प्रतिसाद वेळ (सरासरी) 2.95s 98.19s
प्रतिसाद वेळ (कमाल) 14.63s 281.00s
प्रतिसाद वेळ (एकूण) 61.89s 1571.05s
पॅरामीटर्स ~100B 1T एकूण (32B सक्रिय)
उपलब्धता बंद स्रोत वेट्स उपलब्ध

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#119 Mercury 2

medium
खर्च
$0.002
वेळ
2.1s
टोकन्स
1,702 tok

#122 MoonshotAI: Kimi K2.5

medium
खर्च
$0.030
वेळ
58.6s
टोकन्स
8,683 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693

झटपट तुलना

तुलना जोडी बदला