नेव्हिगेशन
Advertise here

Mercury 2.5 vs Qwen3.5-9B (medium)

Mercury 2.5 average score मध्ये पुढे आहे: 3.9 vs 3.8. Mercury 2.5 चा benchmark खर्च कमी आहे: $0.016 vs $0.062. Mercury 2.5 वेगवान आहे: 2.45s vs 107.51s, pass rates 25.8% vs 25.8%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-09-08

तुलना केलेली मॉडेल्स

क्रमांक
#312
एकूण आउटपुट टोकन्स
71,143
प्रतिसाद वेळ (सरासरी)
2.45s
एकूण खर्च
$0.016
क्रमांक
#316
एकूण आउटपुट टोकन्स
413,442
प्रतिसाद वेळ (सरासरी)
107.51s
एकूण खर्च
$0.062
शिफारस केलेले मॉडेल Mercury 2.5

It has the best score here (3.9), while costing about 4.0x less than Qwen3.5-9B (medium).

तपशीलवार तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 none प्रकाशन: 2026-09-08 Qwen3.5-9B Qwen3.5-9B medium प्रकाशन: 2026-03-02
स्कोअर 3.9 3.8
क्रमांक #312 #316
विश्वसनीयता 10.0 6.0
सुसंगतता 7.5 8.1
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 25.8% 25.8%
अस्थिर चाचण्या 7 5
एकूण रन 66 66
प्रति निकाल खर्च 0.782 2.061
एकूण खर्च $0.016 $0.062
इनपुट किंमत $0.040 / 1M $0.100 / 1M
आउटपुट किंमत $0.150 / 1M $0.150 / 1M
एकूण इनपुट टोकन्स 123,740 17,195
आउटपुट टोकन्स 71,143 46,735
रिझनिंग टोकन्स 0 366,707
प्रतिसाद वेळ (सरासरी) 2.45s 107.51s
प्रतिसाद वेळ (कमाल) 36.48s 569.97s
प्रतिसाद वेळ (एकूण) 53.83s 1720.15s
पॅरामीटर्स ~100B 9B
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#312 Mercury 2.5

none
खर्च
$0.001
वेळ
2.7s
टोकन्स
2,749 tok

#316 Qwen3.5-9B

medium
खर्च
$0.001
वेळ
35.9s
टोकन्स
3,030 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Mercury 2.5 3.7 7.0 22.2% 1 12.50s 7,888 61,297 0
Qwen3.5-9B 2.9 10.0 0.0% 0 100.88s 2,396 7,890 41,129

झटपट तुलना

तुलना जोडी बदला