नेव्हिगेशन
Advertise here

Mercury 2.5 (low) vs Qwen3.5-9B

average score जवळपास समान आहे: 5.1 vs 5.1. Mercury 2.5 (low) चा benchmark खर्च कमी आहे: $0.011 vs $0.021. Mercury 2.5 (low) वेगवान आहे: 1.35s vs 19.19s, pass rates 39.4% vs 19.7%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-09-08

तुलना केलेली मॉडेल्स

क्रमांक
#265
एकूण आउटपुट टोकन्स
33,719
प्रतिसाद वेळ (सरासरी)
1.35s
एकूण खर्च
$0.011
क्रमांक
#267
एकूण आउटपुट टोकन्स
37,484
प्रतिसाद वेळ (सरासरी)
19.19s
एकूण खर्च
$0.021
शिफारस केलेले मॉडेल Mercury 2.5 (low)

It has the best score here (5.1), while costing about 1.9x less than Qwen3.5-9B.

तपशीलवार तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 low प्रकाशन: 2026-09-08 Qwen3.5-9B Qwen3.5-9B none प्रकाशन: 2026-03-02
स्कोअर 5.1 5.1
क्रमांक #265 #267
विश्वसनीयता 9.8 10.0
सुसंगतता 8.1 9.7
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 39.4% 19.7%
अस्थिर चाचण्या 5 1
एकूण रन 66 66
प्रति निकाल खर्च 0.177 0.490
एकूण खर्च $0.011 $0.021
इनपुट किंमत $0.040 / 1M $0.100 / 1M
आउटपुट किंमत $0.150 / 1M $0.150 / 1M
एकूण इनपुट टोकन्स 138,020 144,416
आउटपुट टोकन्स 6,083 37,484
रिझनिंग टोकन्स 27,636 0
प्रतिसाद वेळ (सरासरी) 1.35s 19.19s
प्रतिसाद वेळ (कमाल) 7.48s 382.06s
प्रतिसाद वेळ (एकूण) 29.74s 422.25s
पॅरामीटर्स ~100B 9B
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#265 Mercury 2.5

low
खर्च
$0.001
वेळ
2.4s
टोकन्स
1,236 tok

#267 Qwen3.5-9B

none
Reached the allocated time limit (300 seconds) without receiving showcase output.
खर्च
$0.000
वेळ
300.0s
टोकन्स
0 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Mercury 2.5 5.5 10.0 33.3% 0 972ms 7,909 521 2,269
Qwen3.5-9B 3.9 7.8 11.1% 1 5.60s 7,913 1,042 0

झटपट तुलना

तुलना जोडी बदला