नेविगेशन
Advertise here

Mercury 2.5 (low) vs Mistral Small 4

average score लगभग बराबर है: 5.1 vs 5.1. Mercury 2.5 (low) की benchmark लागत कम है: $0.011 vs $0.022. Mistral Small 4 तेज है: 1.20s vs 1.35s, pass rates 39.4% vs 25.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#265
कुल आउटपुट टोकन
33,719
प्रतिक्रिया समय (औसत)
1.35s
कुल लागत
$0.011
रैंक
#261
कुल आउटपुट टोकन
9,812
प्रतिक्रिया समय (औसत)
1.20s
कुल लागत
$0.022
अनुशंसित मॉडल Mistral Small 4

It has the strongest score in this comparison (5.1) and the best overall balance of cost and response time across all 2 models.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 low रिलीज़: 2026-09-08 Mistral Small 4 Mistral Small 4 none रिलीज़: 2026-03-16
स्कोर 5.1 5.1
रैंक #265 #261
विश्वसनीयता 9.8 10.0
संगति 8.1 9.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 39.4% 25.8%
अस्थिर टेस्ट 5 1
कुल रन 66 66
प्रति परिणाम लागत 0.177 0.432
कुल लागत $0.011 $0.022
इनपुट कीमत $0.040 / 1M $0.150 / 1M
आउटपुट कीमत $0.150 / 1M $0.600 / 1M
कुल इनपुट टोकन 138,020 104,717
आउटपुट टोकन 6,083 9,812
रीजनिंग टोकन 27,636 0
प्रतिक्रिया समय (औसत) 1.35s 1.20s
प्रतिक्रिया समय (अधिकतम) 7.48s 13.16s
प्रतिक्रिया समय (कुल) 29.74s 26.41s
पैरामीटर ~100B 119B कुल (6B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#265 Mercury 2.5

low
लागत
$0.001
समय
2.4s
टोकन
1,236 tok

#261 Mistral Small 4

none
लागत
$0.002
समय
10.4s
टोकन
2,370 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 5.5 10.0 33.3% 0 972ms 7,909 521 2,269
Mistral Small 4 3.7 9.7 0.0% 0 901ms 7,636 619 0

त्वरित तुलना

तुलना जोड़ी बदलें