नेविगेशन
Advertise here

Mercury 2.5 (low) vs Laguna S 2.1 (medium)

Mercury 2.5 (low) average score में आगे है: 5.1 vs 5.0. Mercury 2.5 (low) की benchmark लागत कम है: $0.020 vs $0.080. Mercury 2.5 (low) तेज है: 3.34s vs 63.06s, pass rates 37.7% vs 24.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#293
कुल आउटपुट टोकन
40,302
प्रतिक्रिया समय (औसत)
3.34s
कुल लागत
$0.020
रैंक
#296
कुल आउटपुट टोकन
386,824
प्रतिक्रिया समय (औसत)
63.06s
कुल लागत
$0.080
अनुशंसित मॉडल Mercury 2.5 (low)

It has the best score here (5.1), while costing about 4.2x less than Laguna S 2.1 (medium).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 low रिलीज़: 2026-09-08 Laguna S 2.1 Laguna S 2.1 medium रिलीज़: 2026-07-21 निःशुल्क उपलब्ध
स्कोर 5.1 5.0
रैंक #293 #296
विश्वसनीयता 9.8 10.0
संगति 8.2 8.5
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 37.7% 24.6%
अस्थिर टेस्ट 5 4
कुल रन 69 69
प्रति परिणाम लागत 0.319 1.987
कुल लागत $0.020 $0.080
इनपुट कीमत $0.040 / 1M $0.090 / 1M
आउटपुट कीमत $0.150 / 1M $0.180 / 1M
कुल इनपुट टोकन 326,083 230,291
आउटपुट टोकन 7,224 99,030
रीजनिंग टोकन 33,078 287,794
प्रतिक्रिया समय (औसत) 3.34s 63.06s
प्रतिक्रिया समय (अधिकतम) 47.06s 560.31s
प्रतिक्रिया समय (कुल) 76.80s 1450.31s
पैरामीटर ~100B 118B कुल (8B सक्रिय)
उपलब्धता बंद स्रोत वेट उपलब्ध

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#293 Mercury 2.5

low
लागत
$0.001
समय
2.4s
टोकन
1,236 tok

#296 Laguna S 2.1

medium
लागत
$0.001
समय
4.0s
टोकन
867 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 5.5 10.0 33.3% 0 972ms 7,909 521 2,269
Laguna S 2.1 5.3 7.2 44.4% 1 158.98s 7,917 93,354 106,718

त्वरित तुलना

तुलना जोड़ी बदलें