नेविगेशन
Advertise here

Mercury 2.5 (high) vs Laguna XS 2.1 (medium)

average score लगभग बराबर है: 6.5 vs 6.4. Mercury 2.5 (high) की benchmark लागत कम है: $0.044 vs $0.083. Mercury 2.5 (high) तेज है: 7.62s vs 48.97s, pass rates 59.4% vs 46.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#194
कुल आउटपुट टोकन
193,676
प्रतिक्रिया समय (औसत)
7.62s
कुल लागत
$0.044
रैंक
#200
कुल आउटपुट टोकन
538,292
प्रतिक्रिया समय (औसत)
48.97s
कुल लागत
$0.083
अनुशंसित मॉडल Mercury 2.5 (high)

It has the best score here (6.5), while costing about 1.9x less than Laguna XS 2.1 (medium).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 high रिलीज़: 2026-09-08 Laguna XS 2.1 Laguna XS 2.1 medium रिलीज़: 2026-07-02 निःशुल्क उपलब्ध
स्कोर 6.5 6.4
रैंक #194 #200
विश्वसनीयता 9.8 10.0
संगति 8.7 9.0
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 59.4% 46.4%
अस्थिर टेस्ट 4 3
कुल रन 69 69
प्रति परिणाम लागत 0.362 0.922
कुल लागत $0.044 $0.083
इनपुट कीमत $0.040 / 1M $0.060 / 1M
आउटपुट कीमत $0.150 / 1M $0.120 / 1M
कुल इनपुट टोकन 358,562 352,516
आउटपुट टोकन 4,266 33,786
रीजनिंग टोकन 189,410 504,506
प्रतिक्रिया समय (औसत) 7.62s 48.97s
प्रतिक्रिया समय (अधिकतम) 80.30s 422.72s
प्रतिक्रिया समय (कुल) 175.36s 1126.35s
पैरामीटर ~100B 33B कुल (3B सक्रिय)
उपलब्धता बंद स्रोत वेट उपलब्ध

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#194 Mercury 2.5

high
लागत
$0.001
समय
3.5s
टोकन
2,447 tok

#200 Laguna XS 2.1

medium
लागत
$0.001
समय
30.6s
टोकन
4,678 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012
Laguna XS 2.1 5.5 10.0 33.3% 0 70.35s 7,995 23,767 83,258

त्वरित तुलना

तुलना जोड़ी बदलें