नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2.5 (medium) vs LongCat 2.0

average score लगभग बराबर है: 6.4 vs 6.4. Mercury 2.5 (medium) की benchmark लागत कम है: $0.034 vs $0.104. Mercury 2.5 (medium) तेज है: 7.74s vs 8.50s, pass rates 63.8% vs 42.0%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#206
कुल आउटपुट टोकन
138,946
प्रतिक्रिया समय (औसत)
7.74s
कुल लागत
$0.034
रैंक
#211
कुल आउटपुट टोकन
17,473
प्रतिक्रिया समय (औसत)
8.50s
कुल लागत
$0.104
अनुशंसित मॉडल Mercury 2.5 (medium)

It has the best score here (6.4), while costing about 3.1x less than LongCat 2.0.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 medium रिलीज़: 2026-09-08 LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20
स्कोर 6.4 6.4
रैंक #206 #211
विश्वसनीयता 9.7 10.0
संगति 8.3 9.0
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 63.8% 42.0%
अस्थिर टेस्ट 5 3
कुल रन 69 69
प्रति परिणाम लागत 0.280 1.298
कुल लागत $0.034 $0.104
इनपुट कीमत $0.040 / 1M $0.300 / 1M
आउटपुट कीमत $0.150 / 1M $1.200 / 1M
कुल इनपुट टोकन 317,982 276,199
आउटपुट टोकन 3,918 17,473
रीजनिंग टोकन 135,028 0
प्रतिक्रिया समय (औसत) 7.74s 8.50s
प्रतिक्रिया समय (अधिकतम) 107.89s 81.77s
प्रतिक्रिया समय (कुल) 178.07s 195.60s
पैरामीटर ~100B 1.6T कुल (48B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#206 Mercury 2.5

medium
लागत
$0.001
समय
3.8s
टोकन
3,386 tok

#211 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 5.0 5.1 44.5% 2 3.70s 7,807 488 21,857
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0

त्वरित तुलना

तुलना जोड़ी बदलें