नेविगेशन
Advertise here

Mercury 2 (medium) vs LongCat 2.0 (low)

average score लगभग बराबर है: 6.6 vs 6.6. Mercury 2 (medium) की benchmark लागत कम है: $0.121 vs $0.495. Mercury 2 (medium) तेज है: 4.40s vs 115.00s, pass rates 53.6% vs 55.1%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#189
कुल आउटपुट टोकन
96,943
प्रतिक्रिया समय (औसत)
4.40s
कुल लागत
$0.121
रैंक
#188
कुल आउटपुट टोकन
346,225
प्रतिक्रिया समय (औसत)
115.00s
कुल लागत
$0.495
अनुशंसित मॉडल Mercury 2 (medium)

It has the best score here (6.6), while costing about 4.1x less than LongCat 2.0 (low).

विस्तृत तुलना

मेट्रिक Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24 LongCat 2.0 LongCat 2.0 low रिलीज़: 2026-07-20
स्कोर 6.6 6.6
रैंक #189 #188
विश्वसनीयता 10.0 9.9
संगति 8.1 8.3
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 53.6% 55.1%
अस्थिर टेस्ट 5 5
कुल रन 69 69
प्रति परिणाम लागत 1.201 4.942
कुल लागत $0.121 $0.495
इनपुट कीमत $0.250 / 1M $0.300 / 1M
आउटपुट कीमत $0.750 / 1M $1.200 / 1M
कुल इनपुट टोकन 189,300 262,387
आउटपुट टोकन 10,854 7,344
रीजनिंग टोकन 86,089 338,881
प्रतिक्रिया समय (औसत) 4.40s 115.00s
प्रतिक्रिया समय (अधिकतम) 34.92s 560.39s
प्रतिक्रिया समय (कुल) 96.81s 2645.11s
पैरामीटर ~100B 1.6T कुल (48B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#189 Mercury 2

medium
लागत
$0.002
समय
2.1s
टोकन
1,702 tok

#188 LongCat 2.0

low
लागत
$0.024
समय
428.0s
टोकन
19,557 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
LongCat 2.0 6.6 4.6 77.8% 2 479.30s 6,544 461 206,627

त्वरित तुलना

तुलना जोड़ी बदलें