नेविगेशन
AI BENCHY
Advertise here

Mercury 2.5 Preview (high) vs LongCat 2.0

Mercury 2.5 Preview (high) average score में आगे है: 6.6 vs 6.4. Mercury 2.5 Preview (high) की benchmark लागत कम है: $0.030 vs $0.044. Mercury 2.5 Preview (high) तेज है: 4.01s vs 5.17s, pass rates 65.2% vs 40.9%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-03

रैंक
#163
कुल आउटपुट टोकन
163,505
प्रतिक्रिया समय (औसत)
4.01s
कुल लागत
$0.030
रैंक
#172
कुल आउटपुट टोकन
9,375
प्रतिक्रिया समय (औसत)
5.17s
कुल लागत
$0.044
अनुशंसित मॉडल Mercury 2.5 Preview (high)

It has the best score here (6.6), while costing about 1.5x less than LongCat 2.0.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview high रिलीज़: 2026-09-02 LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20
स्कोर 6.6 6.4
रैंक #163 #172
विश्वसनीयता 10.0 10.0
संगति 8.2 9.3
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 65.2% 40.9%
अस्थिर टेस्ट 5 2
कुल रन 66 66
प्रति परिणाम लागत 0.243 0.549
कुल लागत $0.030 $0.044
इनपुट कीमत $0.040 / 1M $0.300 / 1M
आउटपुट कीमत $0.150 / 1M $1.200 / 1M
कुल इनपुट टोकन 115,759 108,752
आउटपुट टोकन 2,562 9,375
रीजनिंग टोकन 160,943 0
प्रतिक्रिया समय (औसत) 4.01s 5.17s
प्रतिक्रिया समय (अधिकतम) 17.71s 48.38s
प्रतिक्रिया समय (कुल) 88.25s 113.83s
पैरामीटर ~100B 1.6T कुल (48B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#163 Mercury 2.5 Preview

high
लागत
$0.001
समय
4.5s
टोकन
3,851 tok

#172 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 6.7 7.8 55.6% 1 6.13s 7,751 485 42,569
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0

त्वरित तुलना

तुलना जोड़ी बदलें