नेविगेशन
Advertise here

Mercury 2.5 (medium) vs LongCat 2.0 (low)

Mercury 2.5 (medium) average score में आगे है: 6.8 vs 6.7. Mercury 2.5 (medium) की benchmark लागत कम है: $0.022 vs $0.412. Mercury 2.5 (medium) तेज है: 3.19s vs 113.61s, pass rates 65.2% vs 54.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#157
कुल आउटपुट टोकन
120,129
प्रतिक्रिया समय (औसत)
3.19s
कुल लागत
$0.022
रैंक
#162
कुल आउटपुट टोकन
320,594
प्रतिक्रिया समय (औसत)
113.61s
कुल लागत
$0.412
अनुशंसित मॉडल Mercury 2.5 (medium)

It has the best score here (6.8), while costing about 19.0x less than LongCat 2.0 (low).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 medium रिलीज़: 2026-09-08 LongCat 2.0 LongCat 2.0 low रिलीज़: 2026-07-20
स्कोर 6.8 6.7
रैंक #157 #162
विश्वसनीयता 9.8 9.9
संगति 8.6 8.5
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 65.2% 54.6%
अस्थिर टेस्ट 4 4
कुल रन 66 66
प्रति परिणाम लागत 0.181 4.120
कुल लागत $0.022 $0.412
इनपुट कीमत $0.040 / 1M $0.300 / 1M
आउटपुट कीमत $0.150 / 1M $1.200 / 1M
कुल इनपुट टोकन 91,402 90,870
आउटपुट टोकन 3,138 5,676
रीजनिंग टोकन 116,991 314,918
प्रतिक्रिया समय (औसत) 3.19s 113.61s
प्रतिक्रिया समय (अधिकतम) 9.87s 560.39s
प्रतिक्रिया समय (कुल) 70.18s 2499.46s
पैरामीटर ~100B 1.6T कुल (48B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#157 Mercury 2.5

medium
लागत
$0.001
समय
3.8s
टोकन
3,386 tok

#162 LongCat 2.0

low
लागत
$0.024
समय
428.0s
टोकन
19,557 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 5.0 5.1 44.5% 2 3.70s 7,807 488 21,857
LongCat 2.0 6.6 4.6 77.8% 2 479.30s 6,544 461 206,627

त्वरित तुलना

तुलना जोड़ी बदलें