नेविगेशन
Advertise here

Mercury 2 (medium) vs KAT-Coder-Pro V2.5 (low)

average score लगभग बराबर है: 6.6 vs 6.5. Mercury 2 (medium) की benchmark लागत कम है: $0.121 vs $0.400. Mercury 2 (medium) तेज है: 4.40s vs 19.40s, pass rates 53.6% vs 65.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#189
कुल आउटपुट टोकन
96,943
प्रतिक्रिया समय (औसत)
4.40s
कुल लागत
$0.121
रैंक
#191
कुल आउटपुट टोकन
113,193
प्रतिक्रिया समय (औसत)
19.40s
कुल लागत
$0.400
अनुशंसित मॉडल Mercury 2 (medium)

It has the best score here (6.6), while costing about 3.3x less than KAT-Coder-Pro V2.5 (low).

विस्तृत तुलना

मेट्रिक Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24 KAT-Coder-Pro V2.5 KAT-Coder-Pro V2.5 low रिलीज़: 2026-07-14
स्कोर 6.6 6.5
रैंक #189 #191
विश्वसनीयता 10.0 10.0
संगति 8.1 7.1
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 53.6% 65.2%
अस्थिर टेस्ट 5 8
कुल रन 69 69
प्रति परिणाम लागत 1.201 3.636
कुल लागत $0.121 $0.400
इनपुट कीमत $0.250 / 1M $0.740 / 1M
आउटपुट कीमत $0.750 / 1M $2.960 / 1M
कुल इनपुट टोकन 189,300 87,682
आउटपुट टोकन 10,854 7,166
रीजनिंग टोकन 86,089 106,027
प्रतिक्रिया समय (औसत) 4.40s 19.40s
प्रतिक्रिया समय (अधिकतम) 34.92s 209.15s
प्रतिक्रिया समय (कुल) 96.81s 446.11s
पैरामीटर ~100B ~700B कुल (~72B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#189 Mercury 2

medium
लागत
$0.002
समय
2.1s
टोकन
1,702 tok

#191 KAT-Coder-Pro V2.5

low
लागत
$0.016
समय
47.6s
टोकन
5,182 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
KAT-Coder-Pro V2.5 7.8 10.0 66.7% 0 24.87s 7,893 402 24,945

त्वरित तुलना

तुलना जोड़ी बदलें