नेविगेशन
AI BENCHY
Advertise here

Mercury 2 (medium) vs KAT-Coder-Pro V2.5 (medium)

Mercury 2 (medium) average score में आगे है: 7.0 vs 6.9. Mercury 2 (medium) की benchmark लागत कम है: $0.094 vs $0.478. Mercury 2 (medium) तेज है: 2.95s vs 24.87s, pass rates 53.0% vs 65.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-26

रैंक
#122
कुल आउटपुट टोकन
87,554
प्रतिक्रिया समय (औसत)
2.95s
कुल लागत
$0.094
रैंक
#126
कुल आउटपुट टोकन
139,375
प्रतिक्रिया समय (औसत)
24.87s
कुल लागत
$0.478
अनुशंसित मॉडल Mercury 2 (medium)

It has the best score here (7.0), while costing about 5.1x less than KAT-Coder-Pro V2.5 (medium).

विस्तृत तुलना

मेट्रिक Mercury 2 Mercury 2 medium रिलीज़: 2026-02-24 KAT-Coder-Pro V2.5 KAT-Coder-Pro V2.5 medium रिलीज़: 2026-07-14
स्कोर 7.0 6.9
रैंक #122 #126
विश्वसनीयता 10.0 10.0
संगति 8.4 7.0
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 53.0% 65.2%
अस्थिर टेस्ट 4 8
कुल रन 66 66
प्रति परिणाम लागत 0.933 4.342
कुल लागत $0.094 $0.478
इनपुट कीमत $0.250 / 1M $0.740 / 1M
आउटपुट कीमत $0.750 / 1M $2.960 / 1M
कुल इनपुट टोकन 110,515 87,916
आउटपुट टोकन 10,325 7,213
रीजनिंग टोकन 77,229 132,162
प्रतिक्रिया समय (औसत) 2.95s 24.87s
प्रतिक्रिया समय (अधिकतम) 14.63s 257.00s
प्रतिक्रिया समय (कुल) 61.89s 547.14s
पैरामीटर ~100B ~700B कुल (~72B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#122 Mercury 2

medium
लागत
$0.002
समय
2.1s
टोकन
1,702 tok

#126 KAT-Coder-Pro V2.5

medium
लागत
$0.009
समय
25.6s
टोकन
2,939 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
KAT-Coder-Pro V2.5 7.8 10.0 66.7% 0 33.10s 7,893 416 33,658

त्वरित तुलना

तुलना जोड़ी बदलें