नेविगेशन
AI BENCHY
Advertise here

Mercury 2 vs KAT-Coder-Air V2.5

KAT-Coder-Air V2.5 average score में आगे है: 4.8 vs 4.7. Mercury 2 की benchmark लागत कम है: $0.030 vs $0.070. Mercury 2 तेज है: 825ms vs 12.46s, pass rates 24.2% vs 36.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-26

रैंक
#264
कुल आउटपुट टोकन
9,584
प्रतिक्रिया समय (औसत)
825ms
कुल लागत
$0.030
रैंक
#257
कुल आउटपुट टोकन
97,752
प्रतिक्रिया समय (औसत)
12.46s
कुल लागत
$0.070
अनुशंसित मॉडल Mercury 2

Its score stays close to the best score here (4.7 vs 4.8), while costing about 2.3x less than KAT-Coder-Air V2.5.

विस्तृत तुलना

मेट्रिक Mercury 2 Mercury 2 none रिलीज़: 2026-02-24 KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 none रिलीज़: 2026-07-14
स्कोर 4.7 4.8
रैंक #264 #257
विश्वसनीयता 10.0 10.0
संगति 9.2 7.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 24.2% 36.4%
अस्थिर टेस्ट 2 7
कुल रन 66 66
प्रति परिणाम लागत 0.740 1.382
कुल लागत $0.030 $0.070
इनपुट कीमत $0.250 / 1M $0.150 / 1M
आउटपुट कीमत $0.750 / 1M $0.600 / 1M
कुल इनपुट टोकन 89,637 69,376
आउटपुट टोकन 9,584 97,752
रीजनिंग टोकन 0 0
प्रतिक्रिया समय (औसत) 825ms 12.46s
प्रतिक्रिया समय (अधिकतम) 4.52s 121.05s
प्रतिक्रिया समय (कुल) 18.14s 274.11s
पैरामीटर ~100B ~35B कुल (~3B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#264 Mercury 2

none
लागत
$0.002
समय
1.8s
टोकन
1,514 tok

#257 KAT-Coder-Air V2.5

none
लागत
$0.002
समय
14.5s
टोकन
2,619 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 3.4 9.6 0.0% 0 1.03s 7,229 3,088 0
KAT-Coder-Air V2.5 3.3 9.6 0.0% 0 14.31s 6,472 16,918 0

त्वरित तुलना

तुलना जोड़ी बदलें