नेविगेशन
AI BENCHY
Advertise here

Mercury 2.5 Preview (high) vs Inkling Small (medium)

average score लगभग बराबर है: 6.6 vs 6.6. Mercury 2.5 Preview (high) की benchmark लागत कम है: $0.030 vs $0.113. Mercury 2.5 Preview (high) तेज है: 4.01s vs 6.30s, pass rates 65.2% vs 53.0%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-02

रैंक
#157
कुल आउटपुट टोकन
163,505
प्रतिक्रिया समय (औसत)
4.01s
कुल लागत
$0.030
रैंक
#154
कुल आउटपुट टोकन
56,269
प्रतिक्रिया समय (औसत)
6.30s
कुल लागत
$0.113
अनुशंसित मॉडल Mercury 2.5 Preview (high)

It has the best score here (6.6), while costing about 3.9x less than Inkling Small (medium).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview high रिलीज़: 2026-09-02 Inkling Small Inkling Small medium रिलीज़: 2026-08-01
स्कोर 6.6 6.6
रैंक #157 #154
विश्वसनीयता 10.0 10.0
संगति 8.2 9.0
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 65.2% 53.0%
अस्थिर टेस्ट 5 3
कुल रन 66 66
प्रति परिणाम लागत 0.243 1.177
कुल लागत $0.030 $0.113
इनपुट कीमत $0.040 / 1M $0.450 / 1M
आउटपुट कीमत $0.150 / 1M $1.200 / 1M
कुल इनपुट टोकन 115,759 100,255
आउटपुट टोकन 2,562 6,422
रीजनिंग टोकन 160,943 49,847
प्रतिक्रिया समय (औसत) 4.01s 6.30s
प्रतिक्रिया समय (अधिकतम) 17.71s 17.26s
प्रतिक्रिया समय (कुल) 88.25s 138.60s
पैरामीटर ~100B 276B कुल (12B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#157 Mercury 2.5 Preview

high
लागत
$0.001
समय
4.5s
टोकन
3,851 tok

#154 Thinking Machines: Inkling Small

medium
लागत
$0.003
समय
13.4s
टोकन
1,753 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 6.7 7.8 55.6% 1 6.13s 7,751 485 42,569
Inkling Small 7.8 10.0 66.7% 0 10.49s 7,374 434 13,783

त्वरित तुलना

तुलना जोड़ी बदलें