नेविगेशन
Advertise here

Granite 4.2 8B (medium) vs Mercury 2.5 (low)

Granite 4.2 8B (medium) average score में आगे है: 5.2 vs 5.1. Granite 4.2 8B (medium) की benchmark लागत कम है: $0.009 vs $0.011. Mercury 2.5 (low) तेज है: 1.35s vs 45.97s, pass rates 34.9% vs 39.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#259
कुल आउटपुट टोकन
19,330
प्रतिक्रिया समय (औसत)
45.97s
कुल लागत
$0.009
रैंक
#265
कुल आउटपुट टोकन
33,719
प्रतिक्रिया समय (औसत)
1.35s
कुल लागत
$0.011
अनुशंसित मॉडल Mercury 2.5 (low)

Its score stays close to the best score here (5.1 vs 5.2), while responding about 34.0x faster than Granite 4.2 8B (medium).

विस्तृत तुलना

मेट्रिक Granite 4.2 8B Granite 4.2 8B medium रिलीज़: 2026-09-02 Mercury 2.5 Mercury 2.5 low रिलीज़: 2026-09-08
स्कोर 5.2 5.1
रैंक #259 #265
विश्वसनीयता 8.7 9.8
संगति 9.6 8.1
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 34.9% 39.4%
अस्थिर टेस्ट 1 5
कुल रन 66 66
प्रति परिणाम लागत 0.117 0.177
कुल लागत $0.009 $0.011
इनपुट कीमत $0.100 / 1M $0.040 / 1M
आउटपुट कीमत $0.150 / 1M $0.150 / 1M
कुल इनपुट टोकन 52,909 138,020
आउटपुट टोकन 7,058 6,083
रीजनिंग टोकन 12,272 27,636
प्रतिक्रिया समय (औसत) 45.97s 1.35s
प्रतिक्रिया समय (अधिकतम) 557.96s 7.48s
प्रतिक्रिया समय (कुल) 1011.42s 29.74s
पैरामीटर 8B ~100B
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#259 IBM: Granite 4.2 8B

medium
Provider returned error
लागत
$0.000
समय
0.2s
टोकन
0 tok

#265 Mercury 2.5

low
लागत
$0.001
समय
2.4s
टोकन
1,236 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Granite 4.2 8B 5.5 10.0 33.3% 0 12.09s 8,439 2,445 3,900
Mercury 2.5 5.5 10.0 33.3% 0 972ms 7,909 521 2,269

त्वरित तुलना

तुलना जोड़ी बदलें