नेविगेशन
Advertise here

Granite 4.2 8B (high) vs Mercury 2.5

Granite 4.2 8B (high) average score में आगे है: 4.6 vs 3.9. Mercury 2.5 की benchmark लागत कम है: $0.016 vs $0.084. Mercury 2.5 तेज है: 2.45s vs 235.89s, pass rates 39.4% vs 25.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#293
कुल आउटपुट टोकन
612,215
प्रतिक्रिया समय (औसत)
235.89s
कुल लागत
$0.084
रैंक
#312
कुल आउटपुट टोकन
71,143
प्रतिक्रिया समय (औसत)
2.45s
कुल लागत
$0.016
अनुशंसित मॉडल Mercury 2.5

Its score stays close to the best score here (3.9 vs 4.6), while costing about 5.3x less than Granite 4.2 8B (high).

विस्तृत तुलना

मेट्रिक Granite 4.2 8B Granite 4.2 8B high रिलीज़: 2026-09-02 Mercury 2.5 Mercury 2.5 none रिलीज़: 2026-09-08
स्कोर 4.6 3.9
रैंक #293 #312
विश्वसनीयता 7.6 10.0
संगति 6.3 7.5
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 39.4% 25.8%
अस्थिर टेस्ट 10 7
कुल रन 66 66
प्रति परिणाम लागत 2.085 0.782
कुल लागत $0.084 $0.016
इनपुट कीमत $0.100 / 1M $0.040 / 1M
आउटपुट कीमत $0.150 / 1M $0.150 / 1M
कुल इनपुट टोकन 43,278 123,740
आउटपुट टोकन 181,083 71,143
रीजनिंग टोकन 431,132 0
प्रतिक्रिया समय (औसत) 235.89s 2.45s
प्रतिक्रिया समय (अधिकतम) 685.87s 36.48s
प्रतिक्रिया समय (कुल) 5189.64s 53.83s
पैरामीटर 8B ~100B
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#293 IBM: Granite 4.2 8B

high
Provider returned error
लागत
$0.000
समय
0.2s
टोकन
0 tok

#312 Mercury 2.5

none
लागत
$0.001
समय
2.7s
टोकन
2,749 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Granite 4.2 8B 3.8 4.3 33.3% 2 515.34s 7,047 42,438 154,749
Mercury 2.5 3.7 7.0 22.2% 1 12.50s 7,888 61,297 0

त्वरित तुलना

तुलना जोड़ी बदलें