नेविगेशन
Advertise here

Ember-1 (high) vs Grok 4.20 (medium)

Ember-1 (high) average score में आगे है: 7.1 vs 7.0. Grok 4.20 (medium) की benchmark लागत कम है: $0.805 vs $1.798. Grok 4.20 (medium) तेज है: 32.56s vs 56.77s, pass rates 71.2% vs 60.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-28

तुलना किए गए मॉडल

रैंक
#158
कुल आउटपुट टोकन
110,125
प्रतिक्रिया समय (औसत)
56.77s
कुल लागत
$1.798
रैंक
#167
कुल आउटपुट टोकन
270,259
प्रतिक्रिया समय (औसत)
32.56s
कुल लागत
$0.805
अनुशंसित मॉडल Grok 4.20 (medium)

Its score stays close to the best score here (7.0 vs 7.1), while costing about 2.2x less than Ember-1 (high).

विस्तृत तुलना

मेट्रिक Ember-1 Ember-1 high रिलीज़: 2026-09-28 Grok 4.20 Grok 4.20 medium रिलीज़: 2026-03-31
स्कोर 7.1 7.0
रैंक #158 #167
विश्वसनीयता 8.0 10.0
संगति 7.3 8.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 71.2% 60.6%
अस्थिर टेस्ट 7 5
कुल रन 66 66
प्रति परिणाम लागत 14.981 10.365
कुल लागत $1.798 $0.805
इनपुट कीमत $3.000 / 1M $1.250 / 1M
आउटपुट कीमत $15.000 / 1M $2.500 / 1M
कुल इनपुट टोकन 48,577 102,986
आउटपुट टोकन 7,345 5,860
रीजनिंग टोकन 102,780 264,399
प्रतिक्रिया समय (औसत) 56.77s 32.56s
प्रतिक्रिया समय (अधिकतम) 255.06s 199.66s
प्रतिक्रिया समय (कुल) 1248.88s 716.36s
पैरामीटर ~2.8T कुल (~104B सक्रिय) ~1T कुल (~100B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#158 Ember-1

high
लागत
$0.038
समय
55.1s
टोकन
2,671 tok

#167 SpaceXAI: Grok 4.20

medium
लागत
$0.041
समय
110.3s
टोकन
16,336 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Ember-1 8.2 7.2 88.9% 1 72.23s 7,144 1,281 23,093
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150

त्वरित तुलना

तुलना जोड़ी बदलें