नेविगेशन
Advertise here

Ember-1 (low) vs Grok Build 0.1 (medium)

average score लगभग बराबर है: 7.5 vs 7.5. Ember-1 (low) की benchmark लागत कम है: $0.662 vs $1.130. Ember-1 (low) तेज है: 30.98s vs 54.50s, pass rates 66.7% vs 60.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-28

तुलना किए गए मॉडल

रैंक
#120
कुल आउटपुट टोकन
37,467
प्रतिक्रिया समय (औसत)
30.98s
कुल लागत
$0.662
रैंक
#127
कुल आउटपुट टोकन
511,406
प्रतिक्रिया समय (औसत)
54.50s
कुल लागत
$1.130
अनुशंसित मॉडल Ember-1 (low)

It has the best score here (7.5), while costing about 1.7x less than Grok Build 0.1 (medium).

विस्तृत तुलना

मेट्रिक Ember-1 Ember-1 low रिलीज़: 2026-09-28 Grok Build 0.1 Grok Build 0.1 medium रिलीज़: 2026-05-21
स्कोर 7.5 7.5
रैंक #120 #127
विश्वसनीयता 8.1 10.0
संगति 8.5 9.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 66.7% 60.6%
अस्थिर टेस्ट 4 1
कुल रन 66 66
प्रति परिणाम लागत 5.085 8.691
कुल लागत $0.662 $1.130
इनपुट कीमत $3.000 / 1M $1.000 / 1M
आउटपुट कीमत $15.000 / 1M $2.000 / 1M
कुल इनपुट टोकन 33,011 106,946
आउटपुट टोकन 4,780 7,993
रीजनिंग टोकन 32,687 503,413
प्रतिक्रिया समय (औसत) 30.98s 54.50s
प्रतिक्रिया समय (अधिकतम) 93.10s 252.69s
प्रतिक्रिया समय (कुल) 681.50s 1199.07s
पैरामीटर ~2.8T कुल (~104B सक्रिय) ~300B कुल (~30B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#120 Ember-1

low
लागत
$0.016
समय
24.2s
टोकन
1,165 tok

#127 SpaceXAI: Grok Build 0.1

medium
लागत
$0.028
समय
81.3s
टोकन
14,009 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Ember-1 10.0 10.0 100.0% 0 37.91s 8,097 2,518 13,142
Grok Build 0.1 5.7 9.7 33.3% 0 108.46s 8,304 1,138 161,452

त्वरित तुलना

तुलना जोड़ी बदलें