नेविगेशन
Advertise here

Ember-1 (low) vs Grok 4.7 (high)

average score लगभग बराबर है: 7.5 vs 7.5. Ember-1 (low) की benchmark लागत कम है: $0.662 vs $2.180. Ember-1 (low) तेज है: 30.98s vs 113.10s, pass rates 66.7% vs 75.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-28

तुलना किए गए मॉडल

रैंक
#120
कुल आउटपुट टोकन
37,467
प्रतिक्रिया समय (औसत)
30.98s
कुल लागत
$0.662
रैंक
#119
कुल आउटपुट टोकन
416,086
प्रतिक्रिया समय (औसत)
113.10s
कुल लागत
$2.180
अनुशंसित मॉडल Ember-1 (low)

It has the best score here (7.5), while costing about 3.3x less than Grok 4.7 (high).

विस्तृत तुलना

मेट्रिक Ember-1 Ember-1 low रिलीज़: 2026-09-28 Grok 4.7 Grok 4.7 high रिलीज़: 2026-09-21
स्कोर 7.5 7.5
रैंक #120 #119
विश्वसनीयता 8.1 9.5
संगति 8.5 7.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 66.7% 75.8%
अस्थिर टेस्ट 4 7
कुल रन 66 66
प्रति परिणाम लागत 5.085 16.765
कुल लागत $0.662 $2.180
इनपुट कीमत $3.000 / 1M $1.600 / 1M
आउटपुट कीमत $15.000 / 1M $4.800 / 1M
कुल इनपुट टोकन 33,011 113,892
आउटपुट टोकन 4,780 6,907
रीजनिंग टोकन 32,687 409,179
प्रतिक्रिया समय (औसत) 30.98s 113.10s
प्रतिक्रिया समय (अधिकतम) 93.10s 573.57s
प्रतिक्रिया समय (कुल) 681.50s 2488.20s
पैरामीटर ~2.8T कुल (~104B सक्रिय) ~1.7T कुल (~170B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#120 Ember-1

low
लागत
$0.016
समय
24.2s
टोकन
1,165 tok

#119 SpaceXAI: Grok 4.7

high
लागत
$0.110
समय
301.3s
टोकन
23,143 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Ember-1 10.0 10.0 100.0% 0 37.91s 8,097 2,518 13,142
Grok 4.7 6.0 4.6 66.7% 2 335.92s 10,266 353 199,976

त्वरित तुलना

तुलना जोड़ी बदलें