नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Ember-1 (max) vs GPT 5.3 Chat

average score लगभग बराबर है: 6.7 vs 6.7. GPT 5.3 Chat की benchmark लागत कम है: $0.533 vs $3.264. GPT 5.3 Chat तेज है: 6.31s vs 97.34s, pass rates 59.4% vs 62.3%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#181
कुल आउटपुट टोकन
186,901
प्रतिक्रिया समय (औसत)
97.34s
कुल लागत
$3.264
रैंक
#182
कुल आउटपुट टोकन
28,179
प्रतिक्रिया समय (औसत)
6.31s
कुल लागत
$0.533
अनुशंसित मॉडल GPT 5.3 Chat

It has the best score here (6.7), while costing about 6.1x less than Ember-1 (max).

विस्तृत तुलना

मेट्रिक Ember-1 Ember-1 max रिलीज़: 2026-09-28 GPT 5.3 Chat GPT 5.3 Chat none रिलीज़: 2026-03-03
स्कोर 6.7 6.7
रैंक #181 #182
विश्वसनीयता 8.3 10.0
संगति 7.8 8.6
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 59.4% 62.3%
अस्थिर टेस्ट 6 4
कुल रन 69 69
प्रति परिणाम लागत 29.671 4.097
कुल लागत $3.264 $0.533
इनपुट कीमत $3.000 / 1M $0.000 / 1M
आउटपुट कीमत $15.000 / 1M $0.000 / 1M
कुल इनपुट टोकन 153,399 78,846
आउटपुट टोकन 7,803 28,179
रीजनिंग टोकन 179,098 0
प्रतिक्रिया समय (औसत) 97.34s 6.31s
प्रतिक्रिया समय (अधिकतम) 587.08s 18.33s
प्रतिक्रिया समय (कुल) 2238.73s 138.73s
पैरामीटर ~2.8T कुल (~104B सक्रिय) ~400B कुल (~17B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#181 Ember-1

max
लागत
$0.163
समय
229.4s
टोकन
11,002 tok

#182 GPT 5.3 Chat

none
लागत
$0.008
समय
8.1s
टोकन
634 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Ember-1 5.2 4.4 55.6% 2 105.09s 3,362 1,149 27,957
GPT 5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0

त्वरित तुलना

तुलना जोड़ी बदलें