नेविगेशन
Advertise here

Ember-1 (high) vs GPT-5.6 Luna (low)

average score लगभग बराबर है: 6.9 vs 6.9. GPT-5.6 Luna (low) की benchmark लागत कम है: $0.075 vs $2.405. GPT-5.6 Luna (low) तेज है: 6.96s vs 58.14s, pass rates 71.0% vs 56.5%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#163
कुल आउटपुट टोकन
121,223
प्रतिक्रिया समय (औसत)
58.14s
कुल लागत
$2.405
रैंक
#165
कुल आउटपुट टोकन
28,001
प्रतिक्रिया समय (औसत)
6.96s
कुल लागत
$0.075
अनुशंसित मॉडल GPT-5.6 Luna (low)

It has the best score here (6.9), while costing about 32.4x less than Ember-1 (high).

विस्तृत तुलना

मेट्रिक Ember-1 Ember-1 high रिलीज़: 2026-09-28 GPT-5.6 Luna GPT-5.6 Luna low रिलीज़: 2026-07-09
स्कोर 6.9 6.9
रैंक #163 #165
विश्वसनीयता 8.6 10.0
संगति 7.2 8.3
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 71.0% 56.5%
अस्थिर टेस्ट 8 5
कुल रन 69 69
प्रति परिणाम लागत 20.041 2.428
कुल लागत $2.405 $0.075
इनपुट कीमत $3.000 / 1M $0.200 / 1M
आउटपुट कीमत $15.000 / 1M $1.200 / 1M
कुल इनपुट टोकन 195,489 202,680
आउटपुट टोकन 12,475 9,230
रीजनिंग टोकन 108,748 18,771
प्रतिक्रिया समय (औसत) 58.14s 6.96s
प्रतिक्रिया समय (अधिकतम) 255.06s 45.74s
प्रतिक्रिया समय (कुल) 1337.19s 160.19s
पैरामीटर ~2.8T कुल (~104B सक्रिय) ~400B कुल (~17B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#163 Ember-1

high
लागत
$0.038
समय
55.1s
टोकन
2,671 tok

#165 GPT-5.6 Luna

low
लागत
$0.011
समय
10.2s
टोकन
1,897 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Ember-1 8.2 7.2 88.9% 1 72.23s 7,144 1,281 23,093
GPT-5.6 Luna 5.5 10.0 33.3% 0 4.61s 7,302 557 3,535

त्वरित तुलना

तुलना जोड़ी बदलें