नेविगेशन
Advertise here

GPT-5.6 Luna (medium) vs Grok Build 0.1 (medium)

average score लगभग बराबर है: 7.4 vs 7.5. GPT-5.6 Luna (medium) की benchmark लागत कम है: $0.072 vs $1.130. GPT-5.6 Luna (medium) तेज है: 7.43s vs 54.50s, pass rates 62.1% vs 60.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-18

तुलना किए गए मॉडल

रैंक
#116
कुल आउटपुट टोकन
44,525
प्रतिक्रिया समय (औसत)
7.43s
कुल लागत
$0.072
रैंक
#111
कुल आउटपुट टोकन
511,406
प्रतिक्रिया समय (औसत)
54.50s
कुल लागत
$1.130
अनुशंसित मॉडल GPT-5.6 Luna (medium)

It has the best score here (7.4), while costing about 15.8x less than Grok Build 0.1 (medium).

विस्तृत तुलना

मेट्रिक GPT-5.6 Luna GPT-5.6 Luna medium रिलीज़: 2026-07-09 Grok Build 0.1 Grok Build 0.1 medium रिलीज़: 2026-05-21
स्कोर 7.4 7.5
रैंक #116 #111
विश्वसनीयता 10.0 10.0
संगति 9.2 9.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 62.1% 60.6%
अस्थिर टेस्ट 2 1
कुल रन 66 66
प्रति परिणाम लागत 2.601 8.691
कुल लागत $0.072 $1.130
इनपुट कीमत $0.200 / 1M $1.000 / 1M
आउटपुट कीमत $1.200 / 1M $2.000 / 1M
कुल इनपुट टोकन 89,685 106,946
आउटपुट टोकन 5,701 7,993
रीजनिंग टोकन 38,824 503,413
प्रतिक्रिया समय (औसत) 7.43s 54.50s
प्रतिक्रिया समय (अधिकतम) 29.85s 252.69s
प्रतिक्रिया समय (कुल) 163.54s 1199.07s
पैरामीटर ~400B कुल (~17B सक्रिय) ~300B कुल (~30B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#116 GPT-5.6 Luna

medium
लागत
$0.014
समय
14.6s
टोकन
2,362 tok

#111 SpaceXAI: Grok Build 0.1

medium
लागत
$0.028
समय
81.3s
टोकन
14,009 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.6 Luna 5.4 7.2 44.4% 1 10.38s 7,302 564 9,928
Grok Build 0.1 5.7 9.7 33.3% 0 108.46s 8,304 1,138 161,452

त्वरित तुलना

तुलना जोड़ी बदलें