नेविगेशन
AI BENCHY
Advertise here

GPT-5.6 Luna (high) vs Grok Build 0.1 (medium)

GPT-5.6 Luna (high) average score में आगे है: 7.6 vs 7.5. GPT-5.6 Luna (high) की benchmark लागत कम है: $0.179 vs $1.130. GPT-5.6 Luna (high) तेज है: 16.49s vs 54.50s, pass rates 69.7% vs 60.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-20

रैंक
#78
कुल आउटपुट टोकन
135,315
प्रतिक्रिया समय (औसत)
16.49s
कुल लागत
$0.179
रैंक
#89
कुल आउटपुट टोकन
511,406
प्रतिक्रिया समय (औसत)
54.50s
कुल लागत
$1.130
अनुशंसित मॉडल GPT-5.6 Luna (high)

It has the best score here (7.6), while costing about 6.3x less than Grok Build 0.1 (medium).

विस्तृत तुलना

मेट्रिक GPT-5.6 Luna GPT-5.6 Luna high रिलीज़: 2026-07-09 Grok Build 0.1 Grok Build 0.1 medium रिलीज़: 2026-05-21
स्कोर 7.6 7.5
रैंक #78 #89
विश्वसनीयता 10.0 10.0
संगति 8.5 9.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 69.7% 60.6%
अस्थिर टेस्ट 4 1
कुल रन 66 66
प्रति परिणाम लागत 6.100 8.691
कुल लागत $0.179 $1.130
इनपुट कीमत $0.200 / 1M $1.000 / 1M
आउटपुट कीमत $1.200 / 1M $2.000 / 1M
कुल इनपुट टोकन 80,927 106,946
आउटपुट टोकन 5,088 7,993
रीजनिंग टोकन 130,227 503,413
प्रतिक्रिया समय (औसत) 16.49s 54.50s
प्रतिक्रिया समय (अधिकतम) 111.09s 252.69s
प्रतिक्रिया समय (कुल) 362.78s 1199.07s
पैरामीटर ~400B कुल (~17B सक्रिय) ~300B कुल (~30B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#78 GPT-5.6 Luna

high
लागत
$0.033
समय
34.2s
टोकन
5,484 tok

#89 SpaceXAI: Grok Build 0.1

medium
लागत
$0.028
समय
81.3s
टोकन
14,009 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.6 Luna 5.5 4.7 55.6% 2 15.63s 7,302 510 17,746
Grok Build 0.1 5.7 9.7 33.3% 0 108.46s 8,304 1,138 161,452

त्वरित तुलना

तुलना जोड़ी बदलें