नेविगेशन
AI BENCHY
Advertise here

GPT-5.4 Mini (medium) vs Grok Build 0.1 (medium)

average score लगभग बराबर है: 7.5 vs 7.5. GPT-5.4 Mini (medium) की benchmark लागत कम है: $0.786 vs $1.130. GPT-5.4 Mini (medium) तेज है: 26.72s vs 54.50s, pass rates 68.2% vs 60.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-15

रैंक
#88
कुल आउटपुट टोकन
158,344
प्रतिक्रिया समय (औसत)
26.72s
कुल लागत
$0.786
रैंक
#89
कुल आउटपुट टोकन
511,406
प्रतिक्रिया समय (औसत)
54.50s
कुल लागत
$1.130
अनुशंसित मॉडल GPT-5.4 Mini (medium)

It has the best score here (7.5), while responding about 2.0x faster than Grok Build 0.1 (medium).

विस्तृत तुलना

मेट्रिक GPT-5.4 Mini GPT-5.4 Mini medium रिलीज़: 2026-03-17 Grok Build 0.1 Grok Build 0.1 medium रिलीज़: 2026-05-21
स्कोर 7.5 7.5
रैंक #88 #89
विश्वसनीयता 10.0 10.0
संगति 8.1 9.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 68.2% 60.6%
अस्थिर टेस्ट 5 1
कुल रन 66 66
प्रति परिणाम लागत 6.546 8.691
कुल लागत $0.786 $1.130
इनपुट कीमत $0.750 / 1M $1.000 / 1M
आउटपुट कीमत $4.500 / 1M $2.000 / 1M
कुल इनपुट टोकन 97,164 106,946
आउटपुट टोकन 6,211 7,993
रीजनिंग टोकन 152,133 503,413
प्रतिक्रिया समय (औसत) 26.72s 54.50s
प्रतिक्रिया समय (अधिकतम) 138.75s 252.69s
प्रतिक्रिया समय (कुल) 587.90s 1199.07s
पैरामीटर ~400B कुल (~17B सक्रिय) ~300B कुल (~30B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#88 GPT-5.4 Mini

medium
लागत
$0.056
समय
95.5s
टोकन
12,464 tok

#89 SpaceXAI: Grok Build 0.1

medium
लागत
$0.028
समय
81.3s
टोकन
14,009 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.4 Mini 8.4 7.4 88.9% 1 57.87s 7,305 467 40,902
Grok Build 0.1 5.7 9.7 33.3% 0 108.46s 8,304 1,138 161,452

त्वरित तुलना

तुलना जोड़ी बदलें