नेविगेशन
AI BENCHY
Advertise here

Muse Spark 1.2 (high) vs GPT-5.4 (medium)

Muse Spark 1.2 (high) average score में आगे है: 8.8 vs 8.5. GPT-5.4 (medium) की benchmark लागत कम है: $1.533 vs $1.632. GPT-5.4 (medium) तेज है: 23.10s vs 23.99s, pass rates 75.8% vs 77.3%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-05

रैंक
#20
कुल आउटपुट टोकन
349,571
प्रतिक्रिया समय (औसत)
23.99s
कुल लागत
$1.632
रैंक
#29
कुल आउटपुट टोकन
88,670
प्रतिक्रिया समय (औसत)
23.10s
कुल लागत
$1.533
अनुशंसित मॉडल Muse Spark 1.2 (high)

It has the strongest score in this comparison (8.8) and the best overall balance of cost and response time across all 2 models.

विस्तृत तुलना

मेट्रिक Muse Spark 1.2 Muse Spark 1.2 high रिलीज़: 2026-08-06 GPT-5.4 GPT-5.4 medium रिलीज़: 2026-03-05
स्कोर 8.8 8.5
रैंक #20 #29
विश्वसनीयता 9.8 10.0
संगति 8.7 8.6
बेंचमार्क कवरेज 22/22 टेस्ट · 66/66 प्रयास 22/22 टेस्ट · 66/66 प्रयास
सही परीक्षण
प्रति प्रयास पास दर 75.8% 77.3%
अस्थिर टेस्ट 4 4
कुल रन 66 66
प्रति परिणाम लागत 10.880 10.220
कुल लागत $1.632 $1.533
इनपुट कीमत $1.250 / 1M $2.500 / 1M
आउटपुट कीमत $4.250 / 1M $15.000 / 1M
कुल इनपुट टोकन 117,028 81,127
आउटपुट टोकन 6,983 6,155
रीजनिंग टोकन 342,588 82,515
प्रतिक्रिया समय (औसत) 23.99s 23.10s
प्रतिक्रिया समय (अधिकतम) 192.00s 100.41s
प्रतिक्रिया समय (कुल) 527.70s 508.26s

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#20 Muse Spark 1.2

high
लागत
$0.057
समय
34.7s
टोकन
13,356 tok

#29 GPT-5.4

medium
लागत
$0.214
समय
199.6s
टोकन
14,349 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Muse Spark 1.2 10.0 10.0 100.0% 0 22.24s 7,275 351 47,857
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216

त्वरित तुलना

तुलना जोड़ी बदलें