नेविगेशन
AI BENCHY
Advertise here

Muse Spark 1.2 (high) vs Qwen3.8 Max (medium)

Qwen3.8 Max (medium) average score में आगे है: 9.1 vs 8.8. Qwen3.8 Max (medium) की benchmark लागत कम है: $0.728 vs $1.632. Qwen3.8 Max (medium) तेज है: 21.53s vs 23.99s, pass rates 75.8% vs 84.9%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-14

रैंक
#26
कुल आउटपुट टोकन
349,571
प्रतिक्रिया समय (औसत)
23.99s
कुल लागत
$1.632
रैंक
#19
कुल आउटपुट टोकन
84,826
प्रतिक्रिया समय (औसत)
21.53s
कुल लागत
$0.728
अनुशंसित मॉडल Qwen3.8 Max (medium)

It has the best score here (9.1), while costing about 2.2x less than Muse Spark 1.2 (high).

विस्तृत तुलना

मेट्रिक Muse Spark 1.2 Muse Spark 1.2 high रिलीज़: 2026-08-06 Qwen3.8 Max Qwen3.8 Max medium रिलीज़: 2026-08-04
स्कोर 8.8 9.1
रैंक #26 #19
विश्वसनीयता 9.8 10.0
संगति 8.7 9.7
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 75.8% 84.9%
अस्थिर टेस्ट 4 1
कुल रन 66 66
प्रति परिणाम लागत 10.880 4.040
कुल लागत $1.632 $0.728
इनपुट कीमत $1.250 / 1M $2.000 / 1M
आउटपुट कीमत $4.250 / 1M $6.000 / 1M
कुल इनपुट टोकन 117,028 109,046
आउटपुट टोकन 6,983 6,567
रीजनिंग टोकन 342,588 78,259
प्रतिक्रिया समय (औसत) 23.99s 21.53s
प्रतिक्रिया समय (अधिकतम) 192.00s 126.60s
प्रतिक्रिया समय (कुल) 527.70s 473.75s
पैरामीटर ~1T कुल (~50B सक्रिय) 2.4T कुल (~100B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#26 Muse Spark 1.2

high
लागत
$0.057
समय
34.7s
टोकन
13,356 tok

#19 Qwen3.8 Max

medium
लागत
$0.028
समय
71.9s
टोकन
4,750 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Muse Spark 1.2 10.0 10.0 100.0% 0 22.24s 7,275 351 47,857
Qwen3.8 Max 10.0 10.0 100.0% 0 41.35s 7,893 430 23,804

त्वरित तुलना

तुलना जोड़ी बदलें