नेविगेशन
Advertise here

Muse Spark 1.2 (low) vs Qwen3.8 Max (low)

Qwen3.8 Max (low) average score में आगे है: 8.6 vs 8.4. Muse Spark 1.2 (low) की benchmark लागत कम है: $0.655 vs $0.702. Muse Spark 1.2 (low) तेज है: 9.77s vs 21.83s, pass rates 77.3% vs 80.3%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-18

तुलना किए गए मॉडल

रैंक
#56
कुल आउटपुट टोकन
123,963
प्रतिक्रिया समय (औसत)
9.77s
कुल लागत
$0.655
रैंक
#50
कुल आउटपुट टोकन
83,821
प्रतिक्रिया समय (औसत)
21.83s
कुल लागत
$0.702
अनुशंसित मॉडल Muse Spark 1.2 (low)

Its score stays close to the best score here (8.4 vs 8.6), while responding about 2.2x faster than Qwen3.8 Max (low).

विस्तृत तुलना

मेट्रिक Muse Spark 1.2 Muse Spark 1.2 low रिलीज़: 2026-08-06 Qwen3.8 Max Qwen3.8 Max low रिलीज़: 2026-08-04
स्कोर 8.4 8.6
रैंक #56 #50
विश्वसनीयता 10.0 10.0
संगति 9.0 9.0
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 77.3% 80.3%
अस्थिर टेस्ट 3 3
कुल रन 66 66
प्रति परिणाम लागत 4.361 4.384
कुल लागत $0.655 $0.702
इनपुट कीमत $1.250 / 1M $2.000 / 1M
आउटपुट कीमत $4.250 / 1M $6.000 / 1M
कुल इनपुट टोकन 101,811 99,181
आउटपुट टोकन 8,025 6,132
रीजनिंग टोकन 115,938 77,689
प्रतिक्रिया समय (औसत) 9.77s 21.83s
प्रतिक्रिया समय (अधिकतम) 47.80s 155.75s
प्रतिक्रिया समय (कुल) 214.83s 480.37s
पैरामीटर ~1T कुल (~50B सक्रिय) 2.4T कुल (~100B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#56 Muse Spark 1.2

low
लागत
$0.019
समय
14.6s
टोकन
4,384 tok

#50 Qwen3.8 Max

low
लागत
$0.026
समय
68.5s
टोकन
4,280 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Muse Spark 1.2 8.4 7.4 88.9% 1 10.09s 7,275 343 19,717
Qwen3.8 Max 8.4 7.4 88.9% 1 28.69s 8,127 512 15,952

त्वरित तुलना

तुलना जोड़ी बदलें