नेविगेशन
AI BENCHY
Advertise here

Claude Opus 4.7 (medium) vs Muse Spark 1.2 (high)

Muse Spark 1.2 (high) average score में आगे है: 8.8 vs 8.7. Claude Opus 4.7 (medium) की benchmark लागत कम है: $1.477 vs $1.632. Claude Opus 4.7 (medium) तेज है: 7.61s vs 23.99s, pass rates 83.3% vs 75.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-05

रैंक
#23
कुल आउटपुट टोकन
29,990
प्रतिक्रिया समय (औसत)
7.61s
कुल लागत
$1.477
रैंक
#20
कुल आउटपुट टोकन
349,571
प्रतिक्रिया समय (औसत)
23.99s
कुल लागत
$1.632
अनुशंसित मॉडल Claude Opus 4.7 (medium)

Its score stays close to the best score here (8.7 vs 8.8), while responding about 3.1x faster than Muse Spark 1.2 (high).

विस्तृत तुलना

मेट्रिक Claude Opus 4.7 Claude Opus 4.7 medium रिलीज़: 2026-04-16 Muse Spark 1.2 Muse Spark 1.2 high रिलीज़: 2026-08-06
स्कोर 8.7 8.8
रैंक #23 #20
विश्वसनीयता 10.0 9.8
संगति 9.6 8.7
बेंचमार्क कवरेज 22/22 टेस्ट · 66/66 प्रयास 22/22 टेस्ट · 66/66 प्रयास
सही परीक्षण
प्रति प्रयास पास दर 83.3% 75.8%
अस्थिर टेस्ट 1 4
कुल रन 66 66
प्रति परिणाम लागत 8.201 10.880
कुल लागत $1.477 $1.632
इनपुट कीमत $5.000 / 1M $1.250 / 1M
आउटपुट कीमत $25.000 / 1M $4.250 / 1M
कुल इनपुट टोकन 145,252 117,028
आउटपुट टोकन 24,948 6,983
रीजनिंग टोकन 5,042 342,588
प्रतिक्रिया समय (औसत) 7.61s 23.99s
प्रतिक्रिया समय (अधिकतम) 65.40s 192.00s
प्रतिक्रिया समय (कुल) 159.91s 527.70s

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#23 Claude Opus 4.7

medium
लागत
$0.059
समय
26.8s
टोकन
2,475 tok

#20 Muse Spark 1.2

high
लागत
$0.057
समय
34.7s
टोकन
13,356 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114
Muse Spark 1.2 10.0 10.0 100.0% 0 22.24s 7,275 351 47,857

त्वरित तुलना

तुलना जोड़ी बदलें