नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.7 vs Meta: Muse Spark 1.1

Claude Opus 4.7 (medium) average score में आगे है: 8.7 vs 8.1. Claude Opus 4.7 (medium) की benchmark लागत कम है: $1.477 vs $1.694. Claude Opus 4.7 (medium) तेज है: 7.61s vs 31.49s, pass rates 83.3% vs 69.7%.

अनुशंसित मॉडलClaude Opus 4.7 (medium)It has the best score here (8.7), while responding about 4.1x faster than Muse Spark 1.1 (high).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक Claude Opus 4.7 Claude Opus 4.7 medium रिलीज़: 2026-04-16 Muse Spark 1.1 Muse Spark 1.1 high रिलीज़: 2026-07-16
स्कोर 8.7 8.1
रैंक #18 #30
विश्वसनीयता 10.0 10.0
संगति 9.6 7.9
सही परीक्षण
प्रति प्रयास पास दर 83.3% 69.7%
अस्थिर टेस्ट 1 6
कुल रन 66 64
प्रति परिणाम लागत 8.201 14.116
कुल लागत $1.477 $1.694
इनपुट कीमत $5.000 / 1M $1.250 / 1M
आउटपुट कीमत $25.000 / 1M $4.250 / 1M
कुल इनपुट टोकन 145,252 129,423
आउटपुट टोकन 24,948 8,077
रीजनिंग टोकन 5,042 352,421
प्रतिक्रिया समय (औसत) 7.61s 31.49s
प्रतिक्रिया समय (अधिकतम) 65.40s 196.03s
प्रतिक्रिया समय (कुल) 159.91s 661.28s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#18 Claude Opus 4.7

medium
लागत
$0.059
समय
26.8s
टोकन
2,475 tok

#30 Muse Spark 1.1

high
लागत
$0.039
समय
50.1s
टोकन
9,423 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114
Muse Spark 1.1 10.0 10.0 100.0% 0 22.92s 8,562 349 36,039

त्वरित तुलना

तुलना जोड़ी बदलें