नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.7 vs Meta: Muse Spark 1.1

Claude Opus 4.7 (medium) average score मध्ये पुढे आहे: 8.7 vs 8.1. Claude Opus 4.7 (medium) चा benchmark खर्च कमी आहे: $1.477 vs $1.694. Claude Opus 4.7 (medium) वेगवान आहे: 7.61s vs 31.49s, pass rates 83.3% vs 69.7%.

शिफारस केलेले मॉडेलClaude Opus 4.7 (medium)It has the best score here (8.7), while responding about 4.1x faster than Muse Spark 1.1 (high).

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-21

मेट्रिक Claude Opus 4.7 Claude Opus 4.7 medium प्रकाशन: 2026-04-16 Muse Spark 1.1 Muse Spark 1.1 high प्रकाशन: 2026-07-16
स्कोअर 8.7 8.1
क्रमांक #18 #30
विश्वसनीयता 10.0 10.0
सुसंगतता 9.6 7.9
बरोबर चाचण्या
प्रति प्रयत्न पास दर 83.3% 69.7%
अस्थिर चाचण्या 1 6
एकूण रन 66 64
प्रति निकाल खर्च 8.201 14.116
एकूण खर्च $1.477 $1.694
इनपुट किंमत $5.000 / 1M $1.250 / 1M
आउटपुट किंमत $25.000 / 1M $4.250 / 1M
एकूण इनपुट टोकन्स 145,252 129,423
आउटपुट टोकन्स 24,948 8,077
रिझनिंग टोकन्स 5,042 352,421
प्रतिसाद वेळ (सरासरी) 7.61s 31.49s
प्रतिसाद वेळ (कमाल) 65.40s 196.03s
प्रतिसाद वेळ (एकूण) 159.91s 661.28s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#18 Claude Opus 4.7

medium
खर्च
$0.059
वेळ
26.8s
टोकन्स
2,475 tok

#30 Muse Spark 1.1

high
खर्च
$0.039
वेळ
50.1s
टोकन्स
9,423 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114
Muse Spark 1.1 10.0 10.0 100.0% 0 22.92s 8,562 349 36,039

झटपट तुलना

तुलना जोडी बदला