নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.7 vs Meta: Muse Spark 1.1

Claude Opus 4.7 (medium) average score-এ এগিয়ে: 8.7 vs 8.1. Claude Opus 4.7 (medium)-এর benchmark খরচ কম: $1.477 vs $1.694. Claude Opus 4.7 (medium) দ্রুত: 7.61s vs 31.49s, pass rates 83.3% vs 69.7%.

প্রস্তাবিত মডেলClaude Opus 4.7 (medium)It has the best score here (8.7), while responding about 4.1x faster than Muse Spark 1.1 (high).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-21

মেট্রিক Claude Opus 4.7 Claude Opus 4.7 medium প্রকাশ: 2026-04-16 Muse Spark 1.1 Muse Spark 1.1 high প্রকাশ: 2026-07-16
স্কোর 8.7 8.1
র‍্যাঙ্ক #18 #30
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.6 7.9
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 83.3% 69.7%
অস্থির টেস্ট 1 6
মোট রান 66 64
প্রতি ফলাফলে খরচ 8.201 14.116
মোট খরচ $1.477 $1.694
ইনপুট মূল্য $5.000 / 1M $1.250 / 1M
আউটপুট মূল্য $25.000 / 1M $4.250 / 1M
মোট ইনপুট টোকেন 145,252 129,423
আউটপুট টোকেন 24,948 8,077
রিজনিং টোকেন 5,042 352,421
প্রতিক্রিয়া সময় (গড়) 7.61s 31.49s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 65.40s 196.03s
প্রতিক্রিয়া সময় (মোট) 159.91s 661.28s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#18 Claude Opus 4.7

medium
খরচ
$0.059
সময়
26.8s
টোকেন
2,475 tok

#30 Muse Spark 1.1

high
খরচ
$0.039
সময়
50.1s
টোকেন
9,423 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114
Muse Spark 1.1 10.0 10.0 100.0% 0 22.92s 8,562 349 36,039

দ্রুত তুলনা

তুলনার জুটি বদলান