নেভিগেশন
AI BENCHY
Advertise here

Muse Spark 1.2 (medium) vs Qwen3.8 Max (low)

average score প্রায় সমান: 8.6 vs 8.7. Qwen3.8 Max (low)-এর benchmark খরচ কম: $0.687 vs $1.227. Muse Spark 1.2 (medium) দ্রুত: 17.47s vs 21.19s, pass rates 74.2% vs 84.9%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-08-05

র‍্যাঙ্ক
#25
মোট আউটপুট টোকেন
252,312
প্রতিক্রিয়া সময় (গড়)
17.47s
মোট খরচ
$1.227
র‍্যাঙ্ক
#24
মোট আউটপুট টোকেন
81,411
প্রতিক্রিয়া সময় (গড়)
21.19s
মোট খরচ
$0.687
প্রস্তাবিত মডেল Qwen3.8 Max (low)

It has the best score here (8.7), while costing about 1.8x less than Muse Spark 1.2 (medium).

বিস্তারিত তুলনা

মেট্রিক Muse Spark 1.2 Muse Spark 1.2 medium প্রকাশ: 2026-08-06 Qwen3.8 Max Qwen3.8 Max low প্রকাশ: 2026-08-04
স্কোর 8.6 8.7
র‍্যাঙ্ক #25 #24
নির্ভরযোগ্যতা 9.9 10.0
ধারাবাহিকতা 8.7 9.0
বেঞ্চমার্ক কভারেজ 22/22 টেস্ট · 66/66 প্রচেষ্টা 22/22 টেস্ট · 66/66 প্রচেষ্টা
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 74.2% 84.9%
অস্থির টেস্ট 4 3
মোট রান 66 66
প্রতি ফলাফলে খরচ 8.764 4.041
মোট খরচ $1.227 $0.687
ইনপুট মূল্য $1.250 / 1M $2.000 / 1M
আউটপুট মূল্য $4.250 / 1M $6.000 / 1M
মোট ইনপুট টোকেন 123,671 99,172
আউটপুট টোকেন 7,222 6,132
রিজনিং টোকেন 245,090 75,279
প্রতিক্রিয়া সময় (গড়) 17.47s 21.19s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 142.49s 155.75s
প্রতিক্রিয়া সময় (মোট) 384.44s 466.14s

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#25 Muse Spark 1.2

medium
খরচ
$0.033
সময়
21.8s
টোকেন
7,846 tok

#24 Qwen3.8 Max

low
খরচ
$0.026
সময়
68.5s
টোকেন
4,280 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Muse Spark 1.2 10.0 10.0 100.0% 0 17.49s 7,275 353 33,215
Qwen3.8 Max 8.4 7.4 88.9% 1 28.69s 8,127 512 15,952

দ্রুত তুলনা

তুলনার জুটি বদলান