নেভিগেশন
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mistral Large 4 (high) vs GPT-5.6 Luna (medium)

Mistral Large 4 (high) average score-এ এগিয়ে: 7.5 vs 7.4. GPT-5.6 Luna (medium)-এর benchmark খরচ কম: $0.065 vs $1.391. GPT-5.6 Luna (medium) দ্রুত: 9.64s vs 263.69s, pass rates 65.2% vs 62.3%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-10-06

তুলনা করা মডেল

র‍্যাঙ্ক
#126
মোট আউটপুট টোকেন
590,306
প্রতিক্রিয়া সময় (গড়)
263.69s
মোট খরচ
$1.391
র‍্যাঙ্ক
#128
মোট আউটপুট টোকেন
47,986
প্রতিক্রিয়া সময় (গড়)
9.64s
মোট খরচ
$0.065
প্রস্তাবিত মডেল GPT-5.6 Luna (medium)

Its score stays close to the best score here (7.4 vs 7.5), while costing about 21.6x less than Mistral Large 4 (high).

বিস্তারিত তুলনা

মেট্রিক Mistral Large 4 Mistral Large 4 high প্রকাশ: 2026-10-06 GPT-5.6 Luna GPT-5.6 Luna medium প্রকাশ: 2026-07-09
স্কোর 7.5 7.4
র‍্যাঙ্ক #126 #128
নির্ভরযোগ্যতা 9.0 10.0
ধারাবাহিকতা 7.9 9.0
প্রচেষ্টা 69/69 69/69
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 65.2% 62.3%
অস্থির টেস্ট 6 3
মোট রান 69 69
প্রতি ফলাফলে খরচ 11.590 2.822
মোট খরচ $1.391 $0.065
ইনপুট মূল্য $0.680 / 1M $0.200 / 1M
আউটপুট মূল্য $2.090 / 1M $1.200 / 1M
ক্যাশ পড়ার মূল্য $0.070 / 1M $0.020 / 1M
ক্যাশ লেখার মূল্য প্রযোজ্য নয় $0.250 / 1M
মোট ইনপুট টোকেন 230,895 212,780
আউটপুট টোকেন 161,281 6,849
রিজনিং টোকেন 510,655 41,137
প্রতিক্রিয়া সময় (গড়) 263.69s 9.64s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 1727.29s 58.09s
প্রতিক্রিয়া সময় (মোট) 6064.89s 221.62s
প্যারামিটার 1.05T মোট (49B সক্রিয়) ~400B মোট (~17B সক্রিয়)
উপলভ্যতা বন্ধ উৎস বন্ধ উৎস

ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#126 Mistral Large 4

high
খরচ
$0.007
সময়
53.3s
টোকেন
3,333 tok

#128 GPT-5.6 Luna

medium
খরচ
$0.014
সময়
14.6s
টোকেন
2,362 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Mistral Large 4 3.3 4.4 33.3% 2 1277.83s 6,541 53,820 279,694
GPT-5.6 Luna 5.4 7.2 44.4% 1 10.38s 7,302 564 9,928

দ্রুত তুলনা

তুলনার জুটি বদলান