নেভিগেশন
AI BENCHY
Advertise here

Mistral Small 4 (medium) vs GPT-5.6 Luna

GPT-5.6 Luna average score-এ এগিয়ে: 5.4 vs 5.1. GPT-5.6 Luna-এর benchmark খরচ কম: $0.029 vs $0.097. GPT-5.6 Luna দ্রুত: 1.50s vs 10.80s, pass rates 43.9% vs 36.4%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-08-20

র‍্যাঙ্ক
#236
মোট আউটপুট টোকেন
133,597
প্রতিক্রিয়া সময় (গড়)
10.80s
মোট খরচ
$0.097
র‍্যাঙ্ক
#221
মোট আউটপুট টোকেন
6,709
প্রতিক্রিয়া সময় (গড়)
1.50s
মোট খরচ
$0.029
প্রস্তাবিত মডেল GPT-5.6 Luna

It has the best score here (5.4), while costing about 3.4x less than Mistral Small 4 (medium).

বিস্তারিত তুলনা

মেট্রিক Mistral Small 4 Mistral Small 4 medium প্রকাশ: 2026-03-16 GPT-5.6 Luna GPT-5.6 Luna none প্রকাশ: 2026-07-09
স্কোর 5.1 5.4
র‍্যাঙ্ক #236 #221
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 7.0 8.8
প্রচেষ্টা 66/66 66/66
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 43.9% 36.4%
অস্থির টেস্ট 8 3
মোট রান 66 66
প্রতি ফলাফলে খরচ 1.923 2.357
মোট খরচ $0.097 $0.029
ইনপুট মূল্য $0.150 / 1M $0.200 / 1M
আউটপুট মূল্য $0.600 / 1M $1.200 / 1M
মোট ইনপুট টোকেন 140,559 101,332
আউটপুট টোকেন 40,268 6,709
রিজনিং টোকেন 93,329 0
প্রতিক্রিয়া সময় (গড়) 10.80s 1.50s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 59.15s 10.57s
প্রতিক্রিয়া সময় (মোট) 237.60s 33.05s
প্যারামিটার 119B মোট (6B সক্রিয়) ~400B মোট (~17B সক্রিয়)
উপলভ্যতা উন্মুক্ত উৎস বন্ধ উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#236 Mistral Small 4

medium
খরচ
$0.006
সময়
47.9s
টোকেন
9,857 tok

#221 GPT-5.6 Luna

none
খরচ
$0.016
সময়
15.8s
টোকেন
2,685 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Mistral Small 4 4.4 5.1 33.3% 2 39.98s 7,636 11,635 54,715
GPT-5.6 Luna 3.8 7.2 22.2% 1 980ms 7,302 459 0

দ্রুত তুলনা

তুলনার জুটি বদলান