نیویگیشن
AI BENCHY
Advertise here

Mistral Small 4 (medium) vs GPT-5.6 Luna

GPT-5.6 Luna average score میں آگے ہے: 5.4 vs 5.1. GPT-5.6 Luna کی benchmark لاگت کم ہے: $0.029 vs $0.097. GPT-5.6 Luna تیز ہے: 1.50s vs 10.80s، pass rates 43.9% vs 36.4%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-08-20

درجہ
#236
کل آؤٹ پٹ ٹوکنز
133,597
ردِعمل کا وقت (اوسط)
10.80s
کل لاگت
$0.097
درجہ
#221
کل آؤٹ پٹ ٹوکنز
6,709
ردِعمل کا وقت (اوسط)
1.50s
کل لاگت
$0.029
تجویز کردہ ماڈل GPT-5.6 Luna

It has the best score here (5.4), while costing about 3.4x less than Mistral Small 4 (medium).

تفصیلی موازنہ

میٹرک Mistral Small 4 Mistral Small 4 medium اجرا: 2026-03-16 GPT-5.6 Luna GPT-5.6 Luna none اجرا: 2026-07-09
اسکور 5.1 5.4
درجہ #236 #221
اعتماد پذیری 10.0 10.0
تسلسل 7.0 8.8
کوششیں 66/66 66/66
درست ٹیسٹس
فی کوشش کامیابی کی شرح 43.9% 36.4%
غیر مستحکم ٹیسٹ 8 3
کل رنز 66 66
فی نتیجہ لاگت 1.923 2.357
کل لاگت $0.097 $0.029
ان پٹ قیمت $0.150 / 1M $0.200 / 1M
آؤٹ پٹ قیمت $0.600 / 1M $1.200 / 1M
کل ان پٹ ٹوکنز 140,559 101,332
آؤٹ پٹ ٹوکنز 40,268 6,709
ریزننگ ٹوکنز 93,329 0
ردِعمل کا وقت (اوسط) 10.80s 1.50s
ردِعمل کا وقت (زیادہ سے زیادہ) 59.15s 10.57s
ردِعمل کا وقت (کل) 237.60s 33.05s
پیرامیٹرز 119B کل (6B فعال) ~400B کل (~17B فعال)
دستیابی کھلا ماخذ بند ماخذ

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#236 Mistral Small 4

medium
لاگت
$0.006
وقت
47.9s
ٹوکنز
9,857 tok

#221 GPT-5.6 Luna

none
لاگت
$0.016
وقت
15.8s
ٹوکنز
2,685 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mistral Small 4 4.4 5.1 33.3% 2 39.98s 7,636 11,635 54,715
GPT-5.6 Luna 3.8 7.2 22.2% 1 980ms 7,302 459 0

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں