नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mistral Large 4 (high) vs GPT-5.6 Luna (medium)

Mistral Large 4 (high) average score में आगे है: 7.5 vs 7.4. GPT-5.6 Luna (medium) की benchmark लागत कम है: $0.065 vs $1.391. GPT-5.6 Luna (medium) तेज है: 9.64s vs 263.69s, pass rates 65.2% vs 62.3%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-06

तुलना किए गए मॉडल

रैंक
#126
कुल आउटपुट टोकन
590,306
प्रतिक्रिया समय (औसत)
263.69s
कुल लागत
$1.391
रैंक
#128
कुल आउटपुट टोकन
47,986
प्रतिक्रिया समय (औसत)
9.64s
कुल लागत
$0.065
अनुशंसित मॉडल GPT-5.6 Luna (medium)

Its score stays close to the best score here (7.4 vs 7.5), while costing about 21.6x less than Mistral Large 4 (high).

विस्तृत तुलना

मेट्रिक Mistral Large 4 Mistral Large 4 high रिलीज़: 2026-10-06 GPT-5.6 Luna GPT-5.6 Luna medium रिलीज़: 2026-07-09
स्कोर 7.5 7.4
रैंक #126 #128
विश्वसनीयता 9.0 10.0
संगति 7.9 9.0
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 65.2% 62.3%
अस्थिर टेस्ट 6 3
कुल रन 69 69
प्रति परिणाम लागत 11.590 2.822
कुल लागत $1.391 $0.065
इनपुट कीमत $0.680 / 1M $0.200 / 1M
आउटपुट कीमत $2.090 / 1M $1.200 / 1M
कैश पढ़ने की कीमत $0.070 / 1M $0.020 / 1M
कैश लिखने की कीमत लागू नहीं $0.250 / 1M
कुल इनपुट टोकन 230,895 212,780
आउटपुट टोकन 161,281 6,849
रीजनिंग टोकन 510,655 41,137
प्रतिक्रिया समय (औसत) 263.69s 9.64s
प्रतिक्रिया समय (अधिकतम) 1727.29s 58.09s
प्रतिक्रिया समय (कुल) 6064.89s 221.62s
पैरामीटर 1.05T कुल (49B सक्रिय) ~400B कुल (~17B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#126 Mistral Large 4

high
लागत
$0.007
समय
53.3s
टोकन
3,333 tok

#128 GPT-5.6 Luna

medium
लागत
$0.014
समय
14.6s
टोकन
2,362 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mistral Large 4 3.3 4.4 33.3% 2 1277.83s 6,541 53,820 279,694
GPT-5.6 Luna 5.4 7.2 44.4% 1 10.38s 7,302 564 9,928

त्वरित तुलना

तुलना जोड़ी बदलें