नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mistral Large 4 (low) vs GPT-5.6 Luna (medium)

Mistral Large 4 (low) average score में आगे है: 7.6 vs 7.4. GPT-5.6 Luna (medium) की benchmark लागत कम है: $0.065 vs $1.648. GPT-5.6 Luna (medium) तेज है: 9.64s vs 300.15s, pass rates 65.2% vs 62.3%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-06

तुलना किए गए मॉडल

रैंक
#119
कुल आउटपुट टोकन
714,287
प्रतिक्रिया समय (औसत)
300.15s
कुल लागत
$1.648
रैंक
#128
कुल आउटपुट टोकन
47,986
प्रतिक्रिया समय (औसत)
9.64s
कुल लागत
$0.065
अनुशंसित मॉडल GPT-5.6 Luna (medium)

Its score stays close to the best score here (7.4 vs 7.6), while costing about 25.6x less than Mistral Large 4 (low).

विस्तृत तुलना

मेट्रिक Mistral Large 4 Mistral Large 4 low रिलीज़: 2026-10-06 GPT-5.6 Luna GPT-5.6 Luna medium रिलीज़: 2026-07-09
स्कोर 7.6 7.4
रैंक #119 #128
विश्वसनीयता 9.0 10.0
संगति 8.7 9.0
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 65.2% 62.3%
अस्थिर टेस्ट 4 3
कुल रन 69 69
प्रति परिणाम लागत 12.670 2.822
कुल लागत $1.648 $0.065
इनपुट कीमत $0.680 / 1M $0.200 / 1M
आउटपुट कीमत $2.090 / 1M $1.200 / 1M
कैश पढ़ने की कीमत $0.070 / 1M $0.020 / 1M
कैश लिखने की कीमत लागू नहीं $0.250 / 1M
कुल इनपुट टोकन 226,734 212,780
आउटपुट टोकन 278,013 6,849
रीजनिंग टोकन 638,296 41,137
प्रतिक्रिया समय (औसत) 300.15s 9.64s
प्रतिक्रिया समय (अधिकतम) 1798.01s 58.09s
प्रतिक्रिया समय (कुल) 6903.40s 221.62s
पैरामीटर 1.05T कुल (49B सक्रिय) ~400B कुल (~17B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#119 Mistral Large 4

low
लागत
$0.015
समय
115.1s
टोकन
6,915 tok

#128 GPT-5.6 Luna

medium
लागत
$0.014
समय
14.6s
टोकन
2,362 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mistral Large 4 3.4 7.2 22.2% 1 1379.72s 5,896 129,426 386,126
GPT-5.6 Luna 5.4 7.2 44.4% 1 10.38s 7,302 564 9,928

त्वरित तुलना

तुलना जोड़ी बदलें