नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mistral Large 4 (low) vs Qwen3.7 Flash (low)

Qwen3.7 Flash (low) average score में आगे है: 7.7 vs 7.6. Qwen3.7 Flash (low) की benchmark लागत कम है: $0.071 vs $1.648. Qwen3.7 Flash (low) तेज है: 41.03s vs 300.15s, pass rates 65.2% vs 68.1%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-06

तुलना किए गए मॉडल

रैंक
#119
कुल आउटपुट टोकन
714,287
प्रतिक्रिया समय (औसत)
300.15s
कुल लागत
$1.648
रैंक
#117
कुल आउटपुट टोकन
331,107
प्रतिक्रिया समय (औसत)
41.03s
कुल लागत
$0.071
अनुशंसित मॉडल Qwen3.7 Flash (low)

It has the best score here (7.7), while costing about 23.4x less than Mistral Large 4 (low).

विस्तृत तुलना

मेट्रिक Mistral Large 4 Mistral Large 4 low रिलीज़: 2026-10-06 Qwen3.7 Flash Qwen3.7 Flash low रिलीज़: 2026-07-28
स्कोर 7.6 7.7
रैंक #119 #117
विश्वसनीयता 9.0 10.0
संगति 8.7 8.1
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 65.2% 68.1%
अस्थिर टेस्ट 4 6
कुल रन 69 69
प्रति परिणाम लागत 12.670 0.439
कुल लागत $1.648 $0.071
इनपुट कीमत $0.680 / 1M $0.030 / 1M
आउटपुट कीमत $2.090 / 1M $0.130 / 1M
कैश पढ़ने की कीमत $0.070 / 1M $0.006 / 1M
कैश लिखने की कीमत लागू नहीं $0.039 / 1M
कुल इनपुट टोकन 226,734 318,058
आउटपुट टोकन 278,013 16,035
रीजनिंग टोकन 638,296 315,072
प्रतिक्रिया समय (औसत) 300.15s 41.03s
प्रतिक्रिया समय (अधिकतम) 1798.01s 394.54s
प्रतिक्रिया समय (कुल) 6903.40s 943.75s
पैरामीटर 1.05T कुल (49B सक्रिय) ~35B कुल (~3B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#119 Mistral Large 4

low
लागत
$0.015
समय
115.1s
टोकन
6,915 tok

#117 Qwen3.7 Flash

low
Reached the allocated time limit (600 seconds) without receiving showcase output.
लागत
$0.000
समय
600.0s
टोकन
0 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mistral Large 4 3.4 7.2 22.2% 1 1379.72s 5,896 129,426 386,126
Qwen3.7 Flash 6.7 7.8 55.6% 1 42.36s 7,893 428 56,419

त्वरित तुलना

तुलना जोड़ी बदलें