Advertise here
#121

Mistral Small 4

Mistral प्रकाशन: 2026-03-16 चाचणी तारीख: 2026-05-22 00:16 mistralai/mistral-small-2603::medium
119B एकूण (6B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

Mistral Small 4 AI BENCHY वर 5.4 स्कोर करते आणि #121 वर आहे. याची reliability 10.0, pass rate 45.0%, एकूण खर्च $0.056, आणि सरासरी response time 8.33s आहे.

Mistral Small 4 खास का आहे: हे डोमेन-विशिष्ट मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #4 आहे; तर कोडिंग हा सर्वात कमकुवत भाग आहे, rank #18. या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
119B एकूण (6B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
Apache-2.0

सुसंगतता

7.1

एकूण आउटपुट टोकन्स

89,683

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.150 / 1M

आउटपुट किंमत

$0.600 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 15

प्रति प्रयत्न पास दर: 45.0%

अस्थिर चाचण्या

7

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

8.33s

प्रतिसाद वेळ (कमाल): 59.15s

प्रतिसाद वेळ (एकूण): 166.59s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#121 Mistral Small 4

medium
खर्च
$0.006
वेळ
47.9s
टोकन्स
9,857 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:05 पुन्हा चाचणी 5.1 10.0 $0.097 तुलना करा
2026-07-16 22:23 नवीन चाचणी जोडली 5.1 10.0 $0.096 तुलना करा
2026-06-04 13:43 नवीन चाचणी जोडली 5.3 10.0 $0.068 तुलना करा
2026-05-22 00:16 सूट बदलला 5.4 10.0 $0.056 सध्याची रन
2026-04-11 01:44 पहिली नोंदलेली रन 5.7 लागू नाही $0.034 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-22 00:16 · सूट बदलला60/60 प्रयत्न5.47.110.05/20789,6830$0.0568.33s
2026-06-04 13:43 · नवीन चाचणी जोडली63/63 प्रयत्न5.36.910.05/218108,86242,576$0.0689.40s
फरक+0.1+0.20.00-1-19179-42576-$0.012-1070ms

बेंचमार्क कव्हरेज वेगळे आहे: 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 63/63 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 5.6 3.8
कोडिंग 5.1 6.8
संयुक्त 3.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 7.3 5.9
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 4.8 10.0
सूचनांचे पालन 7.3 5.8
कोडी सोडवणे 3.4 9.7
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स