Advertise here
#135

Mistral Small 4

Mistral प्रकाशन: 2026-03-16 चाचणी तारीख: 2026-05-22 00:14 mistralai/mistral-small-2603::none
119B एकूण (6B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

Mistral Small 4 AI BENCHY वर 5.0 स्कोर करते आणि #135 वर आहे. याची reliability 10.0, pass rate 28.3%, एकूण खर्च $0.007, आणि सरासरी response time 658ms आहे.

Mistral Small 4 खास का आहे: हे डोमेन-विशिष्ट मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #2 आहे; तर अँटी-एआय युक्त्या हा सर्वात कमकुवत भाग आहे, rank #18. या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे. समान मॉडेल्सच्या तुलनेत हे लक्षणीय वेगवान आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
119B एकूण (6B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
Apache-2.0

सुसंगतता

9.5

एकूण आउटपुट टोकन्स

2,251

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.150 / 1M

आउटपुट किंमत

$0.600 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 15

प्रति प्रयत्न पास दर: 28.3%

अस्थिर चाचण्या

1

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

658ms

प्रतिसाद वेळ (कमाल): 1.72s

प्रतिसाद वेळ (एकूण): 13.16s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#135 Mistral Small 4

none
खर्च
$0.002
वेळ
10.4s
टोकन्स
2,370 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:04 पुन्हा चाचणी 5.1 10.0 $0.022 तुलना करा
2026-07-16 22:21 नवीन चाचणी जोडली 5.1 10.0 $0.022 तुलना करा
2026-06-04 13:41 नवीन चाचणी जोडली 4.9 10.0 $0.007 तुलना करा
2026-05-22 00:14 सूट बदलला 5.0 10.0 $0.007 सध्याची रन
2026-04-11 01:44 पहिली नोंदलेली रन 5.2 लागू नाही $0.006 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-22 00:14 · सूट बदलला60/60 प्रयत्न5.09.510.05/2012,2510$0.007658ms
2026-08-14 02:04 · पुन्हा चाचणी66/66 प्रयत्न5.19.610.05/2219,812104,717$0.0221.20s
फरक-0.2-0.10.000-7561-104717-$0.016-543ms

बेंचमार्क कव्हरेज वेगळे आहे: 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 66/66 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 3.4 7.9
कोडिंग 4.0 9.5
संयुक्त 3.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 10.0
Samanya Buddhimatta 4.0 10.0
सूचनांचे पालन 6.5 10.0
कोडी सोडवणे 3.1 9.9
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स