Advertise here
#79

Mistral Small 4

Mistral प्रकाशन: 2026-03-16 चाचणी तारीख: 2026-04-11 01:44 mistralai/mistral-small-2603::medium
119B एकूण (6B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

Mistral Small 4 AI BENCHY वर 5.7 स्कोर करते आणि #79 वर आहे. याची reliability लागू नाही, pass rate 50.0%, एकूण खर्च $0.034, आणि सरासरी response time 5.64s आहे.

Mistral Small 4 खास का आहे: या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे. समान मॉडेल्सच्या तुलनेत हे लक्षणीय वेगवान आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
119B एकूण (6B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
Apache-2.0

सुसंगतता

6.8

विश्वसनीयता

लागू नाही

एकूण आउटपुट टोकन्स

54,492

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.150 / 1M

आउटपुट किंमत

$0.600 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 13

प्रति प्रयत्न पास दर: 50.0%

अस्थिर चाचण्या

7

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

5.64s

प्रतिसाद वेळ (कमाल): 30.49s

प्रतिसाद वेळ (एकूण): 101.52s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#79 Mistral Small 4

medium
खर्च
$0.006
वेळ
47.9s
टोकन्स
9,857 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:05 पुन्हा चाचणी 5.1 10.0 $0.097 तुलना करा
2026-07-16 22:23 नवीन चाचणी जोडली 5.1 10.0 $0.096 तुलना करा
2026-06-04 13:43 नवीन चाचणी जोडली 5.3 10.0 $0.068 तुलना करा
2026-05-22 00:16 सूट बदलला 5.4 10.0 $0.056 तुलना करा
2026-04-11 01:44 पहिली नोंदलेली रन 5.7 लागू नाही $0.034 सध्याची रन

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-04-11 01:44 · पहिली नोंदलेली रन54/54 प्रयत्न5.76.8लागू नाही5/18754,4920$0.0345.64s
2026-05-22 00:16 · सूट बदलला60/60 प्रयत्न5.47.110.05/20789,6830$0.0568.33s
फरक+0.3-0.300-351910-$0.022-2689ms

बेंचमार्क कव्हरेज वेगळे आहे: 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 5.6 3.8
कोडिंग 6.7 3.5
संयुक्त 3.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 7.3 5.9
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 4.8 10.0
सूचनांचे पालन 7.3 5.8
कोडी सोडवणे 3.4 9.7
टूल कॉलिंग 10.0 10.0

तुलना केलेली मॉडेल्स