AI BENCHY
Advertise here
#46

MiMo-V2-Flash

Xiaomi प्रकाशन: 2025-12-16 चाचणी तारीख: 2026-04-11 01:44 xiaomi/mimo-v2-flash::medium
309B एकूण (15B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

MiMo-V2-Flash AI BENCHY वर 7.5 स्कोर करते आणि #46 वर आहे. याची reliability लागू नाही, pass rate 70.4%, एकूण खर्च $0.038, आणि सरासरी response time 23.36s आहे.

MiMo-V2-Flash खास का आहे: हे सूचनांचे पालन मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #1 आहे; तर कोडिंग हा सर्वात कमकुवत भाग आहे, rank #18. या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे.

संग्रहित मॉडेल: हे मॉडेल आता अपडेट केले जाणार नाही आणि नवीन चाचण्यांवर तपासले जाणार नाही.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
309B एकूण (15B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
MIT

सुसंगतता

8.6

विश्वसनीयता

लागू नाही

एकूण आउटपुट टोकन्स

127,569

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.090 / 1M

आउटपुट किंमत

$0.290 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 7

प्रति प्रयत्न पास दर: 70.4%

अस्थिर चाचण्या

3

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

23.36s

प्रतिसाद वेळ (कमाल): 96.01s

प्रतिसाद वेळ (एकूण): 280.34s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#46 MiMo-V2-Flash

medium
अवैध SVG
खर्च
$0.020
वेळ
284.1s
टोकन्स
65,689 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-06-04 13:48 नवीन चाचणी जोडली 6.3 10.0 $0.043 तुलना करा
2026-05-22 00:20 सूट बदलला 7.1 10.0 $0.038 तुलना करा
2026-04-11 01:44 पहिली नोंदलेली रन 7.5 लागू नाही $0.038 सध्याची रन

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-04-11 01:44 · पहिली नोंदलेली रन54/54 प्रयत्न7.58.6लागू नाही11/183127,5690$0.03823.36s
2026-05-22 00:20 · सूट बदलला60/60 प्रयत्न7.18.710.011/203127,6090$0.03820.26s
फरक+0.4-0.100-400-$0.001+3099ms

बेंचमार्क कव्हरेज वेगळे आहे: 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 8.1 7.9
कोडिंग 4.7 1.6
संयुक्त 9.8 10.0
डेटा पार्सिंग आणि निष्कर्षण 6.5 10.0
डोमेन-विशिष्ट 5.9 7.2
Samanya Buddhimatta 4.0 10.0
सूचनांचे पालन 10.0 10.0
कोडी सोडवणे 7.7 10.0
टूल कॉलिंग 10.0 10.0

तुलना केलेली मॉडेल्स