AI BENCHY
Advertise here
#75

MiMo-V2.5-Pro

Xiaomi प्रकाशन: 2026-04-22 चाचणी तारीख: 2026-04-22 21:39 xiaomi/mimo-v2.5-pro::none
1.02T एकूण (42B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

MiMo-V2.5-Pro AI BENCHY वर 5.8 स्कोर करते आणि #75 वर आहे. याची reliability लागू नाही, pass rate 46.3%, एकूण खर्च $0.033, आणि सरासरी response time 1.51s आहे.

MiMo-V2.5-Pro खास का आहे: या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे. समान मॉडेल्सच्या तुलनेत हे लक्षणीय वेगवान आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
1.02T एकूण (42B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
MIT

सुसंगतता

8.3

विश्वसनीयता

लागू नाही

एकूण आउटपुट टोकन्स

2,451

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$1.000 / 1M

आउटपुट किंमत

$3.000 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 12

प्रति प्रयत्न पास दर: 46.3%

अस्थिर चाचण्या

4

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

1.51s

प्रतिसाद वेळ (कमाल): 3.54s

प्रतिसाद वेळ (एकूण): 27.21s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#75 MiMo-V2.5-Pro

none
खर्च
$0.004
वेळ
46.4s
टोकन्स
4,025 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:26 पुन्हा चाचणी 5.4 10.0 $0.068 तुलना करा
2026-07-16 22:42 नवीन चाचणी जोडली 5.5 10.0 $0.068 तुलना करा
2026-06-04 13:48 नवीन चाचणी जोडली 5.5 10.0 $0.017 तुलना करा
2026-05-08 15:29 सूट बदलला 5.7 10.0 $0.035 तुलना करा
2026-04-22 21:39 पहिली नोंदलेली रन 5.8 लागू नाही $0.033 सध्याची रन

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-04-22 21:39 · पहिली नोंदलेली रन54/54 प्रयत्न5.88.3लागू नाही6/1842,4510$0.0331.51s
2026-05-08 15:29 · सूट बदलला57/57 प्रयत्न5.78.410.06/1943,0400$0.0351.88s
फरक+0.1-0.100-5890-$0.002-364ms

बेंचमार्क कव्हरेज वेगळे आहे: 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 57/57 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 2.9 7.9
कोडिंग 6.4 3.3
संयुक्त 3.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 10.0
Samanya Buddhimatta 4.5 10.0
सूचनांचे पालन 6.4 10.0
कोडी सोडवणे 6.7 4.7
टूल कॉलिंग 10.0 10.0

तुलना केलेली मॉडेल्स