AI BENCHY
Advertise here
#108

MiMo-V2.5-Pro

Xiaomi प्रकाशन: 2026-04-22 चाचणी तारीख: 2026-05-08 15:29 xiaomi/mimo-v2.5-pro::none
1.02T एकूण (42B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

MiMo-V2.5-Pro AI BENCHY वर 5.7 स्कोर करते आणि #108 वर आहे. याची reliability 10.0, pass rate 43.9%, एकूण खर्च $0.035, आणि सरासरी response time 1.88s आहे.

MiMo-V2.5-Pro खास का आहे: समान मॉडेल्सच्या तुलनेत हे लक्षणीय वेगवान आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
1.02T एकूण (42B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
MIT

सुसंगतता

8.4

एकूण आउटपुट टोकन्स

3,040

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$1.000 / 1M

आउटपुट किंमत

$3.000 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 13

प्रति प्रयत्न पास दर: 43.9%

अस्थिर चाचण्या

4

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

1.88s

प्रतिसाद वेळ (कमाल): 8.32s

प्रतिसाद वेळ (एकूण): 35.63s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#108 MiMo-V2.5-Pro

none
खर्च
$0.004
वेळ
46.4s
टोकन्स
4,025 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:26 पुन्हा चाचणी 5.4 10.0 $0.068 तुलना करा
2026-07-16 22:42 नवीन चाचणी जोडली 5.5 10.0 $0.068 तुलना करा
2026-06-04 13:48 नवीन चाचणी जोडली 5.5 10.0 $0.017 तुलना करा
2026-05-08 15:29 सूट बदलला 5.7 10.0 $0.035 सध्याची रन
2026-04-22 21:39 पहिली नोंदलेली रन 5.8 लागू नाही $0.033 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-08 15:29 · सूट बदलला57/57 प्रयत्न5.78.410.06/1943,0400$0.0351.88s
2026-08-14 02:26 · पुन्हा चाचणी66/66 प्रयत्न5.48.610.05/22415,362124,808$0.0684.24s
फरक+0.3-0.20.0+10-12322-124808-$0.034-2365ms

बेंचमार्क कव्हरेज वेगळे आहे: 57/57 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 66/66 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 3.3 8.1
कोडिंग 6.4 3.3
संयुक्त 3.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 10.0
Samanya Buddhimatta 4.0 10.0
सूचनांचे पालन 6.4 10.0
कोडी सोडवणे 6.7 4.7
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स