AI BENCHY
Advertise here
#108

MiMo-V2.5-Pro

Xiaomi रिलीज़: 2026-04-22 परीक्षण किया गया: 2026-05-08 15:29 xiaomi/mimo-v2.5-pro::none
1.02T कुल (42B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

MiMo-V2.5-Pro AI BENCHY पर 5.7 स्कोर करता है और #108 पर है। इसकी reliability 10.0, pass rate 43.9%, कुल लागत $0.035, और औसत response time 1.88s है।

MiMo-V2.5-Pro को अलग क्या बनाता है: यह समान मॉडलों की तुलना में काफ़ी तेज है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
1.02T कुल (42B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
लाइसेंस
MIT

संगति

8.4

कुल आउटपुट टोकन

3,040

कुल इनपुट टोकन

0

इनपुट कीमत

$1.000 / 1M

आउटपुट कीमत

$3.000 / 1M

सही परीक्षण

गलत टेस्ट: 13

प्रति प्रयास पास दर: 43.9%

अस्थिर टेस्ट

4

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

1.88s

प्रतिक्रिया समय (अधिकतम): 8.32s

प्रतिक्रिया समय (कुल): 35.63s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#108 MiMo-V2.5-Pro

none
लागत
$0.004
समय
46.4s
टोकन
4,025 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 02:26 दोबारा परीक्षण 5.4 10.0 $0.068 तुलना करें
2026-07-16 22:42 नया टेस्ट जोड़ा गया 5.5 10.0 $0.068 तुलना करें
2026-06-04 13:48 नया टेस्ट जोड़ा गया 5.5 10.0 $0.017 तुलना करें
2026-05-08 15:29 सूट बदला गया 5.7 10.0 $0.035 वर्तमान रन
2026-04-22 21:39 पहला दर्ज रन 5.8 लागू नहीं $0.033 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-05-08 15:29 · सूट बदला गया57/57 प्रयास5.78.410.06/1943,0400$0.0351.88s
2026-04-22 21:39 · पहला दर्ज रन54/54 प्रयास5.88.3लागू नहीं6/1842,4510$0.0331.51s
अंतर-0.1+0.100+5890+$0.002+364ms

बेंचमार्क कवरेज अलग है: 57/57 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 54/54 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 3.3 8.1
कोडिंग 6.4 3.3
संयुक्त 3.0 10.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 10.0
Samanya Buddhimatta 4.0 10.0
निर्देश पालन 6.4 10.0
पहेली समाधान 6.7 4.7
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल