नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Xiaomi: MiMo-V2.5

LongCat 2.0 (high) average score मध्ये पुढे आहे: 6.6 vs 6.5. MiMo-V2.5 (medium) चा benchmark खर्च कमी आहे: $0.082 vs $0.469. MiMo-V2.5 (medium) वेगवान आहे: 32.20s vs 148.73s, pass rates 53.0% vs 69.7%.

शिफारस केलेले मॉडेलMiMo-V2.5 (medium)Its score stays close to the best score here (6.5 vs 6.6), while costing about 5.8x less than LongCat 2.0 (high).

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-21

मेट्रिक LongCat 2.0 LongCat 2.0 high प्रकाशन: 2026-07-20 MiMo-V2.5 MiMo-V2.5 medium प्रकाशन: 2026-04-22
स्कोअर 6.6 6.5
क्रमांक #102 #107
विश्वसनीयता 9.4 10.0
सुसंगतता 8.2 7.9
बरोबर चाचण्या
प्रति प्रयत्न पास दर 53.0% 69.7%
अस्थिर चाचण्या 5 6
एकूण रन 66 66
प्रति निकाल खर्च 5.202 3.124
एकूण खर्च $0.469 $0.082
इनपुट किंमत $0.300 / 1M $0.140 / 1M
आउटपुट किंमत $1.200 / 1M $0.280 / 1M
एकूण इनपुट टोकन्स 93,357 105,447
आउटपुट टोकन्स 30,466 7,120
रिझनिंग टोकन्स 336,325 230,682
प्रतिसाद वेळ (सरासरी) 148.73s 32.20s
प्रतिसाद वेळ (कमाल) 941.66s 162.44s
प्रतिसाद वेळ (एकूण) 3272.00s 708.46s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#102 LongCat 2.0

high
अवैध SVG
खर्च
$0.000
वेळ
600.0s
टोकन्स
0 tok

#107 MiMo-V2.5

medium
खर्च
$0.002
वेळ
54.8s
टोकन्स
5,247 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
LongCat 2.0 7.6 7.2 77.8% 1 505.33s 6,913 244 192,377
MiMo-V2.5 6.2 4.7 66.7% 2 97.14s 7,422 557 81,977

झटपट तुलना

तुलना जोडी बदला