नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Xiaomi: MiMo-V2.5

LongCat 2.0 (low) average score मध्ये पुढे आहे: 6.7 vs 6.5. MiMo-V2.5 (medium) चा benchmark खर्च कमी आहे: $0.082 vs $0.391. MiMo-V2.5 (medium) वेगवान आहे: 32.20s vs 100.31s, pass rates 53.0% vs 69.7%.

शिफारस केलेले मॉडेलMiMo-V2.5 (medium)Its score stays close to the best score here (6.5 vs 6.7), while costing about 4.8x less than LongCat 2.0 (low).

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-21

मेट्रिक LongCat 2.0 LongCat 2.0 low प्रकाशन: 2026-07-20 MiMo-V2.5 MiMo-V2.5 medium प्रकाशन: 2026-04-22
स्कोअर 6.7 6.5
क्रमांक #96 #107
विश्वसनीयता 9.6 10.0
सुसंगतता 8.9 7.9
बरोबर चाचण्या
प्रति प्रयत्न पास दर 53.0% 69.7%
अस्थिर चाचण्या 3 6
एकूण रन 66 66
प्रति निकाल खर्च 3.910 3.124
एकूण खर्च $0.391 $0.082
इनपुट किंमत $0.300 / 1M $0.140 / 1M
आउटपुट किंमत $1.200 / 1M $0.280 / 1M
एकूण इनपुट टोकन्स 90,909 105,447
आउटपुट टोकन्स 5,679 7,120
रिझनिंग टोकन्स 297,369 230,682
प्रतिसाद वेळ (सरासरी) 100.31s 32.20s
प्रतिसाद वेळ (कमाल) 560.39s 162.44s
प्रतिसाद वेळ (एकूण) 2206.82s 708.46s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#96 LongCat 2.0

low
खर्च
$0.024
वेळ
428.0s
टोकन्स
19,557 tok

#107 MiMo-V2.5

medium
खर्च
$0.002
वेळ
54.8s
टोकन्स
5,247 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
LongCat 2.0 6.6 4.6 77.8% 2 479.30s 6,544 461 206,627
MiMo-V2.5 6.2 4.7 66.7% 2 97.14s 7,422 557 81,977

झटपट तुलना

तुलना जोडी बदला