नेविगेशन
AI BENCHY
Advertise here

Meituan: LongCat 2.0 vs Xiaomi: MiMo-V2.5

LongCat 2.0 (low) average score में आगे है: 6.7 vs 6.5. MiMo-V2.5 (medium) की benchmark लागत कम है: $0.082 vs $0.391. MiMo-V2.5 (medium) तेज है: 32.20s vs 100.31s, pass rates 53.0% vs 69.7%.

अनुशंसित मॉडलMiMo-V2.5 (medium)Its score stays close to the best score here (6.5 vs 6.7), while costing about 4.8x less than LongCat 2.0 (low).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक LongCat 2.0 LongCat 2.0 low रिलीज़: 2026-07-20 MiMo-V2.5 MiMo-V2.5 medium रिलीज़: 2026-04-22
स्कोर 6.7 6.5
रैंक #96 #107
विश्वसनीयता 9.6 10.0
संगति 8.9 7.9
सही परीक्षण
प्रति प्रयास पास दर 53.0% 69.7%
अस्थिर टेस्ट 3 6
कुल रन 66 66
प्रति परिणाम लागत 3.910 3.124
कुल लागत $0.391 $0.082
इनपुट कीमत $0.300 / 1M $0.140 / 1M
आउटपुट कीमत $1.200 / 1M $0.280 / 1M
कुल इनपुट टोकन 90,909 105,447
आउटपुट टोकन 5,679 7,120
रीजनिंग टोकन 297,369 230,682
प्रतिक्रिया समय (औसत) 100.31s 32.20s
प्रतिक्रिया समय (अधिकतम) 560.39s 162.44s
प्रतिक्रिया समय (कुल) 2206.82s 708.46s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#96 LongCat 2.0

low
लागत
$0.024
समय
428.0s
टोकन
19,557 tok

#107 MiMo-V2.5

medium
लागत
$0.002
समय
54.8s
टोकन
5,247 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 6.6 4.6 77.8% 2 479.30s 6,544 461 206,627
MiMo-V2.5 6.2 4.7 66.7% 2 97.14s 7,422 557 81,977

त्वरित तुलना

तुलना जोड़ी बदलें