नेविगेशन
AI BENCHY
Advertise here

Meituan: LongCat 2.0 vs Xiaomi: MiMo-V2.5

MiMo-V2.5 (medium) average score में आगे है: 6.5 vs 6.3. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.082. LongCat 2.0 तेज है: 5.18s vs 32.20s, pass rates 36.4% vs 69.7%.

अनुशंसित मॉडलLongCat 2.0Its score stays close to the best score here (6.3 vs 6.5), while costing about 1.9x less than MiMo-V2.5 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20 MiMo-V2.5 MiMo-V2.5 medium रिलीज़: 2026-04-22
स्कोर 6.3 6.5
रैंक #117 #107
विश्वसनीयता 10.0 10.0
संगति 9.3 7.9
सही परीक्षण
प्रति प्रयास पास दर 36.4% 69.7%
अस्थिर टेस्ट 2 6
कुल रन 66 66
प्रति परिणाम लागत 0.627 3.124
कुल लागत $0.044 $0.082
इनपुट कीमत $0.300 / 1M $0.140 / 1M
आउटपुट कीमत $1.200 / 1M $0.280 / 1M
कुल इनपुट टोकन 108,743 105,447
आउटपुट टोकन 9,372 7,120
रीजनिंग टोकन 0 230,682
प्रतिक्रिया समय (औसत) 5.18s 32.20s
प्रतिक्रिया समय (अधिकतम) 48.38s 162.44s
प्रतिक्रिया समय (कुल) 113.95s 708.46s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#117 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

#107 MiMo-V2.5

medium
लागत
$0.002
समय
54.8s
टोकन
5,247 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
MiMo-V2.5 6.2 4.7 66.7% 2 97.14s 7,422 557 81,977

त्वरित तुलना

तुलना जोड़ी बदलें