नेविगेशन
AI BENCHY
Advertise here

LongCat 2.0 vs MiMo-V2.5 (medium)

average score लगभग बराबर है: 6.4 vs 6.4. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.104. LongCat 2.0 तेज है: 5.17s vs 46.28s, pass rates 40.9% vs 68.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-04

रैंक
#177
कुल आउटपुट टोकन
9,375
प्रतिक्रिया समय (औसत)
5.17s
कुल लागत
$0.044
रैंक
#178
कुल आउटपुट टोकन
327,048
प्रतिक्रिया समय (औसत)
46.28s
कुल लागत
$0.104
अनुशंसित मॉडल LongCat 2.0

It has the best score here (6.4), while costing about 2.4x less than MiMo-V2.5 (medium).

विस्तृत तुलना

मेट्रिक LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20 MiMo-V2.5 MiMo-V2.5 medium रिलीज़: 2026-04-22
स्कोर 6.4 6.4
रैंक #177 #178
विश्वसनीयता 10.0 10.0
संगति 9.3 7.5
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 40.9% 68.2%
अस्थिर टेस्ट 2 7
कुल रन 66 66
प्रति परिणाम लागत 0.549 3.575
कुल लागत $0.044 $0.104
इनपुट कीमत $0.300 / 1M $0.140 / 1M
आउटपुट कीमत $1.200 / 1M $0.280 / 1M
कुल इनपुट टोकन 108,752 105,456
आउटपुट टोकन 9,375 7,108
रीजनिंग टोकन 0 319,940
प्रतिक्रिया समय (औसत) 5.17s 46.28s
प्रतिक्रिया समय (अधिकतम) 48.38s 316.27s
प्रतिक्रिया समय (कुल) 113.83s 1018.12s
पैरामीटर 1.6T कुल (48B सक्रिय) 310B कुल (15B सक्रिय)
उपलब्धता मुक्त स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#177 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

#178 MiMo-V2.5

medium
लागत
$0.002
समय
54.8s
टोकन
5,247 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
MiMo-V2.5 6.2 4.7 66.7% 2 97.14s 7,422 557 81,977

त्वरित तुलना

तुलना जोड़ी बदलें