नेविगेशन
Advertise here

LongCat 2.0 vs Kimi K2.5 (medium)

average score लगभग बराबर है: 6.4 vs 6.4. LongCat 2.0 की benchmark लागत कम है: $0.104 vs $0.603. LongCat 2.0 तेज है: 8.50s vs 125.76s, pass rates 42.0% vs 60.9%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#211
कुल आउटपुट टोकन
17,473
प्रतिक्रिया समय (औसत)
8.50s
कुल लागत
$0.104
रैंक
#205
कुल आउटपुट टोकन
241,096
प्रतिक्रिया समय (औसत)
125.76s
कुल लागत
$0.603
अनुशंसित मॉडल LongCat 2.0

It has the best score here (6.4), while costing about 5.8x less than Kimi K2.5 (medium).

विस्तृत तुलना

मेट्रिक LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20 Kimi K2.5 Kimi K2.5 medium रिलीज़: 2026-01-27
स्कोर 6.4 6.4
रैंक #211 #205
विश्वसनीयता 10.0 9.6
संगति 9.0 7.1
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 42.0% 60.9%
अस्थिर टेस्ट 3 8
कुल रन 69 69
प्रति परिणाम लागत 1.298 6.085
कुल लागत $0.104 $0.603
इनपुट कीमत $0.300 / 1M $0.450 / 1M
आउटपुट कीमत $1.200 / 1M $2.250 / 1M
कुल इनपुट टोकन 276,199 292,271
आउटपुट टोकन 17,473 55,025
रीजनिंग टोकन 0 186,071
प्रतिक्रिया समय (औसत) 8.50s 125.76s
प्रतिक्रिया समय (अधिकतम) 81.77s 566.79s
प्रतिक्रिया समय (कुल) 195.60s 2137.84s
पैरामीटर 1.6T कुल (48B सक्रिय) 1T कुल (32B सक्रिय)
उपलब्धता मुक्त स्रोत वेट उपलब्ध

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#211 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

#205 MoonshotAI: Kimi K2.5

medium
लागत
$0.030
समय
58.6s
टोकन
8,683 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693

त्वरित तुलना

तुलना जोड़ी बदलें