नेविगेशन
Advertise here

LongCat 2.0 vs GLM 5.3 FlashX (medium)

average score लगभग बराबर है: 6.4 vs 6.4. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.056. GLM 5.3 FlashX (medium) तेज है: 4.32s vs 5.17s, pass rates 40.9% vs 68.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-21

तुलना किए गए मॉडल

रैंक
#195
कुल आउटपुट टोकन
9,375
प्रतिक्रिया समय (औसत)
5.17s
कुल लागत
$0.044
रैंक
#194
कुल आउटपुट टोकन
19,433
प्रतिक्रिया समय (औसत)
4.32s
कुल लागत
$0.056
अनुशंसित मॉडल GLM 5.3 FlashX (medium)

It has the strongest score in this comparison (6.4) and the best overall balance of cost and response time across all 2 models.

विस्तृत तुलना

मेट्रिक LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20 GLM 5.3 FlashX GLM 5.3 FlashX medium रिलीज़: 2026-09-21
स्कोर 6.4 6.4
रैंक #195 #194
विश्वसनीयता 10.0 10.0
संगति 9.3 7.0
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 40.9% 68.2%
अस्थिर टेस्ट 2 8
कुल रन 66 66
प्रति परिणाम लागत 0.549 0.505
कुल लागत $0.044 $0.056
इनपुट कीमत $0.300 / 1M $0.370 / 1M
आउटपुट कीमत $1.200 / 1M $1.250 / 1M
कुल इनपुट टोकन 108,752 84,329
आउटपुट टोकन 9,375 7,717
रीजनिंग टोकन 0 11,716
प्रतिक्रिया समय (औसत) 5.17s 4.32s
प्रतिक्रिया समय (अधिकतम) 48.38s 22.89s
प्रतिक्रिया समय (कुल) 113.83s 95.15s
पैरामीटर 1.6T कुल (48B सक्रिय) 320B कुल (18B सक्रिय)
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#195 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

#194 GLM 5.3 FlashX

medium
लागत
$0.002
समय
8.1s
टोकन
1,480 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
GLM 5.3 FlashX 6.0 4.6 66.7% 2 6.37s 7,317 384 5,562

त्वरित तुलना

तुलना जोड़ी बदलें