नेविगेशन
Advertise here

LongCat 2.0 vs GLM 5.3 FlashX (low)

LongCat 2.0 average score में आगे है: 6.4 vs 6.3. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.090. LongCat 2.0 तेज है: 5.17s vs 6.58s, pass rates 40.9% vs 65.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-21

तुलना किए गए मॉडल

रैंक
#195
कुल आउटपुट टोकन
9,375
प्रतिक्रिया समय (औसत)
5.17s
कुल लागत
$0.044
रैंक
#201
कुल आउटपुट टोकन
37,036
प्रतिक्रिया समय (औसत)
6.58s
कुल लागत
$0.090
अनुशंसित मॉडल LongCat 2.0

It has the best score here (6.4), while costing about 2.0x less than GLM 5.3 FlashX (low).

विस्तृत तुलना

मेट्रिक LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20 GLM 5.3 FlashX GLM 5.3 FlashX low रिलीज़: 2026-09-21
स्कोर 6.4 6.3
रैंक #195 #201
विश्वसनीयता 10.0 10.0
संगति 9.3 7.0
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 40.9% 65.2%
अस्थिर टेस्ट 2 8
कुल रन 66 66
प्रति परिणाम लागत 0.549 0.816
कुल लागत $0.044 $0.090
इनपुट कीमत $0.300 / 1M $0.370 / 1M
आउटपुट कीमत $1.200 / 1M $1.250 / 1M
कुल इनपुट टोकन 108,752 117,325
आउटपुट टोकन 9,375 10,494
रीजनिंग टोकन 0 26,542
प्रतिक्रिया समय (औसत) 5.17s 6.58s
प्रतिक्रिया समय (अधिकतम) 48.38s 73.01s
प्रतिक्रिया समय (कुल) 113.83s 144.85s
पैरामीटर 1.6T कुल (48B सक्रिय) 320B कुल (18B सक्रिय)
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#195 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

#201 GLM 5.3 FlashX

low
लागत
$0.002
समय
8.4s
टोकन
1,526 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
GLM 5.3 FlashX 5.5 7.4 44.4% 1 5.45s 7,317 382 4,760

त्वरित तुलना

तुलना जोड़ी बदलें