नेविगेशन
AI BENCHY
Advertise here

LongCat 2.0 (medium) vs GLM 5.3 (high)

LongCat 2.0 (medium) average score में आगे है: 7.4 vs 7.3. GLM 5.3 (high) की benchmark लागत कम है: $0.403 vs $0.499. GLM 5.3 (high) तेज है: 27.82s vs 143.55s, pass rates 59.1% vs 74.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-20

रैंक
#94
कुल आउटपुट टोकन
390,873
प्रतिक्रिया समय (औसत)
143.55s
कुल लागत
$0.499
रैंक
#99
कुल आउटपुट टोकन
63,667
प्रतिक्रिया समय (औसत)
27.82s
कुल लागत
$0.403
अनुशंसित मॉडल GLM 5.3 (high)

Its score stays close to the best score here (7.3 vs 7.4), while responding about 5.2x faster than LongCat 2.0 (medium).

विस्तृत तुलना

मेट्रिक LongCat 2.0 LongCat 2.0 medium रिलीज़: 2026-07-20 GLM 5.3 GLM 5.3 high रिलीज़: 2026-08-20
स्कोर 7.4 7.3
रैंक #94 #99
विश्वसनीयता 10.0 10.0
संगति 9.3 7.5
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 59.1% 74.2%
अस्थिर टेस्ट 2 7
कुल रन 66 66
प्रति परिणाम लागत 4.153 3.099
कुल लागत $0.499 $0.403
इनपुट कीमत $0.300 / 1M $1.400 / 1M
आउटपुट कीमत $1.200 / 1M $4.400 / 1M
कुल इनपुट टोकन 97,324 87,601
आउटपुट टोकन 44,383 6,006
रीजनिंग टोकन 346,490 57,661
प्रतिक्रिया समय (औसत) 143.55s 27.82s
प्रतिक्रिया समय (अधिकतम) 939.52s 159.91s
प्रतिक्रिया समय (कुल) 3158.11s 612.06s
पैरामीटर 1.6T कुल (48B सक्रिय) 744B कुल (40B सक्रिय)
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#94 LongCat 2.0

medium
लागत
$0.016
समय
285.1s
टोकन
13,057 tok

#99 GLM 5.3

high
लागत
$0.085
समय
362.5s
टोकन
19,310 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143
GLM 5.3 6.6 5.0 66.7% 2 18.89s 7,317 473 8,190

त्वरित तुलना

तुलना जोड़ी बदलें