नेविगेशन
AI BENCHY
Advertise here

Claude Opus 4.8 (medium) vs GLM 5.3 Flash (max)

average score लगभग बराबर है: 8.8 vs 8.7. GLM 5.3 Flash (max) की benchmark लागत कम है: $0.059 vs $1.983. Claude Opus 4.8 (medium) तेज है: 12.97s vs 52.10s, pass rates 83.3% vs 81.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-26

रैंक
#26
कुल आउटपुट टोकन
51,927
प्रतिक्रिया समय (औसत)
12.97s
कुल लागत
$1.983
रैंक
#29
कुल आउटपुट टोकन
204,340
प्रतिक्रिया समय (औसत)
52.10s
कुल लागत
$0.059
अनुशंसित मॉडल GLM 5.3 Flash (max)

It has the best score here (8.7), while costing about 34.0x less than Claude Opus 4.8 (medium).

विस्तृत तुलना

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 medium रिलीज़: 2026-05-28 GLM 5.3 Flash GLM 5.3 Flash max रिलीज़: 2026-08-26
स्कोर 8.8 8.7
रैंक #26 #29
विश्वसनीयता 10.0 10.0
संगति 9.2 8.9
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 83.3% 81.8%
अस्थिर टेस्ट 2 3
कुल रन 66 66
प्रति परिणाम लागत 11.662 0.365
कुल लागत $1.983 $0.059
इनपुट कीमत $5.000 / 1M $0.075 / 1M
आउटपुट कीमत $25.000 / 1M $0.250 / 1M
कुल इनपुट टोकन 138,448 96,873
आउटपुट टोकन 40,765 7,637
रीजनिंग टोकन 11,162 196,703
प्रतिक्रिया समय (औसत) 12.97s 52.10s
प्रतिक्रिया समय (अधिकतम) 70.54s 333.47s
प्रतिक्रिया समय (कुल) 285.29s 1146.24s
पैरामीटर ~5T कुल (~500B सक्रिय) 320B कुल (18B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#26 Claude Opus 4.8

medium
लागत
$0.057
समय
23.1s
टोकन
2,412 tok

#29 GLM 5.3 Flash

max
लागत
$0.005
समय
296.5s
टोकन
16,250 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
GLM 5.3 Flash 10.0 10.0 100.0% 0 43.37s 7,317 381 23,692

त्वरित तुलना

तुलना जोड़ी बदलें