नेविगेशन
Advertise here

Claude Opus 5 vs LongCat 2.0 (medium)

average score लगभग बराबर है: 7.1 vs 7.2. LongCat 2.0 (medium) की benchmark लागत कम है: $0.593 vs $2.766. Claude Opus 5 तेज है: 10.78s vs 144.88s, pass rates 55.1% vs 59.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#149
कुल आउटपुट टोकन
31,386
प्रतिक्रिया समय (औसत)
10.78s
कुल लागत
$2.766
रैंक
#145
कुल आउटपुट टोकन
422,234
प्रतिक्रिया समय (औसत)
144.88s
कुल लागत
$0.593
अनुशंसित मॉडल LongCat 2.0 (medium)

It has the best score here (7.2), while costing about 4.7x less than Claude Opus 5.

विस्तृत तुलना

मेट्रिक Claude Opus 5 Claude Opus 5 none रिलीज़: 2026-07-25 LongCat 2.0 LongCat 2.0 medium रिलीज़: 2026-07-20
स्कोर 7.1 7.2
रैंक #149 #145
विश्वसनीयता 10.0 10.0
संगति 9.6 9.0
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 55.1% 59.4%
अस्थिर टेस्ट 1 3
कुल रन 69 69
प्रति परिणाम लागत 23.044 4.942
कुल लागत $2.766 $0.593
इनपुट कीमत $5.000 / 1M $0.300 / 1M
आउटपुट कीमत $25.000 / 1M $1.200 / 1M
कुल इनपुट टोकन 396,120 287,669
आउटपुट टोकन 31,386 47,204
रीजनिंग टोकन 0 375,030
प्रतिक्रिया समय (औसत) 10.78s 144.88s
प्रतिक्रिया समय (अधिकतम) 79.61s 939.52s
प्रतिक्रिया समय (कुल) 247.96s 3332.19s
पैरामीटर ~5T कुल (~500B सक्रिय) 1.6T कुल (48B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#149 Claude Opus 5

none
लागत
$0.271
समय
149.3s
टोकन
10,962 tok

#145 LongCat 2.0

medium
लागत
$0.016
समय
285.1s
टोकन
13,057 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 5 5.9 9.7 33.3% 0 5.54s 10,590 2,886 0
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143

त्वरित तुलना

तुलना जोड़ी बदलें