नेविगेशन
Advertise here

Claude Opus 4.8 (low) vs LongCat 2.0 (medium)

average score लगभग बराबर है: 7.2 vs 7.2. LongCat 2.0 (medium) की benchmark लागत कम है: $0.593 vs $3.787. Claude Opus 4.8 (low) तेज है: 17.13s vs 144.88s, pass rates 78.3% vs 59.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#143
कुल आउटपुट टोकन
69,489
प्रतिक्रिया समय (औसत)
17.13s
कुल लागत
$3.787
रैंक
#145
कुल आउटपुट टोकन
422,234
प्रतिक्रिया समय (औसत)
144.88s
कुल लागत
$0.593
अनुशंसित मॉडल LongCat 2.0 (medium)

It has the best score here (7.2), while costing about 6.4x less than Claude Opus 4.8 (low).

विस्तृत तुलना

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28 LongCat 2.0 LongCat 2.0 medium रिलीज़: 2026-07-20
स्कोर 7.2 7.2
रैंक #143 #145
विश्वसनीयता 10.0 10.0
संगति 8.6 9.0
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 78.3% 59.4%
अस्थिर टेस्ट 4 3
कुल रन 69 69
प्रति परिणाम लागत 23.669 4.942
कुल लागत $3.787 $0.593
इनपुट कीमत $5.000 / 1M $0.300 / 1M
आउटपुट कीमत $25.000 / 1M $1.200 / 1M
कुल इनपुट टोकन 409,947 287,669
आउटपुट टोकन 46,060 47,204
रीजनिंग टोकन 23,429 375,030
प्रतिक्रिया समय (औसत) 17.13s 144.88s
प्रतिक्रिया समय (अधिकतम) 127.97s 939.52s
प्रतिक्रिया समय (कुल) 394.01s 3332.19s
पैरामीटर ~5T कुल (~500B सक्रिय) 1.6T कुल (48B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#143 Claude Opus 4.8

low
लागत
$0.031
समय
14.1s
टोकन
1,345 tok

#145 LongCat 2.0

medium
लागत
$0.016
समय
285.1s
टोकन
13,057 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 6.6 4.6 77.8% 2 7.58s 10,590 3,637 809
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143

त्वरित तुलना

तुलना जोड़ी बदलें