नेविगेशन
AI BENCHY
Advertise here

Claude Sonnet 4.6 vs LongCat 2.0 (medium)

LongCat 2.0 (medium) average score में आगे है: 7.4 vs 7.3. LongCat 2.0 (medium) की benchmark लागत कम है: $0.499 vs $0.661. Claude Sonnet 4.6 तेज है: 7.67s vs 143.55s, pass rates 57.6% vs 59.1%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-03

रैंक
#108
कुल आउटपुट टोकन
19,362
प्रतिक्रिया समय (औसत)
7.67s
कुल लागत
$0.661
रैंक
#104
कुल आउटपुट टोकन
390,873
प्रतिक्रिया समय (औसत)
143.55s
कुल लागत
$0.499
अनुशंसित मॉडल Claude Sonnet 4.6

Its score stays close to the best score here (7.3 vs 7.4), while responding about 18.7x faster than LongCat 2.0 (medium).

विस्तृत तुलना

मेट्रिक Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17 LongCat 2.0 LongCat 2.0 medium रिलीज़: 2026-07-20
स्कोर 7.3 7.4
रैंक #108 #104
विश्वसनीयता 10.0 10.0
संगति 9.7 9.3
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 57.6% 59.1%
अस्थिर टेस्ट 1 2
कुल रन 66 66
प्रति परिणाम लागत 5.503 4.153
कुल लागत $0.661 $0.499
इनपुट कीमत $3.000 / 1M $0.300 / 1M
आउटपुट कीमत $15.000 / 1M $1.200 / 1M
कुल इनपुट टोकन 123,273 97,324
आउटपुट टोकन 19,362 44,383
रीजनिंग टोकन 0 346,490
प्रतिक्रिया समय (औसत) 7.67s 143.55s
प्रतिक्रिया समय (अधिकतम) 51.18s 939.52s
प्रतिक्रिया समय (कुल) 122.78s 3158.11s
पैरामीटर ~1T कुल (~100B सक्रिय) 1.6T कुल (48B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#108 Claude Sonnet 4.6

none
लागत
$0.038
समय
27.3s
टोकन
2,598 tok

#104 LongCat 2.0

medium
लागत
$0.016
समय
285.1s
टोकन
13,057 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143

त्वरित तुलना

तुलना जोड़ी बदलें